Hugging Face daily papers·11d agoWhy Deterministic PRM Guidance Underperforms in Discrete Diffusion Reasoning#discrete-diffusion#process-reward-model#outcome-reward-model