arXiv cs.AI / cs.LG / cs.CL·3d agoSharpen Without Search: On-Policy Distillation of Sequence-Level Power Distribution#on-policy-distillation#power-sampling#reasoningAI research 2 sources
Hugging Face daily papers·7d agoPivot-SD: Efficient Self-Distillation for Masked Diffusion Language Models#diffusion-language-models#self-distillation#llada1
Hugging Face daily papers·11d agoWhy Deterministic PRM Guidance Underperforms in Discrete Diffusion Reasoning#discrete-diffusion#process-reward-model#outcome-reward-model