Hugging Face daily papers·11d agoAn RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning#policy-distillation#on-policy-distillation#reinforcement-learning