Skip to content
An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning · ZeroHour