arXiv cs.AI / cs.LG / cs.CL·9d agoRetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning#distillation#llm-agents#multi-turn-agentsAI research