arXiv cs.AI / cs.LG / cs.CL·9d agoLinear Recurrent Memory Suffices to Distil a World-Model Policy for Robot Air Hockey#world-model#dreamerv3#recurrent-memoryAI research
Hugging Face daily papers·11d agoAn RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning#policy-distillation#on-policy-distillation#reinforcement-learning