Hugging Face daily papers·4d agoVerifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms#agentic-rl#environment-generation#qwen
Hugging Face daily papers·10d agoRetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning#agentic-rl#alfworld#distillation
Hugging Face daily papers·19d agoMiles v0.1: Production-Level Post-Training#agentic-rl#distributed-training#open-source