Hugging Face daily papers·3d agoBeyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents#reinforcement-learning#distillation#agents