arXiv cs.AI / cs.LG / cs.CL·3d agoWhen and Where to Trust the Teacher: Unifying On-Policy Distillation and GRPO through Entropy-Calibrated Credit Assignment#grpo#on-policy-distillation#reinforcement-learningAI research
Hugging Face daily papers·5d agoPACT: From Credit Assignment to Critic Alignment#reinforcement-learning#llm-post-training#actor-critic