Hugging Face daily papers·5d agoPACT: From Credit Assignment to Critic Alignment#reinforcement-learning#llm-post-training#actor-critic
arXiv cs.AI / cs.LG / cs.CL·9d agoCARE-VI: Conservative Adaptive Reliability Estimation for Value Improvement in Off-Policy Actor-Critic Learning#actor-critic#mujoco#off-policyAI research1