Hugging Face daily papers·11d agoRethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening#critic-learning#ppo#preference-optimization
Hugging Face daily papers·27d agoPLC-DPO: Posterior Label Correction in Noisy and Ambiguous Preference Optimization#alignment#dpo#noisy-labels