Hugging Face daily papers·8d agoRewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling#reward-model#video-generation#reinforcement-learning