arXiv cs.AI / cs.LG / cs.CL·2d agoPoEM: Predicting RL Outcomes from Existing Policies#poem#reinforcement-learning#reward-modelsAI research
Hugging Face daily papers·5d agoJEV-as-a-Judge: Accept When Confident, Escalate When Unsure#llm-as-a-judge#evaluation#reward-models
Hugging Face daily papers·17d agoBeyond Solver Verdicts: Generative Reward Models for Autoformalization#autoformalization#llm-evaluation#neurosymbolic1
arXiv cs.AI / cs.LG / cs.CL·22d agoSame Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models#benchmark#paraphrase-invariance#reward-modelsAI research1