arXiv cs.AI / cs.LG / cs.CL·22d agoSame Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models#benchmark#paraphrase-invariance#reward-modelsAI research1