arXiv cs.AI / cs.LG / cs.CL·8d ago$λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource#grpo#flow-matching#reinforcement-learningAI research