arXiv cs.AI / cs.LG / cs.CL·5d agoCritical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use#reinforcement-learning#tool-use#multi-turnAI research