arXiv cs.AI / cs.LG / cs.CL·9d agoQuantifying Overclaiming Propensity in Frontier LLM Agents#agent-reliability#benchmark#coding-agentsAI safety & security