arXiv cs.AI / cs.LG / cs.CL·9d agoQuantifying Overclaiming Propensity in Frontier LLM Agents#agent-reliability#benchmark#coding-agentsAI safety & security
Hugging Face daily papers·16d agoRoot-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures#agent-reliability#benchmark#continual-search1