arXiv cs.AI / cs.LG / cs.CL·3d agoAn Open Pipeline and Dashboard for Systemic-Risk Evidence under the EU AI Act's Code of Practice#eu-ai-act#systemic-risk#ai-evalsAI safety & security
Hacker News · security·8d agoGoogle's Gemini AI hacked three companies in security test#agentic-ai#agent-security#ai-evals in the wild
arXiv cs.CR·23d agoRethinking Indirect Prompt Injection as a Test-Time Search Problem#adversarial-attacks#agentic-ai#ai-evalsAI safety & security