Security Affairs·5h agoOpenAI Agents Accessed US Government Websites Without Authorization#openai#ai-agents#misalignment 6 sources 3 min
GBHackers·8h ago highOpenAI Says Misaligned AI Agents Hacked Hugging Face and Bypassed Security Controls#openai#hugging-face#ai-agents 2 sources in the wild 3 min
The Decoder·14h ago highOpenAI pauses its "most capable models" after agents exploit loopholes and leak data#openai#ai-safety#ai-agents 2 sources in the wild 5 min1
BleepingComputer·18h agoOpenAI's AI agents accidentally uploaded user-provided images to third-party sites#openai#ai-agents#data-leak 2 min
The Verge · AI·1d ago highOpenAI agents hacked an Australian government website in search for data#openai#ai-agents#misalignment 22 sources in the wild 4 min
Risky Business News·3d agoSrsly Risky Biz: Bring On the AI Lawsuits#ai-liability#ai-policy#ai-agents in the wild 10 min
SecurityWeek·3d agoA Look at AI Doomsday Scenarios That Researchers Say Could Put Humanity at Risk#ai-risk#ai-safety#anthropic 5 min
Dark Reading·4d agoAmid Ongoing Rogue Incidents, Debate Over AI Safety Gets Real#ai-safety#misalignment#ai-risk
SecurityWeek·5d agoGoogle Confirms Gemini AI Breached Three Firms#agentic-ai#ai-safety#capture-the-flag 6 sources 4 min
arXiv cs.AI / cs.LG / cs.CL·5d agoExactness at Inference: A Representational Criterion for Out-of-Distribution Generalization#adversarial-delegation#ai-agents#misalignmentResearch 2 sources
Dark Reading·5d agoRogue Behavior: OpenAI Reveals More Model Misalignment Incidents#openai#misalignment#ai-safety
Risky Business News·6d agoRisky Bulletin: Gemini hacked three companies too#gemini#google#sandbox-escape 15 min1
GBHackers·9d agoOpenAI Reveals AI Models Concealing Mistakes, Using Exposed API Keys and Sharing Files#agentic-ai#api-key-leak#misalignment 3 min1
Simon Willison·9d agoSelf-generated prompt injections in compaction summaries#agents#alignment#compactionAI safety & security1
TechCrunch · AI·9d agoOpenAI caught its models leaving notes to successors to hide bad behavior#ai-safety#alignment#compaction 5 min
Cyber Security News·9d agoOpenAI Models Searched for Leaked API Keys and Uploaded Files Without Permission#agentic-ai#ai-safety#data-exfiltration 4 min1
CSO Online·9d agoOpenAI admits six new misalignment incidents under new reporting framework#agents#ai-safety#misalignment 4 min1
SecurityWeek·9d agoOpenAI Says Its Models Searched GitHub for Leaked API Keys During Training#agents#ai-safety#api-keys 3 min1
The Decoder·9d agoAn OpenAI model kept slipping prompt injections into its own notes, and researchers still aren't sure why#agent-security#alignment#astra 4 min
MarkTechPost·9d agoOpenAI Releases a Model Misalignment Disclosure Framework With 3 Review Tracks and 6 Incident Reports From RL Training#ai-safety#disclosure-framework#gpt-5.6-sol 5 min1
Latent Space·9d ago[AINews] Reality Checks on AI News (Yegge shuts down Gas Town, Databricks’ +60% Astra cost)#ai-news#coding-agents#databricks 15 min1
OpenAI News·10d agoOur framework for reporting model misalignment#ai-safety#alignment#disclosure-framework 9 min2
arXiv cs.AI / cs.LG / cs.CL·12d agoInoculation Midtraining with Learned Neologisms#alignment#fine-tuning#llmAI safety & security
Hacker News · security·14d agoWhy are AI agents lying, cheating and coordinating?#ai-agents#ai-safety#alignment 13 min