The Decoder·1d agoAnother Google Deepmind researcher quits, says building superintelligent AI soon is "inherently irresponsible"#google-deepmind#ai-safety#superintelligence
The Hacker News·2d agoAnthropic and OpenAI Models Still Attempt Restricted Actions in Safety Tests#ai-models#ai-safety#alignment 12 sources 4 min
The Verge · AI·2d agoWhy can’t we just keep rogue AIs off the internet?#ai-safety#air-gap#ai-agents 5 min
Hugging Face daily papers·2d agoJust Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures#ai-safety#alignment#jailbreak 2 sources
SecurityWeek·3d agoOuterlimit Raises $16 Million to Stop Rogue AI Agents From Causing Harm#agentic-ai#ai-safety#alignment 2 sources 4 min
OpenAI News·3d agoSam Altman’s remarks at the United Nations Security Council#openai#sam-altman#united-nations 2 sources 8 min
Schneier on Security·3d agoResearch on Models Engaging in Genie-Like Behavior#ai-safety#self-jailbreaking#jailbreakAI safety & security
arXiv cs.CR·4d agoFrom Alignment to Access Control: A Framework for GenAI Policy Enforcement#genai#policy-enforcement#access-controlAI safety & security
Malwarebytes Labs·5d agoGemini’s breach of real companies exposes an AI guardrail problem#gemini#google#ai-safetyAI safety & security 6 sources 3 min
OpenAI News·5d agoPriorities and principles for effective third party assessments#openai#ai-safety#third-party-assessment 11 min
Hugging Face daily papers·5d agoonPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction#onpanda#alignment#annotation 2 sources
arXiv cs.AI / cs.LG / cs.CL·5d agoEmergent Collusion in Long-Horizon LLM Agent Interaction#llm-agents#collusion#multi-agentAI safety & security 2 sources
The Decoder·5d agoUN science panel says there is "no assurance humans will keep control" over AI agents#ai-agents#alignment#loss-of-controlAI safety & security 2 sources1
arXiv cs.CR·5d agoOPBackdoor: Opportunistic Backdoors via Alibi-Aligned Reasoning#llm-backdoor#ai-safety#opbackdoorAI safety & security
Hacker News · security·6d agoNot all AI workers think the tech could kill everyone#ai-safety#existential-risk#openai 4 min
TechCrunch · AI·7d agoAI safety conversations have gotten unbelievable#agentic-ai#air-gapped#ai-safety 4 min
TechCrunch · AI·8d agoAnthropic’s first embedded evaluator is … Accenture?#accenture#ai-safety#alignment 2 min
arXiv cs.AI / cs.LG / cs.CL·8d ago$λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource#grpo#flow-matching#reinforcement-learningAI research
arXiv cs.AI / cs.LG / cs.CL·8d agoDiaVLo: Diagnosing Behaviours of Vision-Language Models#vision-language-models#diagnostics#alignmentAI research
Malwarebytes Labs·8d agoDid an AI really try to break free from human control?#ai-safety#alignment#frontier-models 3 min
MIT Technology Review · AI·8d agoCould AI really kill us all? Your questions, answered.#ai-existential-risk#ai-safety#alignment 8 min
Security Affairs·9d agoOpenAI admits its models lie to cover their own mistakes#agentic-ai#agent-security#ai-safety 4 min1