arXiv cs.CR·2d agoJust Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures#alignment#evals#benchmarkAI safety & security 2 sources
arXiv cs.CR·3d agoSafety-Aware Zero Trust Enforcement for IoT and Cyber-Physical Systems#zero-trust#iot#cyber-physicalResearch
arXiv cs.CR·3d agoControl-Token Injection Suppresses Chain-of-Thought and Defeats Reasoning-Based Oversight in Tool-Using Agents#chain-of-thought#safety#token-injectionAI research
arXiv cs.CR·5d agoSSP-Bench: A Hybrid Data Generation Framework for Safety, Security, and Privacy Evaluation#llm#benchmark#safetyAI safety & security
Import AI·5d agoImport AI 473: The US's superintelligence strategy; human brain in a mouse skull; and machine hermeneutics#ai-policy#geopolitics#rand 15 min
arXiv cs.CR·9d agoWorst-Case Hidden-Vehicle Trajectory Search in Spatiotemporal Occlusion Regions#autonomous-driving#minimax-search#occlusionAI safety & security
arXiv cs.CR·10d agoCollective Loss of Control in LLM Agent Systems: An Epidemic Account of Mutation, Contagion, and Recovery#benchmark#contagion#dockerAI safety & security
arXiv cs.AI / cs.LG / cs.CL·12d agoInoculation Midtraining with Learned Neologisms#alignment#fine-tuning#llmAI safety & security
Hugging Face daily papers·18d agoReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs#benchmark#embodied-ai#evaluation
Hugging Face daily papers·29d agoRecognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions#abstention#alignment#interpretability
Help Net Security·Aug 20, 2026OpenAI previews privacy-focused system for detecting AI misuse#enterprise#misuse-detection#openai 2 min