arXiv cs.CR·5d agoLoRango: It Takes Two LoRAs to Unlock Hidden Behaviors in Diffusion Models#lora#diffusion-model#text-to-imageAI safety & security
arXiv cs.CR·5d agoOPBackdoor: Opportunistic Backdoors via Alibi-Aligned Reasoning#llm-backdoor#ai-safety#opbackdoorAI safety & security
arXiv cs.CR·9d agoFingerprinting Multimodal Large Language Models#attention#distillation#fingerprintingAI safety & security
SecurityWeek·10d agoAI Agents Can Retrain Own Models Mid-Task, Leaking Secrets and Erasing Refusals#agentic-self-modification#ai-safety#fine-tuning 4 min1
Infosecurity Magazine·Aug 11, 2026OpenAI Pauses Some Development of Astra Model on Security Concerns#ai-safety#astra#development-pauseAI safety & security