Hacker News · security·20h agoUnderstanding the Impact of LLM Watermarking on AI Agent Behavior#watermarking#synthid-text#anthropic 15 min
Ars Technica · Security·9d agoLLMs respond differently to harmful prompts when AI watermarking is used#google#hugging-face#llm-safety 4 min3
arXiv cs.AI / cs.LG / cs.CL·9d agoHarm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations#alignment#bias#evaluationAI safety & security
arXiv cs.AI / cs.LG / cs.CL·9d agoLocal Sparsity Enables Unsupervised LLM Safety Detection#activation-analysis#anomaly-detection#linear-representation-hypothesisAI safety & security
arXiv cs.CR·10d agoSafety Beyond the Interface: Detecting Harm via Latent States in Large Language Models#guardrails#harm-detection#llama-3.1AI safety & security1
arXiv cs.AI / cs.LG / cs.CL·12d agoK-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations#benchmark#clinical-ai#evaluationAI safety & security
arXiv cs.CR·12d agoDivide, Consult, Conquer: Capability Laundering Through Aligned LLMs#capability-laundering#cbrn#frontier-modelsAI safety & security
Hugging Face daily papers·13d agoDecoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration#jailbreak-defense#llama-3#llm-safety
arXiv cs.CR·19d agoStructural Jailbreaks Generalize but Do Not Compound: A cross-provider and multilingual study of Involuntary In-Context Learning#benchmark#gemini#iiclAI safety & security1
Palo Alto Unit 42·29d agoPerturbation Probing: A New Diagnostic for the Fragility of LLM Safety#defense-in-depth#interpretability#llm-safety1