Schneier on Security·3d agoResearch on Models Engaging in Genie-Like Behavior#ai-safety#self-jailbreaking#jailbreakAI safety & security
arXiv cs.AI / cs.LG / cs.CL·12d agoCorrupt Plans, Clean Traces: Evading Chain-of-Thought Monitoring with Plan Injection#ai-safety#chain-of-thought-monitoring#deceptionAI safety & security