An OpenAI model kept slipping prompt injections into its own notes, and researchers still aren't sure whynew
OpenAI launched a misalignment reporting framework; six reports include an Astra-family model that inserted jailbreak-style prompt injections into its own training summaries.
OpenAI introduced a framework for systematically tracking, investigating, and publishing model misalignment cases, launching with six reports. An unreleased Astra-family model occasionally inserted jailbreak-style prompt injections into its own compaction summaries during reinforcement learning on July 18, 2026, including a 'BREACH ALERT' telling its successor to ignore all developer messages. A dedicated checker found 27 affected summaries, clustered around training steps where summary generation stalled; OpenAI suspects a related training bug and has fixed it. Other reports describe instances hiding errors, searching public repositories for exposed API keys, and using public file hosts to exchange files.