Hacker News · security·18h agoUnderstanding the Impact of LLM Watermarking on AI Agent Behavior#watermarking#synthid-text#anthropic 15 min
The Decoder·1d agoMeta's Muse agent gives every user a full cloud computer running Ubuntu Linux#ai-agents#app-store#cloud-computer 2 sources 2 min
The Register · Security·1d agoSalesforce Agentforce vulns allowed 0-click CRM data theft, anonymous phishing#salesforce#agentforce#prompt-injection 6 sources 5 min
ESET WeLiveSecurity·1d agoIs that vibe coded app safe? 5 checks before you download#vibe-coding#prompt-injection#mobile-security 6 min
The Hacker News·2d agoAnthropic and OpenAI Models Still Attempt Restricted Actions in Safety Tests#ai-models#ai-safety#alignment 12 sources 4 min
Help Net Security·2d agoStop watching what AI agents say and start watching what they do#ai-agents#guardrails#prompt-injection 5 min
arXiv cs.CR·2d agoInstrumental Monitor Evasion Emerges Under Ordinary Task Pressure#ai-safety#evasionbench#monitor-evasionAI safety & security
The Verge · AI·2d ago highMuse will apparently let you download its entire filesystem#meta#muse#prompt-injection 3 min
arXiv cs.CR·2d agoENDOPROMPT: Victim-Side Pseudo-References for Utility Degradation#prompt-injection#endoprompt#llm-securityAI safety & security
arXiv cs.CR·2d agoPrefilling the Reasoning Channel: Output-Prefix Attacks on Reasoning LLMs#prompt-injection#jailbreak#reasoning-modelsAI safety & security
Hacker News · security·2d agoJev Is Not a Language Model, but It Breaks Like One#jev#prompt-injection#typesafe-ai 4 sources 8 min
arXiv cs.CR·2d agoOllamaDrama: Designing and Deploying a Honeypot to Measure Attacks on Exposed LLM Infrastructure#ollama#honeypot#llmResearch in the wild
Dark Reading·2d agoAttackers Manipulate AI Chatbots in Mass Disinformation, Phishing Campaign#ai-security#chatgpt#disinformation 3 sources in the wild
Dark Reading·2d agoPrompt-Injection Bug Hits $4B Agentic AI App 'Manus'#manus#prompt-injection#agentic-ai
Hugging Face daily papers·2d agoJust Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures#ai-safety#alignment#jailbreak 2 sources
arXiv cs.CR·2d agoThrough Human Eyes and Machine Eyes: Understanding View Mismatch in Video See-Through Extended Reality#extended-reality#meta-quest#prompt-injectionAI safety & security
arXiv cs.CR·3d ago criticalClaimMirage: When Self-Claims in Domain Names Change LLM Threat Judgments#ai#domain-name#llmAI safety & security1
CERT/CC Vulnerability Notes·3d ago highVU#754548: Cinnamon's kotaemon contains improper authorization checks in Kotaemon multi‑user chat handlers#kotaemon#cinnamon#idorCVE-2026-86867 3 min
Cyber Security News·3d agoChatGPT Computer History Feature Creates New Attack Surface for macOS Infostealers#ai-safety#chatgpt#infostealer 2 sources 4 min
Help Net Security·4d agoPrismor: Open-source runtime control plane for AI agents#prismor#prismorsec#ai-agents 2 min
Infosecurity Magazine·4d agoAI Drives Surge in Bot and API Threats#akamai#api-security#bot-traffic 2 sources 2 min
Cyber Security News·4d agoContext Bombs Trick Autonomous Qwen AI Agents Into Stopping Cyberattacks#qwen#prompt-injection#context-bomb 3 min
GBHackers·5d agoMeta’s Muse AI 0-Day Lets Hackers Hijack Dictation Traffic and Inject Malicious Prompts#meta#muse#prompt-injection 3 min