arXiv cs.CR·1d agoDoes the Unsafe Gradient Survive a Conversation? On the Fragility of Gradient-Based Jailbreak Detection in Multi-Turn Dialogue#jailbreak#gradsafe#multi-turnAI safety & security
arXiv cs.CR·2d agoCan Prompt Anonymity Protect Your Identity From LLM Providers?#prompt-anonymity#re-identification#llm-privacyAI safety & security