arXiv cs.CR·3d agoThe Tokens Remember: When Tokenization Bypasses Knowledge Editing and Unlearning#unlearning#knowledge-editing#tokenizationAI safety & security
arXiv cs.AI / cs.LG / cs.CL·8d agoA Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal#sandbagging#unlearning#deceptionAI safety & security
Hugging Face daily papers·9d agoA Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal#alignment#deception#evals
arXiv cs.CR·22d agoForgetting Without Restarting: Execution-State Unlearning for Stateful LLM Agents#agent-security#kv-cache#llm-agentsAI safety & security1
arXiv cs.CR·23d agoClient-Side Probing of Deleted Ridge Statistics in Federated Unlearning#federated-learning#machine-learning#membership-inferenceResearch1