arXiv cs.AI / cs.LG / cs.CL·8d agoA Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal#sandbagging#unlearning#deceptionAI safety & security
Hugging Face daily papers·9d agoA Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal#alignment#deception#evals