arXiv cs.AI / cs.LG / cs.CL·9d agoHarm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations#alignment#bias#evaluationAI safety & security
arXiv cs.AI / cs.LG / cs.CL·11d agoVerifiable Social Reasoning for LLM Assistants#benchmarks#bias#llm-evaluationAI research
arXiv cs.AI / cs.LG / cs.CL·12d agoBefore You Poll with LLMs: A Deliberative Diagnostic Framework#bias#deliberation#llm-evaluationAI research
Latent Space·19d agoThe Frontier AEO Tracker: What Astra Chooses (and every other frontier model, and what you can do about it)#aeo#benchmark#bias 3 min1