arXiv cs.AI / cs.LG / cs.CL·8d agoAvailable Guardrails: Certifying Selective Prediction across ML Systems#selective-prediction#guardrails#certificationAI research
arXiv cs.AI / cs.LG / cs.CL·9d agoUnifying Models of Intergroup Hostility in Online Discourse#computational-social-science#content-moderation#hostilityAI research
arXiv cs.AI / cs.LG / cs.CL·17d agoCan Foundation Models Moderate Online Content? Evaluating Instruction- vs. Example-Driven Policy Operationalization#benchmark#bluesky#content-moderationAI research1
Ars Technica · AI·18d ago“This is the AI men actually use”: Meta ads pushed apps nudifying real teens#ai-misuse#content-moderation#csam 2 min
WIRED · Security·18d agoMeta Failed to Catch Hundreds of AI Child Abuse Ads. Some Included Images of Real Kids#ai-generated-content#content-moderation#csam 10 min
arXiv cs.CR·19d ago"Shut Up and Let Me Enjoy My Otome": Understanding and Measuring the Toxicity in Otome Game Communities#content-moderation#coordination-analysis#llm-detectorsResearch
CyberScoop·Aug 27, 2026Former sexual abuse victims say Grok used their images, videos to train deepfake capabilities#class-action#content-moderation#csam 5 min
404 Media·Aug 17, 2026Pornhub's Parent Company to Pay $120 Million to Settle Child Sexual Abuse Lawsuits#aylo#content-moderation#csam 3 min