Hugging Face Blog·5d agoHow UK AISI and EvalEval Are Making Benchmark Results Reproducible#uk-aisi#evaleval#benchmarksAI research
Hugging Face daily papers·9d agoGricea: An Open Science Platform for Conversational AI Research#conversational-ai#human-computer-interaction#open-science
MarkTechPost·10d agoStanford Researchers Release Paper2Agent: Turning Research Papers Into AI Agents That Reproduce Results and Run on New Data#agents#alphagenome#claude-code 5 min1
arXiv cs.AI / cs.LG / cs.CL·11d agoOPEN-1B: A Fully Auditable Training Run#auditing#floating-point#model-releaseAI research1
arXiv cs.CR·15d agoForging Tree-Ring: Reproducing and Instrumenting Black-Box Semantic Watermark Forgery#black-box#diffusion-models#forgeryResearch
arXiv cs.AI / cs.LG / cs.CL·17d agoIdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications#benchmark#code-agents#ideaambigAI research2
Hugging Face daily papers·18d agoIdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications#benchmark#coding-agents#llm-evaluation
Hugging Face daily papers·20d agoScores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents#ai-agents#auditing#evaluation
Hugging Face Blog·Aug 13, 2026What We Learned by Reproducing 2,200 papers from ICML#hugging-face#icml#machine-learningAI research1