arXiv cs.AI / cs.LG / cs.CL·2d agoExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds#explorationbench#benchmark#scientific-discoveryAI research 2 sources
Hugging Face daily papers·5d agoCalibration as a First-Class Criterion in LLM Evaluation#calibration#llm-evaluation#benchmarks
arXiv cs.AI / cs.LG / cs.CL·9d agoMTVA-Bench: Evaluating the Language Model Inside Cascaded Voice Agents#asr#benchmark#llm-evaluationAI research
Hacker News · AI·10d agoHarnessTax: How Much Does the Harness Matter for Coding Agents?#agent-scaffolding#benchmark#coding-agentsAI research
arXiv cs.AI / cs.LG / cs.CL·10d agoMonitoring and Discovering Reward Hacking with Internal Representations during LLM Evaluations#alignment#frontier-models#interpretabilityAI safety & security1
arXiv cs.AI / cs.LG / cs.CL·10d agoHow Much is a Human Right Worth? ECtHR-NPD: A Benchmark for Predicting Non-Pecuniary Damage Awards#benchmark#echr#human-rightsAI research
arXiv cs.AI / cs.LG / cs.CL·10d agoStructured Claim-Level Discourse Representations for Dense Health Narratives#annotation#claim-detection#discourse-analysisAI research
arXiv cs.AI / cs.LG / cs.CL·11d agoVerifiable Social Reasoning for LLM Assistants#benchmarks#bias#llm-evaluationAI research
Hacker News · AI·12d agoGPT-5.6 Luna vs. GPT-6 Astra: Is a $1.20 Model Good Enough for Code Review?#benchmark#code-review#gpt-5.6-luna 9 min
arXiv cs.AI / cs.LG / cs.CL·12d agoBefore You Poll with LLMs: A Deliberative Diagnostic Framework#bias#deliberation#llm-evaluationAI research
Help Net Security·13d agoAWS puts AI vulnerability detection to the test, and false positives pile up#ai-benchmark#aws#cwe 4 min
arXiv cs.AI / cs.LG / cs.CL·15d agoAnchoring Clinical Events in Time: UID-Preserving Multimodal Reconstruction and Source-Grounded Adjudication#clinical-nlp#ehr#llm-evaluationAI research1
Hugging Face daily papers·17d agoBeyond Solver Verdicts: Generative Reward Models for Autoformalization#autoformalization#llm-evaluation#neurosymbolic1
Hugging Face daily papers·17d agoBenchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation#benchmarks#datasets#evaluation
arXiv cs.AI / cs.LG / cs.CL·17d agoIdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications#benchmark#code-agents#ideaambigAI research2
Hugging Face daily papers·18d agoRESCUE-BENCH: Towards Relation-Aware Multi-Party Emotional Support Conversation Systems#benchmark#emotional-support#llm-evaluation
Hugging Face daily papers·18d agoIdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications#benchmark#coding-agents#llm-evaluation
Hugging Face daily papers·18d agoMetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes#agents#benchmark#fine-tuning1
arXiv cs.AI / cs.LG / cs.CL·18d agoPerformance of Clinical AI System and Physicians and Frontier Language Models in primary care diagnostics#benchmark#clinical-ai#diagnosticsAI research
arXiv cs.AI / cs.LG / cs.CL·19d agoxDailyBench: Benchmarking LLMs on Professional Consultation for Real-Life Problems#agentic-settings#benchmark#frontier-modelsAI research
arXiv cs.AI / cs.LG / cs.CL·22d agoWearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data#benchmark#health-ai#llm-evaluationAI research
arXiv cs.AI / cs.LG / cs.CL·22d agoMolecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models#benchmark-contamination#llm-evaluation#memorizationAI research1
Hugging Face daily papers·23d agoWearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data#benchmark#health-reasoning#llm-evaluation
Hugging Face daily papers·24d agoWhat Else Needs Fixing? Exploring Cost-Effective Test-Time Compute for Revision Propagation in Artifacts Generated Through Conversation#artifact-revision#benchmark#code-generation