arXiv cs.AI / cs.LG / cs.CL·1d agoValidity Without Ground Truth: What Stated-Preference Economics Offers the Evaluation of Language Models#llm-evaluation#stated-preference#validityAI research1
arXiv cs.AI / cs.LG / cs.CL·2d agoAgreement Is Not Validity: Cross-Model LLM Consensus in Diagnosing Student Failure Modes in K-12 Math Tutoring Dialogue#llm-evaluation#learning-analytics#inter-rater-agreementAI research1