arXiv cs.AI / cs.LG / cs.CL·12d agoK-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations#benchmark#clinical-ai#evaluationAI safety & security
arXiv cs.AI / cs.LG / cs.CL·19d agoBag of Tricks or Bag of Myths? Reducing Modeling Complexity with Task Knowledge in Explainable Suicide Risk Assessment#audit#calibration#clinical-nlpAI research