Latent Space·2d agoJev: System One models for Prod, not God — with Diogo Almeida, CEO, TypeSafe AI#jev#typesafe#rlcd 4 sources 15 min
MarkTechPost·4d agoNokia Open-Sources AnyJev: A Training-Free Layer That Turns Any Open LLM Into a Calibrated Decision Model#calibration#decision-model#huggingface 4 min
Hugging Face daily papers·5d agoCalibration as a First-Class Criterion in LLM Evaluation#calibration#llm-evaluation#benchmarks
arXiv cs.AI / cs.LG / cs.CL·5d agoPinocchio: Fast Uncertainty Estimates for Black-Box Language Models#ai-model#black-box#calibrationAI research
Hacker News · security·7d agoLaya the open source version of Jev#calibration#hugging-face#mmbert 10 min1
arXiv cs.AI / cs.LG / cs.CL·8d agoAvailable Guardrails: Certifying Selective Prediction across ML Systems#selective-prediction#guardrails#certificationAI research
arXiv cs.AI / cs.LG / cs.CL·8d agoMoral Entropy: Auditing Bias and Uncertainty in Moral Judgment#computational-ethics#moral-entropy#bayesianAI research
arXiv cs.AI / cs.LG / cs.CL·8d agoWhen Should a Failing Robot Ask? Initiating Corrective Human-Robot Dialogue from Audited Sensor Evidence#vision-language-models#human-robot#prompt-sensitivityAI research
Hugging Face trending models·9d agoconvaiinnovations/laya — new model trending #30 on Hugging Face#calibration#email-triage#hugging-faceModel release 6 min
arXiv cs.AI / cs.LG / cs.CL·9d agoCalibrated RF-Fingerprinting Under Interference With Heterogeneous Transmission Protocols#5g#calibration#cnnAI research
Hacker News · AI·9d agoLLM Classification Is Feature Engineering#calibration#classification#feature-engineeringAI research 15 min1
arXiv cs.AI / cs.LG / cs.CL·11d agoWhen Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control#abstention#calibration#hallucinationAI research1
arXiv cs.AI / cs.LG / cs.CL·11d agoENCP: Episode-Normalized Conformal Prediction for Vision-and-Language Navigation#calibration#conformal-prediction#embodied-aiAI research
arXiv cs.AI / cs.LG / cs.CL·11d agoBridging the Confidence Gap: Temperature Scaling for Calibrating Test-Time Prompt Tuning#calibration#temperature-scaling#test-time-prompt-tuningAI research1
Hugging Face daily papers·12d agoConfidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents#agents#calibration#confidence-estimation
arXiv cs.AI / cs.LG / cs.CL·15d agoA Ranking Approach for Measuring Calibration#calibration#ece#evaluationAI research1
arXiv cs.AI / cs.LG / cs.CL·16d agoDomain-Specific Hallucination Detection in Large Language Models#calibration#deberta-v3#dpoAI research1
arXiv cs.AI / cs.LG / cs.CL·16d agoTarget leakage, not model class, explains reported accuracy in survey-based cardiovascular screening: a leakage-tiered audit of glass-box and tabular foundation models#calibration#fairness#glass-boxAI research1
Hugging Face daily papers·17d agoCompetence-Gated Pooling of Language Models and Priors for Event Forecasting#abstention#brier-score#calibration1
arXiv cs.AI / cs.LG / cs.CL·19d agoBag of Tricks or Bag of Myths? Reducing Modeling Complexity with Task Knowledge in Explainable Suicide Risk Assessment#audit#calibration#clinical-nlpAI research
Hugging Face daily papers·21d agoTrain Smarter, Not Harder: Switching Signal-Guided Training in Active Learning#active-learning#calibration#fine-tuning
Hugging Face daily papers·22d agoMLLMs Hallucinate when Information Distribution Drifts in Synergy Heads#attention-heads#calibration#hallucination