Hugging Face daily papers·9d agoCalibrating Teacher--Student Discrepancy for On-Policy Distillation#distillation#knowledge-distillation#on-policy-distillation
arXiv cs.AI / cs.LG / cs.CL·9d agoRetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning#distillation#llm-agents#multi-turn-agentsAI research
arXiv cs.AI / cs.LG / cs.CL·9d agoDon't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL#grpo#llm-agents#qwen3AI research
arXiv cs.AI / cs.LG / cs.CL·11d agoCoupled Calibration and Learning: Mitigating Teacher Bias in LLM Distillation without Target-Domain Reward Feedback#covariate-shift#distillation#knowledge-transferAI research1
MarkTechPost·12d agoSakana AI Researchers Introduce PC-ALM, a Layer-Local Alternative to Backpropagation That Trains 1000-Layer Networks#backpropagation#deep-learning#jax 4 min2
Hugging Face daily papers·17d agoNegative Self-Distillation: Learning to Reason by Avoiding Flaws#distillation#llm#reasoning1
Hugging Face daily papers·20d agoKalman Delta Networks: Uncertainty-aware Associative Memory#associative-memory#kalman-filter#language-models
Hugging Face Blog·Aug 25, 2026Granite 4.2 LLMs: How They're Built#granite-4.2#hugging-face#ibmModel release