arXiv cs.AI / cs.LG / cs.CL·6d agoLESSER: Post-Training Data Selection with Output-Layer Gradients#llm#post-training#data-selectionAI research1
arXiv cs.AI / cs.LG / cs.CL·7d agoFrom Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillation#distillation#on-policy#qwen3AI research3