Hugging Face daily papers·3d agoBase Models Can Reason By Taking a Cue From Training Data#reasoning#base-models#olmo 2 sources
Hugging Face daily papers·12d agoSelecting Diverse SFT Traces Improves Post-RL Generalization#sft#reinforcement-learning#data-selection