Hugging Face daily papers·3d agoRufus-Air: An Open LLM Post-Training Recipe#post-training#sft#reinforcement-learning
Hugging Face daily papers·5d agoonPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction#onpanda#alignment#annotation 2 sources
Hugging Face daily papers·10d agoDon't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL#actobs#exploration#grpo
Hugging Face daily papers·11d agoScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments#agents#code-repair#model-training2
arXiv cs.AI / cs.LG / cs.CL·17d agoBuilding Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning#data-mixing#multilingual#open-weightsAI research1
Hugging Face daily papers·18d agoBuilding Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning#data-mixing#multilingual#open-weights1
Hugging Face daily papers·19d agoFeyospace-v1: How the Cyber Mercury Seven Trained Frontier Cyber Models#ctf#cyber-agents#cybergym
Hugging Face daily papers·20d agoRevisiting Complete Reasoning Traces for Post-Training#data-efficiency#distillation#llm
MarkTechPost·21d agoUC Berkeley Researchers Release CUA-Lite, an Open Platform Unifying Sandboxes, Data, Evaluation and RL for Computer-Use Agents#computer-use-agents#cua-lite#docker 4 min1