Hugging Face daily papers·4d agoMinimal Witness Reinforcement Learning#reinforcement-learning#minimal-witness#explanations
Hugging Face daily papers·4d agoTRIAGE: Direction-Aware Mismatch Stabilization of Native NVFP4 Reinforcement Learning#nvfp4#quantization#reinforcement-learning1
arXiv cs.AI / cs.LG / cs.CL·6d agoPlanning to Learn#deep-learning#loss-functions#policy-gradientAI research1
arXiv cs.AI / cs.LG / cs.CL·6d agoIDRF: Inverse-Distilled Reward Fine-tuning of Masked Discrete Diffusion Models#discrete-diffusion#reward-fine-tuning#inverse-distillationAI research1