arXiv cs.AI / cs.LG / cs.CL·7d agoTACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning#taco#optimizer#llm-fine-tuningAI research
arXiv cs.AI / cs.LG / cs.CL·7d agoMuon meets Tamed Langevin: Momentum Preconditioning beyond Convex and gradient-Lipschitz Potentials#langevin-dynamics#sampling#momentumAI research
arXiv cs.AI / cs.LG / cs.CL·10d agoMeqMuon: Matrix-Equilibrating Muon for LLM Pretraining#llm#pretraining#optimizerAI research