arXiv cs.AI / cs.LG / cs.CL·7d agoTACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning#taco#optimizer#llm-fine-tuningAI research
arXiv cs.AI / cs.LG / cs.CL·10d agoMeqMuon: Matrix-Equilibrating Muon for LLM Pretraining#llm#pretraining#optimizerAI research