arXiv cs.AI / cs.LG / cs.CL·15h agoRounding in Preconditioner Space: Redesigning 4-bit AdamW Optimizer-State Quantization#adamw#quantization#optimizer-statesAI research
arXiv cs.AI / cs.LG / cs.CL·7d agoTACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning#taco#optimizer#llm-fine-tuningAI research
arXiv cs.AI / cs.LG / cs.CL·10d agoMeqMuon: Matrix-Equilibrating Muon for LLM Pretraining#llm#pretraining#optimizerAI research
Hugging Face daily papers·11d agoTraining and Inference Dynamics of PLDR-LLMs: Row-Map Collapse, Renormalization, and Predictive Reduction#pldr-llm#training-dynamics#inference