arXiv cs.AI / cs.LG / cs.CL·16d agoAdamX: Cosine similarity meets gradient descent#adamx#deep-learning#gradient-descentAI research
arXiv cs.AI / cs.LG / cs.CL·18d agoSilver Rate Is (Almost) Optimal for Gradient Descent Acceleration#acceleration#convergence-rates#convex-optimizationAI research
arXiv cs.AI / cs.LG / cs.CL·19d agoA Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient Descent with Weight Decay#generalization#gradient-descent#grokkingAI research