arXiv cs.AI / cs.LG / cs.CL·2d agoAnchored Extra-Proximal Methods: Optimal Higher-Order Methods for Monotone Inclusion Problems#optimization#monotone-inclusion#proximal-methodsAI research1
arXiv cs.AI / cs.LG / cs.CL·3d agoMinimal-Norm Univariate Two-Layer ReLU Classification: Exact Solutions and Global Optimality with Skip Connections#relu#optimization#skip-connectionsAI research
Hugging Face Blog·5d agoPruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem#llm#pruning#model-compressionAI research
arXiv cs.AI / cs.LG / cs.CL·9d agoLarge Language Models as Falsifiers for Cyber-Physical Systems#arch-comp#cyber-physical-systems#falsificationAI research
arXiv cs.AI / cs.LG / cs.CL·9d agoNear-Optimal Pure Single-Loop Extragradient Method for Strongly Convex--Strongly Concave Minimax Optimization#convergence-guarantees#convex-optimization#extragradientAI research
arXiv cs.AI / cs.LG / cs.CL·11d agoBridging the Gap Between Homogeneous and Heterogeneous Asynchronous Optimization Is Surprisingly Difficult#asynchronous-training#distributed-training#lower-boundsAI research
arXiv cs.AI / cs.LG / cs.CL·11d agoFlashVector: Agent for Hierarchical Model Serving Stack Optimization#ai-agents#gpu-kernels#inferenceAI research1
Hugging Face daily papers·15d agoDrift-Constrained Optimization: Only Direction Matters in Fine-Tuning Instruct Models#fine-tuning#instruction-tuning#optimization
arXiv cs.AI / cs.LG / cs.CL·15d agoBenign Loss Landscapes Can Coexist with Worst-Case Hardness#computational-hardness#deep-learning-theory#learning-theoryAI research
arXiv cs.AI / cs.LG / cs.CL·15d agoQuantile-based Loss Filtering for Outlier-Robust Stochastic Gradient Descent#convergence#optimization#outlier-robustnessAI research
arXiv cs.AI / cs.LG / cs.CL·17d agoNonmaximal sums of maximally monotone operators under Rockafellar's constraint qualification#convex-analysis#mathematics#monotone-operatorsAI research
arXiv cs.AI / cs.LG / cs.CL·18d agoWhen Does Scale-Invariant Optimization Become Unstable? An Exact Schedule Law with Weight Decay#deep-learning-theory#learning-rate-schedules#normalizationAI research
arXiv cs.AI / cs.LG / cs.CL·19d agoA Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient Descent with Weight Decay#generalization#gradient-descent#grokkingAI research
Hugging Face Blog·Aug 20, 2026Up to 3.2x Faster Inference with LFM2.5-DSpark#hugging-face#inference#lfm2.5-dsparkAI tools & infra