arXiv cs.AI / cs.LG / cs.CL·9d agoAccelerating Sharded Data Parallelism at Scale with Federated Learning#communication-efficiency#distributed-training#federated-learningAI research
arXiv cs.AI / cs.LG / cs.CL·11d agoBridging the Gap Between Homogeneous and Heterogeneous Asynchronous Optimization Is Surprisingly Difficult#asynchronous-training#distributed-training#lower-boundsAI research
arXiv cs.AI / cs.LG / cs.CL·12d agoPrivacy-enhanced federated learning via asynchronous aggregation and local differential perturbation#differential-privacy#distributed-training#fedavgAI research
Hugging Face daily papers·14d agoFlattening Every Memory Peak in Long-Context Mixture-of-Experts Training#distributed-training#long-context#memory-optimization1
Hugging Face Blog·17d agoAsync GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL#distributed-training#fine-tuning#grpoAI tools & infra
arXiv cs.AI / cs.LG / cs.CL·17d agoHybridFLow: SDN-Orchestrated Client Partitioning for Hybrid Federated Learning#distributed-training#federated-learning#sdnAI research
Hugging Face daily papers·19d agoMiles v0.1: Production-Level Post-Training#agentic-rl#distributed-training#open-source
arXiv cs.AI / cs.LG / cs.CL·19d agoScalability Analysis of Distributed Kolmogorov-Arnold Network Training on High-Performance Computing Systems#distributed-training#hpc#kolmogorov-arnold-networksAI research1