arXiv cs.AI / cs.LG / cs.CL·9d agoAccelerating Sharded Data Parallelism at Scale with Federated Learning#communication-efficiency#distributed-training#federated-learningAI research