加载中...

数据并行(Data Parallelism)是分布式深度学习最基础的并行策略:每个计算设备(GPU)保存一份完整的模型副本,各自处理全局批量中的不同数据分片,反向传播后通过集合通信(通常是 AllReduce)对梯度求平均,再各自执行相同的参数更新,保持副本一致。
PyTorch 的 DistributedDataParallel(DDP)是典型实现:梯度按桶(bucket)划分,在反向传播过程中与计算重叠地异步执行 AllReduce,通信底层依赖 NCCL。TensorFlow 的 MirroredStrategy、Horovod 等采用相同思想。
针对显存冗余问题,ZeRO/FSDP 等「全分片数据并行」把参数、梯度、优化器状态也切分到各卡,按需聚合;超大模型训练则将数据并行与张量并行、流水线并行组合成混合并行(3D 并行)。

登录 后参与讨论
暂无讨论,来发表第一条评论吧