定义
模型并行(Model Parallelism)是把单个神经网络的参数和计算划分到多个设备上的分布式训练策略,与「每卡一份完整模型」的数据并行相对。当模型大到单卡显存无法容纳时,模型并行是必要选择。
主要形式
- 张量并行(Tensor Parallelism):把单个层内的权重矩阵按行或列切分到多卡,各卡计算部分结果后通过 AllReduce/AllGather 拼合。Megatron-LM 提出的 Transformer 张量并行方案是事实标准,因通信频繁,通常限制在 NVLink 互连的单机内。
- 流水线并行(Pipeline Parallelism):按层把模型切成多个阶段分布到不同设备,微批次流水执行。
- 专家并行(Expert Parallelism):MoE 模型把不同专家分布到不同设备,通过 All-to-All 通信路由 token。
实践
大模型训练普遍将张量并行、流水线并行与数据并行组合为 3D 并行,按互连带宽分层安排:张量并行在机内、数据/流水线并行跨机。
挑战
切分策略直接影响通信量与负载均衡,需结合模型结构与集群拓扑精细设计,自动并行化仍是研究热点。