加载中...

DeepSpeed 是微软开源的深度学习优化库,构建在 PyTorch 之上,目标是让大规模模型的训练与推理更快、更省显存、更易用。它与 Megatron-LM 并列为大模型分布式训练的主流基础设施。
最具代表性的是 ZeRO(Zero Redundancy Optimizer)系列:将优化器状态、梯度和模型参数分片到各数据并行进程,消除冗余存储;ZeRO-Offload 与 ZeRO-Infinity 进一步把状态卸载到 CPU 内存和 NVMe,使单机也能容纳百亿级模型。此外还提供流水线并行、混合精度、梯度累积、推理内核与 MoE 支持。
DeepSpeed 曾支撑 Megatron-Turing NLG 530B、BLOOM 176B 等大模型训练,其 DeepSpeed-Chat 提供 RLHF 全流程实现。对资源有限的团队,ZeRO 系列显著降低了大模型训练与微调的硬件门槛。

登录 后参与讨论
暂无讨论,来发表第一条评论吧