加载中...
DeepSpeed 是微软开源的深度学习训练优化库,通过 ZeRO 显存优化、混合精度、卸载与并行策略,使得在有限硬件上训练超大规模模型成为可能,是大模型分布式训练的重要基础设施。

| 中文名 | DeepSpeed |
| 开发方 | 微软 |
| 发布时间 | 2020 年 |
| 核心技术 | ZeRO 显存优化 |
| 用途 | 大模型分布式训练 |
DeepSpeed 是由微软开发的开源深度学习优化库,专注于让大规模模型的训练更高效、更省显存,其核心的 ZeRO 系列技术极大降低了训练超大模型的硬件门槛。
DeepSpeed 于二零二零年由微软发布,目标是解决大模型训练中显存不足与扩展困难的问题。随着模型参数量增长到数十亿乃至数千亿,单卡显存远不足以容纳模型、梯度与优化器状态。DeepSpeed 通过一系列显存与并行优化,使研究者能够在相对有限的集群上训练出规模庞大的模型。
DeepSpeed 被广泛用于大语言模型的预训练与微调,也是许多开源训练工具链的底层依赖。它尤其适合显存受限但希望训练更大模型的团队,以及需要在多机多卡上高效扩展的场景。
问:DeepSpeed 与 ZeRO 是什么关系?答:ZeRO 是 DeepSpeed 提供的核心显存优化技术,分为多个阶段逐级分片;DeepSpeed 则是包含 ZeRO 在内的完整训练优化框架。
问:使用卸载会显著变慢吗?答:把状态卸载到内存或硬盘会引入额外数据搬运开销,因此以速度换取可训练规模。是否启用应根据显存紧张程度与吞吐要求权衡。

| 中文名 | DeepSpeed |
| 开发方 | 微软 |
| 发布时间 | 2020 年 |
| 核心技术 | ZeRO 显存优化 |
| 用途 | 大模型分布式训练 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧