加载中...
规模法则(Scaling Laws)描述了神经网络性能如何随模型参数量、训练数据量和计算量的增大而可预测地提升。这一发现为大模型的研发投入提供了理论依据,也引发了 AI 领域的「算力竞赛」。

| 类型 | 深度学习经验规律 |
| 关键论文 | Kaplan et al. 2020(OpenAI)/ Hoffmann et al. 2022(Chinchilla) |
| 核心结论 | 性能随参数、数据、算力呈幂律增长 |
2020 年 OpenAI 的 Kaplan et al. 系统研究了 GPT 在不同规模下的损失曲线,发现了一个惊人规律:模型性能(以交叉熵损失衡量)随参数量、数据量、计算量三者各自的幂律增长而平滑下降,三条曲线几乎是直线(对数坐标下),没有出现明显的「天花板」。
更重要的发现是:在固定计算预算下,扩大模型比增加训练数据回报更高(当时 OpenAI 偏向「用更多算力训大模型」)。这个结论直接指导了 GPT-3 的训练策略——用 3000 亿 token 训练 1750 亿参数的模型。[1]
2022 年 DeepMind 的 Hoffmann et al.(Chinchilla 论文)发现 Kaplan 的结论有误:业界普遍「模型过大、数据过少」。他们重新拟合规模法则,结论是参数量和训练 token 数应该同比增长,最优比例约为 1:20(每个参数对应 20 个训练 token)。Chinchilla 70B 用 1.4 万亿 token 训练,比 Gopher 280B 性能更强、成本更低。
Chinchilla 修正影响了后续所有主流模型:LLaMA 1 就是在「给定推理预算最优」的框架下设计的小模型 + 大量训练数据。但随着数据量上限(高质量互联网文本已近枯竭)和「过训练」有益的新证据出现,规模法则的边界仍在持续修订,2024 年多篇论文发现训练 token 远超 Chinchilla 推荐量仍然有益。

| 类型 | 深度学习经验规律 |
| 关键论文 | Kaplan et al. 2020(OpenAI)/ Hoffmann et al. 2022(Chinchilla) |
| 核心结论 | 性能随参数、数据、算力呈幂律增长 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧