Scaling Law(缩放定律)是描述 AI 大模型性能随参数量、训练数据量和计算量增加而可预测提升的经验规律,它是大语言模型「越大越强」的理论依据,指导着 GPT、Claude 等模型的训练资源投入决策。

| 类型 | 人工智能经验规律 |
| 提出方 | OpenAI 研究团队等 |
| 提出时间 | 2020年(Kaplan 等人论文) |
| 相关概念 | Chinchilla 定律、涌现能力 |
| 应用领域 | 大语言模型训练与算力规划 |
Scaling Law(缩放定律)是人工智能领域的一条经验规律,指大模型的性能会随着模型参数量、训练数据量和计算量的扩大而按可预测的方式持续提升。
在深度学习研究中,人们很早就注意到「更大的模型往往表现更好」,但真正把这一现象总结为定量规律的,是 OpenAI 研究团队于 2020 年发表的论文《Scaling Laws for Neural Language Models》。该研究发现,语言模型的损失(Loss)与参数量、数据量、计算量三者之间近似服从幂律关系:只要持续加大投入,模型能力就会平滑提升,且提升幅度可以提前估算。
这一发现深刻改变了 AI 行业的发展路径。它让「堆算力、堆数据、堆参数」从盲目尝试变成了有据可依的工程决策,直接推动了 GPT 系列等超大规模模型的诞生,也是近年来科技巨头竞相采购 GPU、建设算力集群的底层逻辑。后来 DeepMind 提出的 Chinchilla 定律进一步修正了配比:在算力固定时,参数量与训练数据量应当均衡增长,许多早期大模型其实「训练不足」。
随着模型规模逼近数据和算力的现实上限,业界开始讨论 Scaling Law 是否会「撞墙」:高质量训练数据可能耗尽,边际收益也在递减。为此,研究方向逐渐扩展到推理阶段的扩展(让模型在回答时进行更长的思考)、合成数据、模型蒸馏等新路径,Scaling Law 的内涵仍在不断演化。
问:Scaling Law 是严格的物理定律吗?答:不是。它是从大量实验中总结出的经验规律,在一定范围内成立,但没有理论保证永远有效,因此常被称为「经验定律」。
问:Scaling Law 和「涌现能力」有什么关系?答:Scaling Law 描述的是损失值的平滑下降,而涌现能力指模型规模跨过某个门槛后突然表现出的新能力(如推理、代码),两者是观察同一现象的不同视角。
问:普通用户需要了解 Scaling Law 吗?答:了解它有助于理解 AI 行业动态,比如为什么大厂疯狂囤积 GPU、为什么新一代模型通常更大更贵,以及「小模型精调」路线为何同样受到关注。

| 类型 | 人工智能经验规律 |
| 提出方 | OpenAI 研究团队等 |
| 提出时间 | 2020年(Kaplan 等人论文) |
| 相关概念 | Chinchilla 定律、涌现能力 |
| 应用领域 | 大语言模型训练与算力规划 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧