加载中...
| 类别 | AI术语 |
| 英文名 | Scaling Law |
| 年份 | 2020 年 |
| 领域 | 人工智能 |
扩展法则(Scaling Law,亦称缩放定律)是指深度学习模型,尤其是大语言模型的性能,随着模型参数量、训练数据量与计算资源投入的增加,呈现出平滑、可预测的提升关系的经验性规律。这些规律通常表现为测试损失与各扩展因素之间的幂律关系,为大模型的资源规划与设计决策提供了量化依据。[1]
扩展法则的核心发现是:在足够规模下,模型的交叉熵损失会随参数量、数据量与算力按幂律平稳下降,且这种关系跨越多个数量级仍然成立。OpenAI 于 2020 年的研究首次系统刻画了这一现象。2022 年 DeepMind 的 Chinchilla 研究进一步揭示,在给定算力预算下,模型规模与训练数据量应按近似等比例协同扩展才能达到计算最优,纠正了此前重参数、轻数据的倾向,指出许多大模型实际处于训练不足状态。这表明性能并非由单一因素决定,而取决于三者的均衡配置。
扩展法则的价值在于其预测性:研究者可在小规模实验中拟合规律,据此外推大规模模型的性能与所需资源,从而以较低成本指导高昂的训练投入。它也部分解释了涌现能力——某些复杂能力在模型跨越特定规模阈值后突然显现。然而,扩展法则并非无限有效:高质量数据正逐渐成为稀缺瓶颈,边际收益可能递减,且法则的具体系数依赖于架构、数据分布与优化设置。
扩展法则深刻影响了大模型的发展路线,驱动了规模即能力的研发范式,指导着参数规模、数据配比与算力分配的工程决策。它也促使业界探索数据质量优化、推理时计算扩展等新方向,以在数据与算力约束下持续突破模型能力的边界。
| 类别 | AI术语 |
| 英文名 | Scaling Law |
| 年份 | 2020 年 |
| 领域 | 人工智能 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧