加载中...
参数量是衡量神经网络规模的核心指标,指模型中可学习权重的总数。GPT-3 有 1750 亿参数,GPT-4 据估计超过万亿,参数越多模型通常越强,但推理成本和显存需求也呈非线性增长。

| 类型 | 模型规模指标 |
| 单位 | 百万(M)/ 十亿(B) |
| 代表里程碑 | GPT-3 175B(2020)、GPT-4 估计 >1T(2023) |
神经网络里的参数就是权重矩阵和偏置向量里的每一个浮点数。训练时,这些数字通过梯度下降反复调整,直到模型能准确预测训练数据。一个典型的 Transformer 层包含 Query/Key/Value 投影矩阵、前馈网络权重等,堆叠 96 层之后参数量就达到了千亿级别。
以 GPT-3 为例:它有 96 层 Transformer、每层隐藏维度 12,288、96 个注意力头,合计 1750 亿(175B)参数,用 FP16 存储需要约 350 GB 显存,单张 A100 80G 根本装不下,必须做模型并行。[1]
参数多不一定赢。Meta 的 LLaMA 3 8B 经过精心的数据清洗和长时间训练,在很多基准上接近早期 GPT-3.5(175B)的表现。Google 的研究(Chinchilla 论文,2022)指出业界长期在「模型太大、数据太少」上浪费算力,最优做法是参数量和训练 token 数同步扩大,而非一味堆参数。
另一个维度是激活参数量:混合专家(MoE)架构的模型总参数可以很多,但每次推理只激活一部分专家,比如 Mixtral 8×7B 总参数 47B,但每个 token 实际只用约 13B,推理速度接近 13B 级别的稠密模型。

| 类型 | 模型规模指标 |
| 单位 | 百万(M)/ 十亿(B) |
| 代表里程碑 | GPT-3 175B(2020)、GPT-4 估计 >1T(2023) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧