加载中...
涌现能力指大语言模型在规模跨过某个阈值后突然表现出、而小模型几乎不具备的能力,如多步推理和指令理解。该概念由谷歌研究者于2022年提出,其真实性与度量方式在学界仍有争论。

| 英文名 | Emergent Abilities |
| 提出者 | Jason Wei 等 |
| 提出时间 | 2022年 |
| 相关论文 | Emergent Abilities of Large Language Models |
| 相关概念 | 扩展法则、思维链 |
涌现能力(Emergent Abilities)是指在小规模模型中几乎不存在、但当模型规模跨过某个临界点后突然出现的能力。该概念由Jason Wei等谷歌研究者在2022年的论文中正式提出,用以描述大语言模型许多难以由小模型表现外推预测的行为。
扩展法则表明,模型的损失随参数量、数据量和算力平滑下降。但研究者观察到,在多步算术、多语言问答、思维链推理等具体任务上,性能并非平滑提升:模型在某个规模之下接近随机水平,跨过阈值后准确率陡然跃升。这种类似相变的现象被称为涌现,常被用来论证继续扩大模型规模的价值,也引发了对大模型不可预测性的安全担忧。
涌现能力的讨论直接影响业界对扩展路线的判断:如果能力真的突然出现,则前沿模型可能带来难以预见的风险,需要加强评测与红队测试;如果只是度量假象,则能力增长是可预测的,可通过精细评测提前观察到苗头。目前学界普遍认为两种因素同时存在,应针对具体任务具体分析。
问:涌现能力和扩展法则矛盾吗?答:不矛盾。扩展法则描述的是损失等平均指标的平滑变化,涌现描述的是具体下游任务的非线性表现,两者刻画的层面不同。
问:涌现是否已被证伪?答:没有定论。度量错觉的批评解释了部分现象,但思维链推理等复杂能力确实主要在大模型上稳定出现,相关争论仍在继续。

| 英文名 | Emergent Abilities |
| 提出者 | Jason Wei 等 |
| 提出时间 | 2022年 |
| 相关论文 | Emergent Abilities of Large Language Models |
| 相关概念 | 扩展法则、思维链 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧