加载中...
测试时扩展指在推理阶段投入更多计算(如更长的思维链、多路采样、搜索)来提升模型表现的技术路线。OpenAI o1与DeepSeek-R1的成功使其成为继训练扩展法则之后的新增长曲线。

| 英文名 | Test-Time Scaling |
| 别称 | 推理时扩展、推理时计算 |
| 代表模型 | OpenAI o1、DeepSeek-R1 |
| 兴起时间 | 2024年 |
| 核心手段 | 长思维链、并行采样、搜索 |
| 相关概念 | 扩展法则、思维链 |
测试时扩展(Test-Time Scaling,又称推理时扩展、Inference-Time Scaling)是指在模型推理阶段投入更多计算量以换取更好输出质量的技术路线。与通过增加参数和训练数据提升能力的传统扩展法则相对,它开辟了让模型思考更久而非变得更大的第二条增长曲线。
传统上模型一次前向采样直接给出答案,算力消耗固定。研究者发现,让模型在回答前生成长推理过程、对同一问题多次采样再择优,或在解空间中显式搜索,都能显著提升数学、编程等可验证任务的成绩,且成绩随推理算力近似对数线性增长。2024年OpenAI发布的o1模型将这一思路产品化:通过强化学习训练模型自发生成很长的内部思维链,在解题前反复尝试、检查与回溯;2025年初DeepSeek-R1开源了类似技术并公开了训练细节,使推理模型成为行业标配。
测试时扩展在数学竞赛、编程、科学问答等可验证领域收益最大,推动了AIME、竞赛编程等高难基准成绩的飞跃,也改变了推理基础设施的需求结构——输出token量大幅增加,使KV缓存与解码吞吐成为新瓶颈。它与训练扩展互补:更强的基座配合更多思考时间,共同决定最终能力上限。
问:测试时扩展对所有任务都有效吗?答:不是。在答案可验证、需要多步推理的任务上收益显著;在闲聊、简单事实问答等任务上过度思考收益甚微,还会增加延迟与成本。
问:它会取代扩大模型规模吗?答:不会,两者互补。小模型多思考可在部分任务追平大模型,但基座能力仍决定思考质量的上限。

| 英文名 | Test-Time Scaling |
| 别称 | 推理时扩展、推理时计算 |
| 代表模型 | OpenAI o1、DeepSeek-R1 |
| 兴起时间 | 2024年 |
| 核心手段 | 长思维链、并行采样、搜索 |
| 相关概念 | 扩展法则、思维链 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧