加载中...
Best-of-N 采样是一种测试时增强方法,对同一问题让模型生成 N 个候选答案,再用奖励模型或验证器从中挑出最佳者作为最终输出,以增加推理计算换取更高的答案质量。

| 中文名 | Best-of-N 采样 |
| 类别 | 测试时扩展 |
| 依赖 | 奖励模型/验证器 |
| 代价 | N 倍推理开销 |
| 用途 | 提升输出质量 |
Best-of-N 采样是一种在推理阶段提升大语言模型输出质量的方法,通过对同一提示采样 N 个候选回答并用打分器选出最优的一个作为最终答案,属于测试时扩展的典型手段。
大语言模型单次生成的答案质量存在随机波动,一次不一定给出最好的结果。Best-of-N 采样的核心思想是用更多的推理计算换取更好的答案:既然一次不够,就多生成几次,再挑最好的。它简单直接,被广泛用作对齐评估的基线,也是测试时扩展研究的重要组成部分。
Best-of-N 常用于数学、代码等答案可评判的任务中提升准确率,也用于对齐研究中衡量模型潜力上限。此外,它生成的最优样本可反过来用于拒绝采样式的数据构建,帮助迭代改进模型。
问:Best-of-N 与自洽性有何区别?答:自洽性通过对多个答案投票选出最一致的结果,依赖答案可比对;Best-of-N 则依赖外部奖励模型或验证器为每个答案单独打分再取最优,二者选择机制不同。
问:N 是不是越大越好?答:并非无限增益。随着 N 增大,质量提升会逐渐饱和,而计算成本持续增加;同时若打分器不准确,还可能出现奖励作弊,挑出看似高分实则不佳的答案。

| 中文名 | Best-of-N 采样 |
| 类别 | 测试时扩展 |
| 依赖 | 奖励模型/验证器 |
| 代价 | N 倍推理开销 |
| 用途 | 提升输出质量 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧