加载中...
在大模型对齐中,拒绝采样指对同一提示采样多个候选回答,再用奖励模型或规则筛选出高质量样本用于后续训练。它是一种简单有效的数据自举方法,广泛用于监督微调数据构建。

| 中文名 | 拒绝采样 |
| 英文名 | Rejection Sampling |
| 类别 | 对齐数据方法 |
| 依赖 | 奖励模型/验证器 |
| 用途 | 筛选高质量训练样本 |
拒绝采样(Rejection Sampling)在大语言模型对齐语境中,是指对同一个提示生成多个候选回答,然后依据奖励模型或验证规则保留高质量样本、丢弃低质量样本的一种数据筛选与训练方法。
拒绝采样原是统计学中从复杂分布抽样的经典技术。在大模型训练里,它被借用为一种数据自举手段:让模型自己生成大量回答,再用一个更可信的评判器挑出优质回答,形成新的监督微调数据。这种方法在多个知名对齐流程中被用来提升模型的有用性与正确率。
拒绝采样常用于构建高质量指令微调数据,尤其适合数学、代码等答案可验证的任务,可自动筛出正确解法。它也作为强化学习之外的轻量替代方案,在许多对齐管线中作为迭代提升模型能力的一环。
问:拒绝采样与强化学习有何区别?答:拒绝采样只保留好样本做监督微调,不涉及对劣质样本的显式惩罚与策略梯度更新;强化学习则同时利用正负反馈调整策略,通常更复杂但上限更高。
问:拒绝采样的效果依赖什么?答:关键在于评判器的质量。若奖励模型或验证规则不可靠,筛选出的样本可能带偏,反而损害模型,因此常需搭配可验证任务或高质量奖励模型使用。

| 中文名 | 拒绝采样 |
| 英文名 | Rejection Sampling |
| 类别 | 对齐数据方法 |
| 依赖 | 奖励模型/验证器 |
| 用途 | 筛选高质量训练样本 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧