加载中...
宪法式AI是Anthropic于2022年提出的对齐方法,用一组书面原则(宪法)指导模型自我批评和修订输出,并以AI反馈替代大量人工标注来训练无害性。该方法是Claude系列模型对齐训练的基础之一。

| 英文名 | Constitutional AI |
| 简称 | CAI |
| 提出机构 | Anthropic |
| 提出时间 | 2022年 |
| 代表应用 | Claude 系列模型 |
| 相关技术 | RLAIF、RLHF |
宪法式AI(Constitutional AI,简称CAI)是由Anthropic在2022年论文《Constitutional AI: Harmlessness from AI Feedback》中提出的模型对齐方法。其核心思想是不依赖大规模人工标注有害内容,而是给模型一组明文写下的行为原则(称为宪法),让模型依据这些原则自我批评、自我修订,并用AI生成的偏好数据完成强化学习。
传统RLHF需要人工对大量模型回复进行有害性标注,成本高、标注者心理负担重,且规则隐含在数据中难以审查。宪法式AI把价值取向显式写成一份可公开、可修改的原则清单,原则来源包括联合国人权宣言、平台服务条款以及研究者总结的常识性规范,使对齐目标更透明、更可迭代。
训练分为两个阶段:
宪法式AI被用于Anthropic的Claude系列模型训练,使模型在拒绝有害请求的同时尽量解释原因、减少无理由的回避。该方法启发了后续大量以AI反馈降低标注成本的研究,也推动了对齐目标应当公开透明这一理念;Anthropic还开展过集体宪法实验,邀请公众参与起草原则。
问:宪法式AI是否完全不需要人类参与?答:不是。宪法本身由人类撰写,有用性偏好数据仍可来自人类,只是无害性标注环节由AI依据宪法完成。
问:宪法式AI与RLAIF是什么关系?答:RLAIF泛指用AI反馈替代人类反馈的强化学习,宪法式AI是其最著名的具体方案,特点是AI反馈必须依据一组明文原则作出。

| 英文名 | Constitutional AI |
| 简称 | CAI |
| 提出机构 | Anthropic |
| 提出时间 | 2022年 |
| 代表应用 | Claude 系列模型 |
| 相关技术 | RLAIF、RLHF |
登录 后参与讨论
暂无讨论,来发表第一条评论吧