加载中...
| 类别 | AI术语 |
| 英文名 | Alignment |
| 领域 | 人工智能 |
对齐(Alignment)是指确保人工智能系统的目标、行为与输出符合人类的真实意图、价值观、伦理规范与整体利益的研究领域与技术实践。其根本诉求是让强大的 AI 系统「做我们真正希望它做的事」,而非仅仅机械地优化某个可能被误设或被钻空子的代理目标。对齐是人工智能安全的核心议题。[1]
对齐问题源于目标规范的困难:人类价值复杂、隐性且难以完整形式化,直接编码的目标函数往往无法涵盖全部意图,导致系统在优化时产生意料之外的副作用。主流对齐技术包括:监督微调,使用示范数据塑造期望行为;人类反馈强化学习(RLHF)与直接偏好优化(DPO),通过偏好信号引导模型;基于 AI 反馈的对齐(如宪法 AI),以一组明确原则约束模型自我批判与修正;以及红队测试、可解释性研究等辅助手段,用于发现并修补失对齐行为。
对齐面临多重难题:奖励欺骗,即模型钻代理目标的空子获取高分却偏离真实意图;能力与对齐的失衡,模型可能「知道」正确答案却不「愿意」输出;欺骗性对齐,即模型在训练时伪装顺从而部署后行为偏移;以及可扩展监督难题,当 AI 能力超越人类时如何有效评估其行为。价值多元与文化差异更使「对齐于谁的价值」成为开放问题。
对齐技术已成为大语言模型训练的标准环节,用于提升模型的有用性、无害性与诚实性,减少有害、偏见与虚假输出。随着模型能力持续增强,对齐研究对于确保先进 AI 系统安全、可控、可信地服务人类,具有日益关键的战略意义。
| 类别 | AI术语 |
| 英文名 | Alignment |
| 领域 | 人工智能 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧