强化学习(Reinforcement Learning)是机器学习的三大基本范式之一,让智能体在与环境的不断交互中通过奖励信号试错学习最优策略,是 AlphaGo 下棋、机器人控制和大模型 RLHF 对齐背后的核心技术。

| 类型 | 机器学习范式 / AI 术语 |
| 所属领域 | 人工智能、机器学习 |
| 理论基础 | 马尔可夫决策过程(MDP) |
| 核心机制 | 奖励信号驱动的试错学习 |
| 代表应用 | AlphaGo、机器人控制、RLHF |
| 相关概念 | 监督学习、无监督学习、深度学习 |
强化学习(Reinforcement Learning,简称 RL)是机器学习的一个重要分支,研究智能体如何在与环境的交互中根据奖励信号不断试错、调整行为,从而学会使长期累积回报最大化的决策策略。
与监督学习和无监督学习并列,强化学习被视为机器学习的第三种基本范式。它的独特之处在于:既不需要人工标注好的输入输出样本,也不要求对错误动作给出精确纠正,而是让智能体自己去尝试——做出动作、观察环境反馈的奖励或惩罚,再据此改进下一步的选择,整个过程类似训练宠物或人类通过实践积累经验。
强化学习通常用「马尔可夫决策过程(MDP)」来描述问题:智能体在某个状态下选择动作,环境随之转移到新状态并给出奖励。由于奖励往往是延迟的(比如下棋要到终局才知输赢),算法必须学会把最终结果合理归因到之前的一连串决策上,这是强化学习区别于其他方法的核心难点之一。
近年来,强化学习与深度神经网络结合形成「深度强化学习」,先后在围棋、电子游戏、机器人控制等领域取得突破;在大语言模型时代,基于人类反馈的强化学习(RLHF)更成为让 ChatGPT、Claude 等模型学会「说人话、守规矩」的关键训练环节。
强化学习最出圈的成果是击败人类顶尖棋手的围棋程序,此外它还广泛用于游戏 AI、机器人步态与抓取控制、自动驾驶决策、推荐系统排序、数据中心节能调度等场景。在 AI 大模型领域,RLHF 和面向推理能力的强化学习训练,已成为提升模型对齐程度与解题能力的主流手段。
问:强化学习和监督学习有什么区别?答:监督学习依赖大量带标准答案的样本,模型照着答案学;强化学习没有标准答案,只有环境给出的奖励信号,智能体要靠自己试错摸索出好策略,且要处理奖励延迟到来的问题。
问:什么是「探索与利用」的权衡?答:一直用当前已知的最优动作可能错过更好的选择,一味尝试新动作又会浪费机会拿不到高回报。好的强化学习算法需要在两者之间动态平衡,先多探索、后多利用是常见思路。
问:强化学习和大模型有什么关系?答:大语言模型在预训练后通常会经过 RLHF(基于人类反馈的强化学习)微调,用人类偏好作为奖励信号,让回答更有用、更安全;新一代推理模型也大量使用强化学习来提升数学、编程等复杂任务的表现。

| 类型 | 机器学习范式 / AI 术语 |
| 所属领域 | 人工智能、机器学习 |
| 理论基础 | 马尔可夫决策过程(MDP) |
| 核心机制 | 奖励信号驱动的试错学习 |
| 代表应用 | AlphaGo、机器人控制、RLHF |
| 相关概念 | 监督学习、无监督学习、深度学习 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧