加载中...
强化学习让智能体通过与环境交互、获取奖励信号来学习最优策略,无需人工标注数据。AlphaGo、ChatGPT 的 RLHF 对齐、OpenAI Five 打败职业 Dota2 选手,都是强化学习的代表性成果。

| 类型 | 机器学习范式 |
| 经典算法 | Q-Learning、PPO、DDPG、SAC |
| 代表成就 | AlphaGo(2016)、ChatGPT RLHF(2022) |
强化学习的核心要素:智能体(Agent)、环境(Environment)、状态(State)、动作(Action)、奖励(Reward)。智能体观察当前状态,执行动作,环境返回新状态和奖励,智能体以最大化累积奖励为目标调整策略。
这和监督学习有根本区别:监督学习有明确的正确答案,RL 只有延迟的、稀疏的奖励信号。比如下围棋,只在游戏结束才知道输赢,中间几百步棋的好坏都要从最终结果倒推。这叫信用分配问题(credit assignment problem),是 RL 最核心的挑战之一。[1]
2013 年 DeepMind 的 DQN 用卷积神经网络处理 Atari 游戏的像素输入,无需人工设计特征,直接学会玩 49 款游戏,其中 29 款超越人类水平。2016 年 AlphaGo 击败李世石,用的是蒙特卡洛树搜索 + 深度强化学习,而 AlphaZero(2017)完全不靠人类棋谱,纯自我对弈 72 小时后击败 AlphaGo。
在 LLM 领域,RLHF(Reinforcement Learning from Human Feedback) 让 ChatGPT 成为可能:先用人类偏好数据训练一个奖励模型,再用 PPO 算法微调语言模型的输出符合人类偏好。这是 GPT-3.5 和 GPT-4 区别于原始 GPT-3 的关键步骤。

| 类型 | 机器学习范式 |
| 经典算法 | Q-Learning、PPO、DDPG、SAC |
| 代表成就 | AlphaGo(2016)、ChatGPT RLHF(2022) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧