加载中...

| 类别 | AI术语 |
| 英文名 | Reinforcement Learning |
| 领域 | 人工智能 |
强化学习(Reinforcement Learning,RL)是机器学习的三大范式之一,研究智能体(Agent)如何在与环境的持续交互中,通过试错并依据获得的奖励信号,学习一套能够最大化长期累积回报的行为策略。它不依赖预先标注的样本,而是从行动的后果中学习,体现了「在实践中成长」的学习思想。[1]
强化学习通常被建模为马尔可夫决策过程(MDP),包含状态、动作、状态转移概率、奖励函数与折扣因子五大要素。智能体在某一状态下选择动作,环境随之转移至新状态并反馈奖励,目标是学习一个策略以最大化期望折扣累积回报。核心挑战之一是探索与利用的权衡:既要利用已知的高回报动作,又要探索未知动作以发现更优策略。主流算法分为三类:基于价值的方法(如 Q-Learning、DQN),通过估计动作价值函数间接导出策略;基于策略的方法(如策略梯度、PPO),直接对策略参数化并优化;以及结合二者的演员-评论家方法。
强化学习的优势在于能够处理序贯决策与延迟奖励问题,适用于目标明确但最优路径未知的复杂场景。其难点包括:奖励稀疏与信用分配困难、样本效率低下、训练不稳定,以及奖励函数设计不当易导致非预期行为。深度强化学习将深度神经网络作为函数逼近器,显著扩展了其在高维状态空间中的适用范围。
强化学习在游戏博弈(如围棋、电子竞技)、机器人控制、自动驾驶、资源调度与推荐系统中取得了瞩目成果。近年来,它更成为大语言模型对齐(RLHF)与提升推理能力的关键技术,通过奖励信号引导模型生成更优质、更符合人类期望的输出,展现出广阔的应用前景。

| 类别 | AI术语 |
| 英文名 | Reinforcement Learning |
| 领域 | 人工智能 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧