加载中...
DeepMind开发的围棋AI,2016年以4:1击败世界冠军李世石,2017年以3:0击败排名世界第一的柯洁,终结了人类在围棋领域维持数十年的认知优越感,被视为AI史上的里程碑事件。

| 开发者 | DeepMind |
| 关键赛事 | 2016年人机大战(vs李世石4:1胜) |
| 核心技术 | 深度强化学习 + 蒙特卡洛树搜索 |
围棋的落子可能性约为10的170次方,远超国际象棋,传统搜索算法无法穷举。AlphaGo的核心创新是将深度神经网络与蒙特卡洛树搜索(MCTS)结合:策略网络(Policy Network)预测下一步落子概率,价值网络(Value Network)评估当前局面胜率,两者共同指导搜索树的剪枝,大幅缩小搜索空间。
训练分两阶段:先用人类棋谱做监督学习,再让模型自我对弈做强化学习。AlphaGo Lee(2016年版)已能击败职业九段;AlphaGo Master(2017年1月)在网络上以60:0横扫人类顶尖棋手。[1]
2017年10月,DeepMind发布AlphaGo Zero——完全不使用人类棋谱,从随机落子开始纯靠自我对弈,训练40天后以100:0击败AlphaGo Lee。这证明了强化学习能在没有人类先验知识的情况下超越人类。
后续的AlphaZero(2017年12月)用同样框架扩展到国际象棋和日本将棋,均击败了各领域最强专用AI。这套方法论深刻影响了后续的AI研究方向,「从零自我对弈」成为解决复杂博弈问题的标准范式。

| 开发者 | DeepMind |
| 关键赛事 | 2016年人机大战(vs李世石4:1胜) |
| 核心技术 | 深度强化学习 + 蒙特卡洛树搜索 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧