世界模型(World Model)是一类让 AI 在内部模拟和预测环境变化的模型:它学习世界的运行规律,能推演「接下来会发生什么」,被视为通往更强通用智能的关键路线,广泛用于自动驾驶、机器人和视频生成等领域。

| 类型 | 人工智能模型 / 研究方向 |
| 所属领域 | 强化学习、机器人、自动驾驶、视频生成 |
| 核心能力 | 模拟环境、预测未来状态 |
| 代表人物 | Yann LeCun(杨立昆)等 |
| 相关概念 | 强化学习、AGI、视频生成模型 |
世界模型(World Model)是人工智能领域的一类模型,指让 AI 系统在内部构建一个对外部世界的「模拟器」,学习环境的运行规律,从而能够预测环境接下来会如何变化,并据此进行规划和决策。
人类之所以能安全地开车、接住抛来的物体,是因为大脑里有一套对物理世界的直觉理解:我们不需要真的撞一次车,就能预判「再不刹车就会追尾」。世界模型的目标就是让 AI 拥有类似的能力——先在「脑内」推演行动的后果,再选择最优的行动,而不是只能在真实环境中反复试错。
这一思想在强化学习中由来已久,通常做法是让模型把高维的观测(如摄像头画面)压缩成简洁的内部表示,再学习一个预测模块来推演状态如何随动作演化。近年来,随着大模型和视频生成技术的发展,世界模型成为热门方向:不少研究者认为,仅靠预测下一个词的语言模型难以真正理解物理世界,而世界模型可能是通往通用人工智能(AGI)的重要路线,Meta 首席科学家杨立昆(Yann LeCun)是这一观点的代表人物之一。
世界模型已经在多个方向落地探索:自动驾驶公司用它模拟各种罕见路况来训练和测试系统;机器人领域用它让机械臂在虚拟推演中学会操作物体;视频生成模型(如 OpenAI 的 Sora、谷歌的 Genie 等)也常被讨论是否算「世界模拟器」;游戏 AI 则借助世界模型在想象中排练玩法。
问:世界模型和大语言模型(LLM)有什么区别?答:大语言模型主要学习文本规律、预测下一个词;世界模型学习的是环境状态如何随时间和动作变化,更侧重对物理世界因果关系的理解,两者可以互补结合。
问:视频生成模型就是世界模型吗?答:有争议。视频生成模型能生成逼真画面,说明学到了部分世界规律,但常出现违背物理常识的错误,是否算真正的世界模型,学界尚无定论。
问:普通用户现在能用上世界模型吗?答:它目前更多是研究方向和底层技术,普通用户主要通过自动驾驶辅助、视频生成工具等产品间接体验其成果。

| 类型 | 人工智能模型 / 研究方向 |
| 所属领域 | 强化学习、机器人、自动驾驶、视频生成 |
| 核心能力 | 模拟环境、预测未来状态 |
| 代表人物 | Yann LeCun(杨立昆)等 |
| 相关概念 | 强化学习、AGI、视频生成模型 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧