世界模型关注的核心问题,是在给定当前状态和一个动作后,预测环境接下来会发生什么,并把预测结果用于规划与决策。原帖采用狭义定义:语言模型主要预测下一个词,而世界模型学习环境的动态规律,预测动作发生后的下一个场景状态。广义语境里,视频预测、天气预报等也可能被称为世界模型,因此讨论前需要先明确口径。

三项核心能力

1. 表示世界(Represent)

现实状态通常过于复杂,模型先通过编码器把高维观测 o_t 压缩为潜在状态 z_t:

s_t -> o_t -> z_t

这个压缩表示只保留当前任务需要的信息。由于环境往往是部分可观测的,潜在状态通常还要结合历史信息,推断当前观测中没有直接出现的内容。

2. 预测世界(Predict)

动态模型学习状态如何随动作和时间变化。最基本的形式是:

(z_t, a_t) -> z_(t+1)

这里的目标不是逐像素重建全部细节,而是抓住会影响任务的状态变化。模型需要预测的不只是下一步,还包括未来多步的奖励、代价或价值,才能支撑规划。

3. 想象与规划(Imagine and Plan)

模型可以在内部继续展开多条未来轨迹,而不立即改变真实环境。系统再用奖励、代价或价值函数比较这些轨迹,选择预期更优的一条,只执行其第一个动作,获得新观测后重新规划。

整个循环可以概括为:

Represent -> Predict -> Imagine -> Evaluate -> Plan -> Act

典型架构组件

原帖把常见组件整理为五部分:

  1. 编码器:把高维观测压缩成潜在状态。
  2. 动态模型:学习潜在状态在动作作用下如何演化。
  3. 解码器(可选):把潜在状态还原为人可观察的形式;如果任务只需要潜在空间内规划,不一定要完整重建画面。
  4. 奖励或代价预测头:评估预测状态的好坏。
  5. 规划与动作选择过程:比较多条模拟轨迹并选择下一步动作。

目前并不存在一套公认、统一的世界模型 Agent 架构,上述划分是便于理解的工程抽象。

经典工作的可核实结论

2018 年的 World Models 展示了如何学习环境的压缩时空表示,并让紧凑策略使用该表示完成任务;论文还报告了在模型生成的“梦境”中训练策略,再迁移回真实环境的实验。

PlaNet 从图像交互中学习潜在动态模型,并在潜在空间进行在线规划。论文覆盖了接触动力学、部分可观测和稀疏奖励等连续控制任务,并报告了较高的样本效率。

Dreamer 进一步直接利用潜在空间中的想象轨迹学习行为。论文在 20 个视觉控制任务上报告了数据效率、计算时间和最终表现方面的改进。

Google 在 2025 年 5 月公开表示,计划把 Gemini 扩展为能够规划并通过模拟世界来想象新经验的“世界模型”。这代表公司的研究方向与产品愿景,不应当被理解为世界模型路线已经完成验证。

价值与边界

世界模型的潜在价值包括:减少必须从真实环境获得的训练经验、在执行前比较不同动作的后果,以及把环境规律迁移到新情境。但这些能力都受模型准确性约束:

  • 单步预测误差会在长轨迹中累积,导致规划基于一个偏离现实的虚拟环境。
  • 从相关性中学习真正的因果关系仍然困难。
  • 仿真中的光线、材质、传感器噪声等细微差异,可能造成明显的现实迁移落差。
  • “能生成逼真未来”不等于“学会了对决策有用的状态变化”,评价时应同时检查任务成功率、长时域稳定性和迁移表现。

原帖是一篇入门科普,重点是直观概念和架构脉络,不包含完整数学推导、复现实验步骤或统一基准。阅读时应把作者的归纳、论文报告的实验结果和厂商的战略表述区分开来。

原作者:Pinkman1893(Pinkman)
原帖:https://linux.do/t/topic/2816225