世界模型:AI如何在想象中学习和规划

outcomeschool 发布于 2026-06-21 阅读 139

世界模型(World Model)是一种让AI学习环境内部模拟的技术,通过预测下一状态和奖励来高效学习。文章从基本概念(环境、状态、动作)出发,解释世界模型如何像人类下棋一样“想象未来”,减少真实试错成本。它通过压缩观测为潜在状态,并利用潜在空间进行滚动预测(rollout),从而在想象中大量训练。Dreamer-style代理利用这一机制实现样本高效学习。实际应用包括机器人、自动驾驶、游戏和视频生成。文章强调世界模型的核心是预测未来,进而实现智能规划。

世界模型是如何工作的?

在这篇博客中,我们将学习世界模型是如何工作的。我们还将了解为什么需要它们,它们如何学习环境的内部表示,以及它们在机器人、游戏和视频生成等实际系统中的应用。

我们将涵盖以下内容:

  • 什么是环境、状态和动作
  • 什么是世界模型
  • 人类类比:在行动前先想象
  • 为什么我们需要世界模型
  • 世界模型如何学习:预测下一个状态
  • 潜在状态:压缩我们所看到的
  • 想象未来:在不接触真实世界的情况下进行推演
  • 在模型内部规划的 Dreamer 风格智能体
  • 世界模型与预测未来
  • 现实世界中的世界模型

让我们开始吧。

什么是环境、状态和动作

在讨论世界模型之前,我们必须先理解三个简单的词:环境、状态和动作。这三个词会反复出现,所以让我们把它们解释清楚。

环境是 AI 所生活的世界,以及它与之交互的世界。

简单来说,环境就是周围的环境。对于机器人来说,环境就是它走来走去的房间。对于玩游戏的人工智能来说,环境就是游戏本身。对于自动驾驶汽车来说,环境就是道路、其他车辆和交通信号灯。

状态是环境在某一时刻的快照。

简单来说,状态就是“现在的情况”。假设我们在玩电子游戏。状态就是当前的屏幕:我们的角色站在哪里,敌人在哪里,我们还有多少生命值。如果任何东西移动了,我们就得到一个新状态。

动作是 AI 做出的改变状态的选择。

简单来说,动作就是一个操作。在游戏中,动作可以是“跳跃”“左移”或“射击”。对于机器人来说,动作可以是“转动轮子”或“抬起手臂”。

所以,这就是一个将三者联系在一起的简单循环:AI 查看当前状态,选择一个动作,然后环境返回一个新状态。接着它查看新状态,选择另一个动作,依此类推。

我们可以将这个循环描绘如下:

   +-->  当前状态  -->  AI 选择一个动作  -->  环境  --+
   |                                                    |
   |                                                    v
   +------------------------  下一个状态  <--------------+
                          (循环重复)

在这里,我们可以看到 AI 和环境轮流进行。AI 执行动作,环境用新状态回应,然后一步一步继续。这个循环是我们需要的基础。现在我们可以来理解这个问题了。

什么是世界模型

既然我们知道了状态和动作是什么,让我们来理解世界模型。

世界模型是一个 AI,它学习环境行为的一个近似内部副本,以便根据当前状态和动作预测接下来会发生什么。

让我们分解这个术语来加深理解。

世界模型 = 世界 + 模型。

这里的“世界”就是我们刚才讨论的环境。“模型”只是某个真实事物的一个小型内部副本或模仿品。所以世界模型是存在于 AI 内部的世界的近似内部副本。它不是完美的副本,但足够好用。

简单来说,世界模型就是 AI 在自己头脑中构建的一个小型模拟器。我们可以问它这样的问题:“如果我处于这个状态并采取这个动作,接下来会发生什么?”它会给出答案:下一个状态,以及这个结果的好坏程度。

在继续之前,让我们快速理解另一个词:奖励。奖励是一个数字,告诉 AI 一个结果有多好。高奖励意味着“那很好,多做这样的行为”。低或负奖励意味着“那很糟糕,要避免”。对于游戏来说,得分给予奖励;掉进坑里给予负奖励。

所以,世界模型接收两个输入:当前状态和动作。从这些输入中,它预测接下来会发生什么。它主要预测的是下一个状态。许多世界模型,特别是那些在强化学习中使用的模型,也会预测奖励。在这篇博客中,我们将重点放在这些模型上,所以从现在开始,我们将一起讨论预测下一个状态和奖励。

这就是世界模型在高级层面上的工作方式。现在,让我们用一个日常例子让它感觉真实。

人类类比:在行动前先想象

学习这个的最好方法是举个例子。而最好的例子是我们每天都做的事情,甚至不需要思考。

假设我们在下棋。在我们实际拿起棋子之前,我们会做什么?我们会想象。我们会想:“如果我把我的马移到这儿,那么我的对手很可能会把他们的象移到那儿,然后我就麻烦了。”我们首先在头脑中走一步棋。我们观察想象的结果。只有当它看起来不错时,我们才做出实际的移动。

我们并没有接触棋盘来发现这个结果。我们在脑海中运行了一个小型的模拟。

我们脑海中的那个小型模拟正是世界模型。

再举一个例子。假设我们要往杯子里倒水。在我们倾斜瓶子之前,我们已经大致知道会发生什么:水会流出来,杯子里的水位会上升,如果我们倾斜得太厉害,水就会溢出来。我们知道这一切,而一滴水都没有洒出来,因为我们携带着一个关于水如何行为的内部模型。

所以,世界模型赋予了 AI 同样的能力:在现实世界中采取行动之前,能够想象行动的结果。

这就是整个想法的核心。现在的问题是,我们为什么需要这个?让我们来看看。

为什么我们需要世界模型

为了理解为什么需要世界模型,让我们先看看没有它时 AI 是如何学习的。

AI 学习任务通常的方式是试错。它尝试一个动作,看看会发生什么,然后慢慢弄清楚哪些动作是好的,哪些是坏的。这种通过试错和奖励来学习的方式被称为强化学习

简单来说,强化学习就是从经验中学习:尝试某事,获得奖励或惩罚,然后记住什么有效。

但问题就在这里。要以这种方式学习,AI 必须在真实环境中实际尝试,一次又一次,成千上万甚至数百万次。这带来了实际问题。

这导致了三个实际问题:

  • 速度慢。 在现实世界中尝试数百万次动作需要很长时间。
  • 成本高。 如果我们的 AI 是一个真实的机器人,每一次尝试都意味着真实的电机在动,真实的电池在消耗,真实的磨损。
  • 风险高。 一个通过随机试错学习的真实机器人可能会摔倒、损坏东西或在摸索中受伤。

所以,直接在现实世界中学习是浪费的,有时甚至很危险。

我们可以比较两种学习方式如下:

  没有世界模型                    有世界模型
  ------------                  ----------

  AI                               AI
   |                                |
   | 在真实世界中尝试               | 在模型内部尝试
   v                                v
  真实环境                         内部模拟器
   |                                |
   | 慢、贵、有风险                 | 快、便宜、安全
   v                                v
  新状态 + 奖励                    预测的状态 + 奖励
   |                                |
   | 重复数百万次                   | 重复数百万次
   | (在缓慢的真实世界中)           | (全部在想象中)
   v                                v
  学习到的行为                     学习到的行为

在这里,我们可以注意到两条路径都达到了学习到行为的相同目标,但左边的路径在每一次尝试中都付出缓慢、昂贵、有风险的真实世界代价,而右边的路径则在一个廉价、安全的内部模拟器中完成所有练习。

现在,回想一下下棋的例子。我们并没有通过移动真实棋子一百万次来学习。我们在脑海中想象走法,并从这些想象的结果中学习。这就是我们想要赋予 AI 的技巧。

所以,世界模型来救援了。一旦 AI 有了世界的内部模型,它就可以在该模型内部进行练习,而不是在现实世界中练习。我们马上就会看到这到底节省了多少精力。

世界模型如何学习:预测下一个状态

现在,让我们来理解世界模型实际上是如何学习的。这比听起来简单。

世界模型通过观察经验并学习预测接下来发生的事情来学习。

让我们一步一步地走一遍。

第 1 步: 首先,我们让 AI 与环境交互一段时间并记录发生的事情。每个记录都是一小段故事:“我处于这个状态,我采取了那个动作,然后下一个状态发生了,我得到了这个奖励。”我们收集许多这样的故事。

第 2 步: 然后,我们在这些记录的故事上训练世界模型。我们向它展示状态和动作,并要求它猜测下一个状态和奖励。起初,它的猜测是错误的。

第 3 步: 之后,我们将其猜测与实际发生的情况进行比较。如果猜测是错误的,我们就微调模型,使其下次做得更好。我们对所有记录的故事反复重复这个过程。

最后, 经过足够的练习,世界模型在这方面变得擅长。给定一个状态和一个动作,它能准确地预测下一个状态和奖励。最棒的是,即使对于未曾完全见过的情况,它也能工作,因为它已经学习了环境的通用规则,而不仅仅是记住了每个记录的故事。

我们可以将训练好的世界模型所做的事情描绘如下:

   输入                            世界模型                  输出

  当前状态  ----\
                      >----->  [ 学习的模拟器 ]  ----->  下一个状态
  动作  -----------/                                        + 奖励

在这里,我们可以看到世界模型在左侧接收当前状态和动作,通过它学到的内容运行它们,并在右侧产生预测的下一个状态和奖励。它本质上是学习了环境的规则,仅仅通过观察足够的例子,而且不需要任何人手动编写这些规则。

这就是世界模型学习的方式。现在,还有一小块巧妙的部件使它真正强大。让我们理解它。

潜在状态:压缩我们所看到的

首先,我们必须处理一个小问题。

在许多环境中,AI 实际看到的是原始且庞大的。例如,游戏屏幕或相机图像就是一个巨大的像素网格。单个图像可以有数百万个数字,每个数字对应一个微小的颜色点。一个像素一个像素地预测下一个完整图像将是巨大且浪费的。

这些像素中的大多数甚至不重要。在一个游戏中,背景中天空的颜色并不影响我们应该做什么。重要的是角色在哪里,敌人在哪里,以及其他一些重要的细节。

所以,世界模型做了一件聪明的事。它将原始的观察压缩成一个小而紧凑的摘要,保留重要信息并丢弃其余信息。这里需要注意的是,世界模型自己决定什么是重要的。它保留任何有助于它良好预测未来的信息,这主要(但不总是)与人类会选择的内容相同。

这个紧凑的摘要被称为潜在状态

简单来说,潜在状态是对“真正发生了什么”的简短描述,从巨大的原始图像中压缩成一组小的数字。

让我们用一个类比来理解。假设一个朋友看了一场足球比赛,然后用两句话向我们描述:“我们的球队正在进攻,前锋在球门附近控球,后卫正在逼近。”我们的朋友并没有重复比赛的每一帧。他们把整个场景压缩成了一个微小而有意义的摘要。潜在状态正是这种微小而有意义的摘要。

我们可以将压缩描绘如下:

  原始观察                            潜在状态
  (数百万像素)            ----->       (一组小的数字)

  +-----------------------+                 +----------------+
  | 完整游戏画面          |    压缩          | 角色位置       |
  | 每个像素、天空、      |   =========>    | 敌人位置       |
  | 云、背景              |   (只保留        | 生命值等       |
  | 数百万数字            |    重要的东西)   +----------------+
  +-----------------------+

在这里,我们可以看到世界模型将左侧巨大的原始屏幕压缩成右侧微小的潜在状态,只包含对预测接下来发生的事情重要的内容。因为潜在状态很小,模型可以快速且廉价地处理它。

所以,从现在开始,世界模型在这个紧凑的潜在空间中进行预测。它输入一个潜在状态和一个动作,并预测下一个潜在状态和奖励。这使得一切学习和运作都更快、更容易。

这种将原始观察压缩成一组小的有意义的数字的想法,正是编码器在变分自编码器中所学习的——我们有一篇详细的关于变分自编码器的博客解释了这种压缩是如何工作的。

这就是世界模型处理像图像这样巨大而杂乱输入的方式。现在,让我们进入最激动人心的部分:想象未来。

想象未来:在不接触真实世界的情况下进行推演

现在我们已经拥有了所有部分。让我们把它们结合起来,以获得重大回报。

一旦世界模型能够从当前潜在状态和动作预测下一个潜在状态,我们就可以将这些预测链接起来。

简单来说,我们可以想象一整个未来的序列步骤,全部在模型内部进行,一次也不接触真实环境。

直接在紧凑的潜在空间(而不是原始像素)中预测未来,也是 JEPA 的核心思想——我们有一篇详细的关于联合嵌入预测架构(JEPA)的博客深入探讨了这一点。

这种预测步骤的链接被称为推演。推演就是“想象第一步,然后第二步,然后第三步,依此类推”,完全在想象中。

让我们一步步了解推演是如何工作的。

第 1 步: 我们从当前潜在状态开始。

第 2 步: 我们选择一个动作。我们将潜在状态和动作输入世界模型,它预测下一个潜在状态和奖励。

第 3 步: 现在我们取那个预测的下一个状态,选择另一个动作,再次输入世界模型。它预测那之后的状态。

最后, 我们一直重复很多步。我们现在已经想象出了完整的未来,几步之后,而没有采取任何真实动作。

我们可以将推演描绘如下:

  想象的未来(全部在世界模型内部,没有真实环境)

  潜在状态 0
        | 动作 A
        v
  潜在状态 1  (+ 奖励)
        | 动作 B
        v
  潜在状态 2  (+ 奖励)
        | 动作 C
        v
  潜在状态 3  (+ 奖励)   ...依此类推

在这里,我们可以看到从当前潜在状态开始,模型不断为每个选择的动作预测下一个状态,建立一个想象的时刻链条。每一步它还预测奖励,这样 AI 就能看到这个想象路径最终好坏如何。

这与我们在下棋时所做的是一样的。我们想象了一系列动作及其结果,在真实执行之前就在脑海里完成了。

而这里巨大的好处是:因为所有这些想象都发生在模型内部,AI 可以快速且廉价地练习数百万次,不会损坏任何真实机器人,也不必等待缓慢的真实世界。这个特性被称为样本高效。简单来说,样本高效意味着 AI 从非常少的真实经验中就能学习良好的行为,因为它从想象中榨取了大量的额外练习。

但是,我们必须记住一个陷阱。世界模型并不完美,所以它的每个预测都带有小误差。当我们在一个长推演中将许多预测链接在一起时,这些小误差会一步一步相加。因此,我们想象得越远,想象的未来就越不可靠。这就是为什么在实践中,这些推演通常保持较短,并且 AI 不断返回真实环境检查和纠正其模型。

所以,主要问题在很大程度上得到了解决。AI 不再需要以缓慢、昂贵、有风险的方式学习一切。它首先从一点真实经验中学习模型,然后在模型内部尽可能多地练习,同时仍然与真实世界核对以保持其想象的真实性。

在模型内部规划的 Dreamer 风格智能体

现在,让我们将其与真实使用这个想法的 AI 智能体家族联系起来。它们被称为 Dreamer 智能体。

“Dreamer”这个名字非常贴切,因为这些智能体实际上是通过做梦来学习的。它们构建了一个世界模型,然后在该模型内部的想象经验上进行训练,就像我们描述推演时那样。

简单来说,Dreamer 智能体不断重复一个简单的几步骤循环。

首先, 它与真实环境进行少量交互并记录发生了什么。

然后, 它使用这些记录来改进其世界模型,使内部模拟器变得更加准确。

之后, 它想象在世界模型内部进行多次推演,并使用这些想象的未来来练习和改进其决策,学习哪些动作会带来高奖励。

最后, 它带着改进后的行为回到真实环境,收集更多一点真实经验,然后循环重复。

我们可以将 Dreamer 循环描绘如下:

  真实环境                        世界模型(想象)
  --------                        ---------------

  少量行动,记录  --->  改进模型
                               |
                               v
                         想象多次推演
                               |
                               v
                         在这里练习和学习
                               |
  带着更聪明的行为回来  <----------------
  (然后重复)

在这里,我们可以看到智能体只花少量时间在真实环境中收集经验,而大部分学习发生在通过想象的世界模型内部。这就是为什么 Dreamer 风格的智能体可以在使用很少真实世界交互的情况下学习复杂的行为。它们在模型内部进行规划和练习,这正是我们刚刚学到的样本高效思想。

所以,Dreamer 智能体是在世界模型内部规划和学习的一个清晰、真实的例子。

世界模型与预测未来

让我们暂停一下,注意一直位于我们学到的一切中心的一个简单思想。

世界模型,在其核心,是一个预测未来的机器。给定我们现在在哪里以及我们接下来做什么,它告诉我们之后会发生什么。

这正是我们人类在世界中行动的方式。在我们过马路之前,我们预测车辆会在哪里。在我们把球扔给朋友之前,我们预测他们会站在哪里。我们不断地在运行一个对未来不久的预测,并根据那个预测采取行动。

世界模型赋予了 AI 这份礼物。当 AI 能够预测未来时,它就可以进行规划。它可以想象每个动作会通向哪里,然后选择导致最佳结果的动作。

所以,预测未来的能力是这里的真正超能力。其他一切——潜在状态、推演、Dreamer 循环——都建立在这个能力之上。

这就是预测未来如何转化为智能行为。

现实世界中的世界模型

现在,让我们看看世界模型在实际系统中的用途。

世界模型被用于几个重要领域。

第一个是强化学习和游戏。正如我们所学到的,智能体不是完全通过缓慢的试错在真实游戏中学习,而是学习一个游戏的世界模型,然后在其内部练习。这使得它在掌握游戏时使用更少的真实游戏步骤。Dreamer 风格的智能体已经通过这种方式学会了玩许多不同的游戏。

第二个是机器人学。真实机器人速度慢、成本高且易损坏。世界模型让机器人可以在实际执行之前想象其动作的结果,这样它就可以在想象中安全练习,只在现实世界中执行好的动作。这使得学习更加安全,并且样本效率高得多。

第三个是自动驾驶与规划系统。驾驶系统可以使用世界模型来想象周围交通在未来几秒内将如何移动。通过预测这些未来,它可以在承诺执行之前规划一条安全路径。

第四个是视频生成。这个联系很美。生成视频的模型学习场景如何从一个帧变化到下一个帧,这与预测环境的下一个状态是同一类技能。因此,现代视频生成模型和世界模型是密切相关的,因为它们都在学习世界如何随时间展开。我们有一篇详细的关于扩散模型的博客解释了许多这些视频生成模型实际生成帧的原理。

但在这里我们必须小心。并非每个视频生成器都是完整的世界模型。一个普通的视频生成器只是以看似合理的方式继续视频,而我们并不告诉它我们要采取哪个动作。一个真正的世界模型是动作条件的,这意味着我们可以问它“如果我采取这个动作,接下来会发生什么?”所以最紧密的联系是与那些将我们的动作作为输入并展示接下来发生什么的交互式视频模型。这些动作条件的视频模型才是真正的世界模型。

所以,任何地方只要 AI 需要理解环境如何变化并提前规划,世界模型都能极大地帮助我们。

这就是世界模型的工作原理。AI 学习其环境的内部模拟器,将看到的内容压缩成一个小的潜在状态,然后在该模型内部想象许多可能的未来,以决定做什么,在确信之前都不会接触真实世界。当学习到的模型足够准确时,这使得学习比原始试错更快、更便宜、更安全、样本效率更高。而当模型还不准确时,AI 只需返回真实世界,收集更多一点经验,再次改进模型。

  • 原文链接: outcomeschool.com/blog/h...
  • 登链社区 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~

相关文章

0 条评论