第 16 章 世界模型
第16章 世界模型
16.1 世界模型概述
世界模型(World Model)是指能够理解、预测和模拟物理世界动态的计算模型。与纯粹的语言模型不同,世界模型不仅 理解文字描述的世界,更能内化物理规律(因果、运动、遮挡、碰撞)、模拟环境变化(物体位移、流体流动、光照变化) 并预测行动后果(执行某动作后环境如何变化)。这一研究方向标志着 AI 从语言智能迈向世界智能的关键跨越。 从形式化角度看,一个世界模型 W 是一个时态映射函数,给定历史观测 o 和可选动作 a ,预测未来的观测分布: 1:t 1:t ot+1:t+H ∼ W(⋅ ∣ o1:t , a1:t ) 其中 H 为预测时域(Prediction Horizon)。与语言模型中 P (token t+1 ∣ token1:t ) 的结构高度类似,世界模型本质上是将 自回归预测从离散符号空间扩展到了高维感知空间。
16.1.1 从语言模型到世界模型
语言模型向世界模型的延伸遵循四条技术路线,它们在 2024-2026 年间不同程度地取得了突破,其汇聚关系如图 16-1 所 示。
- 视频生成即世界模型 OpenAI Sora(2024)的发布标志着这一路线的里程碑。研究者发现,大规模视频生成模型在生成连贯视频时隐式地学习 了物理世界的规律:物体恒存性(Object Permanence)、遮挡关系、刚体运动、流体动力学等。Sora 的核心洞察是,如 果模型能生成物理上合理的视频,它的内部表示就构成了一个隐式的世界模型。 随后,NVIDIA Cosmos 系列(2025-2026)将这一思路系统化,显式构建用于 Physical AI 的世界基础模型,涵盖文本到 视频、图像到视频、视频预测和动作条件生成等多模态能力。
- 强化学习中的世界模型 2018 年 Ha & Schmidhuber 的奠基性工作《World Models》提出,智能体可以先学习环境的压缩表征,再在表征空间中 做梦(Dream)来规划行为。Dreamer 系列(DreamerV1 2020、DreamerV2 2021、DreamerV3 2023)通过潜变量动 力学模型(Latent Dynamics Model)实现了从像素到动作的端到端世界模型学习,在 Atari、DeepMind Control Suite 和 Minecraft 上达到顶尖性能。 这条路线直接启发了策略与世界协同训练思想,并在 2026 年的多篇论文中被发展为语言 Agent 的核心训练范式。
- 自动驾驶中的神经仿真器 自动驾驶是世界模型最苛刻的应用场景,它要求模型不仅理解物理世界,还要以实时速度(不低于 30Hz)、照片级真实感 和物理精确性来模拟驾驶环境。NVIDIA OmniDreams(2026)率先实现了实时闭环自动驾驶世界模型,将传统图形管线 仿真与神经渲染结合,在 NVIDIA DRIVE 平台上部署。
- 世界-语言-动作统一 2025-2026 年的另一趋势是将世界模型、语言理解和动作执行统一到同一个架构中。WALL-WM(2026)提出在世界模型 的事件节点上雕刻动作理解,World-Language-Action Model(2026)则展示了三合一架构零样本泛化到新机器人环境 的能力。这标志着从看见到行动的端到端范式的确立。 Language Model Video Generation World Model for RL Neural Simulator World-Language-Action U Sora, Cosmos Dreamer OmniDreams nified WALL-WM
Implicit Physics Understan Planning and Exploration Real-time closed-loop sim End-to-end Perception-De ding ulation cision-Action Physical AI 图16-1 从语言模型到世界模型的四条技术路线
16.1.2 世界模型的分类体系
按功能定位和学习范式,世界模型可以沿三个维度分类。 按输出模态分类: 类型 描述 代表工作 输入 输出 预测型世界模型(Predictive 预测未来状态/观测 DreamerV3, STORM 历史观测 + 动 未来状态/奖励 WM) 作 生成型世界模型(Generative 生成逼真的未来场景 Sora, Cosmos 3, Gen-3 文本/图像/视频 高保真视频 WM) 具身世界模型(Embodied 含动作控制的交互式世界 OmniDreams, UniSim 传感器 + 动作 传感器 + 规划 WM) 模拟 轨迹 统一型世界模型(Unified 多模态/多用途一体化 World-Language-Action, 文本 + 图像 + 文本 + 视频 + WM) WALL-WM 动作 动作 表16-1 世界模型按输出模态的四分类体系 这四类模型并非互斥,2026 年的趋势正是从单一类别向统一类别收敛。例如 Cosmos 3 同时具备生成型和具身型能力, WALL-WM 则试图统一所有四类。 按学习范式分类: •无监督世界模型:仅从观测数据学习动力学,不依赖动作和奖励标签。代表方法包括 VideoGPT(基于 VQ-VAE 的视频 自回归)与掩码视频重建。这类模型的优势在于数据获取成本低,但无法直接用于决策和控制任务。 •自监督世界模型:利用对比学习、掩码重建等自监督信号学习表征。Sora 的视频补丁重建即属此类,通过随机掩码部 分时空补丁并训练模型重建被掩码的内容,模型隐式地学习了时空连续性、物体恒存性和物理因果关系。 •强化学习世界模型:在 RL 循环中联合学习世界模型和策略。Dreamer 系列是这一范式的典型代表,世界模型预测奖励 和下一状态,策略在世界模型的想象中优化(Latent Imagination)。这种闭环学习方式使策略无需大量真实交互即可 提升样本效率。 •规划型世界模型:利用世界模型进行显式的多步推演和搜索。MuZero 将 MCTS 与世界模型结合,不是直接模拟执行动 作,而是在世界模型的潜空间中进行蒙特卡洛树搜索,找出最优动作序列。2025 年的 EfficientZero 进一步提升了样本 效率,仅需 2 小时的游戏时间即可在 Atari 上达到人类水平。 按建模粒度分类: •像素级世界模型:直接在原始像素空间建模动力学,优势在于感知保真度高,不丢失任何视觉细节,但计算成本极大, 预测一帧 512×512 的 RGB 图像需要处理 786,432 个像素。代表工作包括 SVG(Stochastic Video Generation)和 FitVid。 •潜变量世界模型:在压缩潜空间建模动力学,计算高效(潜空间维度通常为 d = 32 ∼ 1024),但压缩可能导致细粒度信 息丢失,如微小物体的运动、精细纹理的变化。RSSM(Dreamer 的核心)即为此类。 •混合世界模型:在潜空间建模动力学,在像素空间渲染,这是当前的主流方案。编码器将高维图像压缩到低维潜空间, 动力学模型在潜空间中推演状态演化,解码器将潜状态渲染回像素空间。DreamerV3 和 Cosmos 3 均采用此混合架 构。
16.1.3 历史演进脉络
世界模型的研究可追溯至更早的起源,其发展脉络深刻影响了 2024-2026 年的爆发: •1990 年代:内部模型假说(Internal Model Hypothesis)。神经科学研究发现大脑中存在预测编码(Predictive Coding),神经元不仅对外部刺激做出反应,更持续地预测即将到来的刺激,并对预测误差(Prediction Error)做出 反应。这一发现奠定了世界模型的生物学基础。 •2015 年:DRAW(Deep Recurrent Attentive Writer)。DeepMind 的 DRAW 模型首次将注意力机制与循环生成结合, 通过逐步关注画布的局部区域来生成图像。DRAW 虽未直接以世界模型命名,但其潜空间反复推演、逐步生成的机制直 接启发了后续 RSSM 的设计。 •2018 年:Ha & Schmidhuber《World Models》。这篇奠基性论文首次以世界模型为名提出完整框架:VAE 编码视觉观 测为潜状态 z ,MDN-RNN 预测下一步的 z ,线性控制器在潜空间中学习策略。在 CarRacing 和 VizDoom 上的成功 证明了在想象中学习的可行性。 t t+1 •2020-2023 年:Dreamer 系列。将世界模型从玩具级任务(CarRacing)扩展到通用任务(Atari、DMC、 Minecraft),实现了无需调参的跨任务泛化。 •2024-2026 年:世界基础模型(World Foundation Model)。Sora、Cosmos 3、Gen-3 等大规模视频生成模型的涌现 标志着世界模型进入基础模型时代,不再是针对特定任务训练的小型模型,而是在互联网规模数据集上预训练的通用世 界理解引擎。
16.1.4 语言模型的世界盲区
LLM 的世界盲区在 2024-2025 年间被多项研究系统揭示: •物理常识缺失:即使是前沿旗舰模型也常犯物理常识错误,如预测物体抛射轨迹、判断堆叠物体的稳定性、理解容器倾 倒逻辑。PhysicalBench(2025)对当时旗舰 GPT-4o 的测试显示,其物理常识推理得分仅为 52.3%,而人类为 94.7%。 •因果关系混淆:LLM 习惯于在文本相关性上建模,而非因果结构。当任务要求区分“因为 A 所以 B”和“A 与 B 同时发 生”时,LLM 的因果判别准确率显著低于专用因果推断模型。 •具身推理缺失:“把左手边的红色方块放到右手边的蓝色碗里”,这类指令对 LLM 来说可以解析,但无法内化为空间关 系和动作序列。世界模型可以在 3D 潜空间中想象这一动作的过程,验证可行性后再转化为执行方案。 •时态一致性不足:LLM 生成视频或长篇叙事时,难以维持物体恒存性、空间一致性和因果链,而这些恰是世界模型的 核心能力。 各项能力的落差汇总如表 16-2 所示。 能力 LLM 表现 表现本质 统计相关性 极强 文本共现统计是 AI 所长 逻辑推理 强(在训练覆盖范围内) 模式匹配伪装成推理 物理直觉 弱 缺乏具身体验 空间推理 弱(纯文本),强(多模态 VLM) 视觉信息是关键补充 时间因果 弱 文本难以传导因果方向 反事实推理 极弱 没有世界模型支撑 表16-2 LLM 能力表现与本质 统计相关性之外的短板在反事实问题上暴露得最彻底。当被问“如果一个苹果从树上落下,落地前 0.1 秒它的速度如 何”,LLM 可以正确计算,本质是检索自由落体公式的模式匹配。但当被问“如果地球引力突然变为原来的两倍,苹果落 地的声音会变大吗”,回答质量大幅下降,因为这需要理解从重力到速度、冲击力再到声压的完整因果链,而非检索预存 的公式。 世界模型填补这些空缺的方式,是为 LLM 推理提供环境先验: PLLM+WM (y ∣ x) = ∫ PLLM (y ∣ x, w) ⋅ PWM (w ∣ x) dw w 其中 w 是世界模型提供的隐式物理表征,作为 LLM 推理的环境先验,将物理常识内化到推理过程中。
16.1.5 与相邻领域的关系
- 与视频生成的关系 视频生成模型(Sora、Kling、Gen-3)在生成连贯视频时自然形成了隐式世界模型,但显式世界模型具备三点优势: •可控制生成条件,包括动作、视角与物理参数; •物理一致性可通过损失函数显式约束; •支持闭环交互,生成的下一帧可作为下一轮预测的输入。 两者的关系可以形式化为一个光谱:左端是纯视频生成,仅追求视觉质量而不关心物理正确性;右端是纯物理模拟,追求 物理精度而不惜牺牲视觉质量和速度。世界模型位于光谱的中间: VideoGenpure 视觉质量优先 WorldModel 物理精度优先 PhysicsSim balanced pure Cosmos 3 等世界基础模型正是向这一光谱的中右侧设计,在保持视觉质量的同时显式优化物理一致性。
- 与具身智能的关系 世界模型是具身智能(Embodied AI)的核心组件。具身智能体需要在物理世界中感知、规划和行动,世界模型提供了内 部模拟器,允许智能体在行动前于脑海中预演各种可能的结果。RT-2、Octo、π0 等工作已将世界模型内化到机器人控制 策略中。 具身智能领域中世界模型的关键应用模式包括: •动作前验证(Pre-Action Verification):在物理执行之前,在世界模型中模拟动作的后果,评估其安全性和可行性。 •模型预测控制(Model Predictive Control, MPC):利用世界模型推演未来 H 步的状态,优化当前动作的选择。 •Sim-to-Real 迁移:在世界模型中仿真训练策略,再部署到物理机器人,降低真实环境交互的成本和风险。
- 与自动驾驶的关系 自动驾驶是世界模型的终极测试场,其特殊性体现在四个方面: •极高的安全要求,物理预测错误可能导致事故; •30 至 60Hz 的实时性约束; •相机、激光雷达、雷达的多传感器融合; •与其他车辆、行人、骑行者的多智能体交互。 OmniDreams 是首个同时满足这些约束的实时世界模型。
- 与数字孪生的关系 世界模型可视为数字孪生(Digital Twin)的神经实现。传统数字孪生需要人工构建高精度 3D 模型并进行物理参数校 准,而世界模型从数据中自动学习这些表示。两者互补:数字孪生提供物理精确的基准数据用于世界模型训练,世界模型 则提供实时、可泛化的仿真推理能力。
16.1.6 核心挑战
世界模型的核心挑战集中在五个方面:
- 长期一致性(Long-Horizon Consistency):随预测步数增加,误差指数级积累。典型世界模型在超过 50 步预测后, 累积误差使预测质量急剧退化。这一挑战的数学本质是误差传播的 Lyapunov 不稳定性: ∥δst ∥ ≈ ∥δs0 ∥ ⋅ eλt 其中 λ 为系统的最大 Lyapunov 指数。对于混沌动力学系统,λ > 0 意味着初始微小误差随时间指数放大。世界模型必 须学习将 λ 降至接近零的表示,即学习一个稳定化映射(Stabilizing Transformation)。
- 物理精度与计算效率的权衡:精确物理模拟(如基于 Navier-Stokes 方程的流体模拟)计算成本极高,单帧 CFD 模拟 可能需要数分钟;高效近似(如潜空间动力学)则牺牲精度。这一矛盾在实时应用中尤为尖锐,自动驾驶要求低于 33ms 的帧预算,远低于物理模拟的计算需求。解决方向包括多尺度建模(粗粒度动力学加细粒度渲染)、神经加速物 理引擎(Physics-Informed Neural Networks, PINN),以及自适应精度,即在关键区域使用高精度预测,在非关键区 域使用粗粒度预测。
- 可控制性(Controllability):世界模型需要准确响应输入动作(如转向、加速),而非生成无关联的场景变化。控制信 号与视觉变化之间的因果关系是学习中最容易被破坏的环节,模型可能学会忽视动作条件,仅基于历史帧外推未来,在 视觉指标上得分很高但在控制意义上完全失败。这需要专门的可控性损失(Controllability Loss),如最大化动作与生 成变化之间的互信息 I(a ; o^ )。 t t+1
- 分布外泛化(Out-of-Distribution Generalization):训练环境与部署环境的分布偏移是世界模型的核心瓶颈。例如, 在训练中未出现过的天气条件或道路类型下,模型预测的物理动力学可能完全崩溃。应对手段包括域随机化(Domain Randomization),训练时系统性地变化天气、光照、纹理等环境参数;以及不变性学习(Invariant Learning),鼓励 模型学习跨域不变的物理规律表征。
- 多模态对齐:语言描述、视觉观测、动作信号之间的语义对齐是统一世界模型的根本难题。“拿起红色杯子”的语言描 述、杯子被手抓起的像素变化、机器人执行的关节力矩序列,必须映射到相同的语义空间。最先进的方案采用对比语 言-视觉-动作预训练(Contrastive Language-Vision-Action Pretraining),将 CLIP 的思想扩展到三个模态。
16.1.7 关键术语对照
世界模型领域术语繁多,表 16-3 汇总了核心术语及其在本章中的含义。 术语 英文 含义 世界模型 World Model 能理解、预测和模拟物理世界动态的计算模型 潜动力学 Latent Dynamics 在压缩潜空间中建模的状态演变规律 推演 Rollout 世界模型从当前状态出发,反复应用动力学模型 H 步以预测未来状态序列 想象 Imagination 在世界模型的潜空间中推演,无需与实际环境交互 闭环仿真 Closed-Loop Simulation 世界模型生成的动作反馈被用作下一轮预测的输入,形成“感知→预测→行动→感 知”的完整环路 物体恒存性 Object Permanence 物体在离开视野后返回时仍保持原属性和存在性 有效预测时 Effective Prediction 世界模型预测误差超过可接受阈值时的推演步数 域 Horizon 物理一致性 Physical Consistency 模型预测的动力学行为与真实物理定律的吻合程度 协同训练 Co-Training 策略模型和世界模型在共享表征下联合优化的训练范式 事件节点 Event Joints 世界状态发生显著变化的离散时间点(WALL-WM 的核心概念) 表16-3 世界模型领域核心术语对照
16.2 生成式世界模型的数学
生成式世界模型(Generative World Model)的核心数学问题是:给定历史观测序列 o 和动作序列 a (可选),学习 1:t 1:t 一个能够生成未来观测 o^ 的模型,使得生成分布 p(o^ ∣ o , a ) 尽可能接近真实物理世界的分布。本节系统 1:t 1:t 阐述这一问题的数学基础,聚焦于状态空间模型、变分推断框架、Dreamer 系列的系统演进和扩散/自回归两大生成范 t+1:t+H t+1:t+H 式。
16.2.1 状态空间模型的形式化
世界模型通常建立在状态空间模型(State-Space Model, SSM)之上。SSM 假设观测 o 由一个低维潜状态(Latent State)s 决定,而潜状态按马尔可夫动力学演化: t t 潜状态动力学(Latent Dynamics): st ∼ p(st ∣ st−1 , at−1 ) 观测模型(Observation Model): ot ∼ p(ot ∣ st ) 奖励模型(Reward Model,可选): rt ∼ p(rt ∣ st ) 这一结构将世界模型分解为三个子问题: •表示学习:从观测 o 推断状态 s; •动力学学习:学习潜状态的转移规律; •生成与重建:从潜状态生成观测。 在实践中,潜状态 s 通常被进一步分解为随机分量(Stochastic) z 和确定性分量(Deterministic) h : t t t st = (zt , ht ) 其中 h = f (h , z , a ) 通过 RNN/GRU 等序列模型更新,z 则建模为从先验分布中采样: t ϕ t−1 t−1 t−1 t z t ∼ p ϕ (z t ∣ ht ) Inference Path o_{t-1} Encoder z_{t-1} a_{t-1} GRU h_t Deterministic state h_t Generation Path z_t ~ p(z_t|h_t) h_{t+1} Decoder ô_t 图16-2 典型 RSSM 结构,潜状态分解与信息流
16.2.2 变分世界模型
RSSM(Recurrent State-Space Model)是 Dreamer 系列的基础架构。它将 VAE(Variational Autoencoder)的变分推 断框架扩展到时间序列场景。 设 o , a 为观测和动作序列,z 为潜变量序列。则联合分布为: 1:T 1:T −1 1:T T p(o1:T , z1:T ∣ a1:T −1 ) = ∏ p(ot ∣ zt ) ⋅ p(zt ∣ zt−1 , at−1 , ht ) t=1 其中先验 p(z ∣ z , a , h ) 仅基于历史状态和动作,不看到当前观测。 t t−1 t−1 t 变分后验(还看到当前观测以辅助推断)为: q(zt ∣ zt−1 , at−1 , et , ht ) 其中 e = Encoder(o ) 为当前观测的编码。 t t 训练目标为 ELBO(证据下界): T LRSSM = Eq ∑ log p(ot ∣ zt ) − DKL (q(zt ∣ … , et ) ∥ p(zt ∣ … )) t=1 重建损失 KL 正则化 T = ∑ [ ln p(ot ∣ zt )] − β ⋅ DKL (qt ∥pt ) t=1 β控制潜信息瓶颈(Information Bottleneck)的强度:β > 1 鼓励更压缩的表示(类似 β-VAE),通常取 β = 0.1 到 1.0 之间以平衡重建质量和动力学学习。
16.2.3 Dreamer 系列的架构演进
Dreamer 系列代表了基于 RSSM 的世界模型研究的系统化推进: DreamerV1(2020):引入 RSSM 架构,在潜空间中通过 Actor-Critic 方法学习行为策略。核心创新是“潜想象(Latent Imagination)”,即在潜空间中展开未来状态的推演,无需实际与环境交互: V (st ) = Eq [∑ γ τ −t rτ ] t+H τ =t 其中 r 为世界模型预测的奖励,推演步长 H = 15。 τ DreamerV2(2021):将 RSSM 中的随机变量从高斯分布改为分类分布(Categorical Distribution),并引入 Straight- Through 梯度估计。这一改进带来三重收益:
- 离散潜空间天然适合表示状态间的尖锐边界(如碰撞/未碰撞);
- 分类分布的 KL 散度可精确计算(无需高斯的蒙特卡洛近似);
- Straight-Through 使得梯度可无偏地穿过离散采样。 DreamerV3(2023):实现了无需调参的通用世界模型——同一套超参数在 Atari 100k(小规模)、DeepMind Control Suite(中规模)和 Minecraft(大规模开放世界)上均取得顶尖性能。核心创新: •Symlog 变换:将跨度极大的奖励/观测值映射到对称对数空间: symlog(x) = sign(x) ⋅ ln(∣x∣ + 1)
•Free Bits KL 正则化:仅在 KL 散度超过阈值 τ 时才施加 KL 惩罚: LKL = max(0, DKL − τfree ) •RSSM 的并行训练:将序列拆分为长度为 L 的片段(Chunk),每片段起始状态由前一片段末尾的状态采样初始化,实 现 mini-batch 内的并行化。 版本 年份 潜变量类型 核心创新 代表性性能 DreamerV1 2020 高斯 Latent Imagination DMC: 823 分 DreamerV2 2021 分类 Straight-Through 离散化 Atari 50M: 人类水平×2 版本 年份 潜变量类型 核心创新 代表性性能 DreamerV3 2023 分类 Symlog + Free Bits Minecraft: 首个采集钻石 表16-4 Dreamer 系列的架构演进对比
16.2.4 扩散世界模型
扩散模型(Diffusion Models)为世界模型提供了另一种生成范式。其核心思想是将世界动力学建模为一个条件去噪过 程: 前向扩散过程: (k) (k−1) (k) (k−1) q(ot ∣ ot ) = N (ot ; 1 − βk o t , βk I) 其中 k = 1, … , K 为扩散步数。 反向(去噪)过程,条件于历史: pθ (o(k−1) t (k) (k−1) ∣ ot , ct ) = N (ot (k) ; μθ (ot , k, ct ), Σθ ) 其中条件 c 编码了历史观测和动作信息 c = f (o t t ϕ 1:t−1 , a1:t−1 ) 。 训练目标为简化的去噪分数匹配: Ldiffusion = Et,k,ϵ [∥ϵ − ϵθ (o(k) t , k, ct )∥ ] 其中 ϵ ∼ N (0, I) 为添加的噪声,ϵ 为预测噪声的网络。 θ 扩散世界模型相对于 RSSM 的优势: •更高质量的可视化输出:扩散模型擅长生成高保真图像/视频; •天然的多样性:采样过程 o ∼ p (o ∣ c) 自然产生多样化的未来轨迹; θ •条件控制的灵活性:可通过 Classifier-Free Guidance 调节生成与条件的一致性。 其代价是推理速度较慢(需 K = 50 ∼ 1000 步去噪),难以满足实时闭环控制的需求。Cosmos 3 通过蒸馏步数压缩和流 匹配(Flow Matching)部分缓解了这一问题。
16.2.5 自回归世界模型
自回归世界模型将视频生成视为 token 序列预测问题。核心思路是将视频帧分块(Patchify),将空间-时间补丁转化为离 散 token,然后以自回归方式逐 token 预测: N P (v ∣ c) = ∏ P (tokeni ∣ token<i , c) i=1 其中 v 为目标视频,c 为条件信息,N 为 token 序列长度。 时空补丁化(Spatiotemporal Patchification)是自回归世界模型的关键操作: ′ ′ ,H ,W {patcht,h,w }Tt=1,h=1,w=1 = Patchify(v1:T H×W ) 每个补丁的尺寸通常为 p × p × p = 1 × 16 × 16 或 2 × 16 × 16,补丁数量 N = T × × 。 t h w H ph W pw 训练目标为标准的交叉熵: N LAR = − ∑ log P (tokeni ∣ token<i , c) i=1 自回归世界模型的优势在于其与 LLM 训练框架的高度兼容性(共享 Transformer 架构、训练流程和推理基础设施),主要 劣势是推理延迟与序列长度线性增长。 特性 RSSM 世界模型 扩散世界模型 自回归世界模型 数学基础 变分推断 + 序列建模 随机微分方程 + 分数匹配 自回归概率分解 推理速度 快(单步前向) 慢(K 步去噪) 中等(Causal Attention) 视觉质量 中等 高 高 物理精度 中等(受潜空间限制) 高(像素级建模) 高(像素级建模) 可控性 好(动作条件) 中(条件控制) 中(条件 token) 代表工作 DreamerV3, STORM Cosmos 3, Gen-3 Sora, VideoGPT 表16-5 三种世界模型范式的系统性对比
16.2.6 训练目标体系
世界模型的训练目标通常由多个损失项的加权组合构成: Ltotal = λ1 Lrecon + λ2 Ldyn + λ3 Lpred + λ4 Lcontrast + λ5 Lreg 重建损失(Reconstruction Loss) L :衡量模型从潜状态重建观测的能力: recon L = ∥o − o^ ∥ 或 LPIPS(o , o^ ) recon t t t t 动力学一致性损失(Dynamics Consistency) L :确保潜状态转移的物理一致性,两个相邻帧的潜状态差值应与重建 dyn 观测的差值一致: Ldyn = ∥Enc(ot+1 ) − Enc(ot ) − (st+1 − st )∥2 预测损失(Prediction Loss) L :衡量多步潜状态预测(Rollout)的累积误差: pred H Lpred = ∑ ∥Enc(ot+h ) − s^t+h ∥2 H h=1 其中 s^ 是通过反复应用动力学模型从 s 推演 h 步得到的状态。 t+h t 对比损失(Contrastive Loss) L :鼓励相同时刻的潜状态-观测对(正样本)相似度高于不同时刻的对(负样本): contrast
exp(sim(st , et )/τ )
Lcontrast = − log
=t exp(sim(st , et )/τ )∑t ′ ′ 对比损失在防止潜空间坍缩(Posterior Collapse)中效果显著:当模型倾向于忽略潜变量直接生成观测时,对比项强制 模型区分不同的时间点,使潜空间保持信息量。 正则化损失 L : reg •潜平滑(Latent Smoothness):∥s − s ∥ ; t+1 t •潜稀疏(Latent Sparsity):∥s ∥ ; t 1 •动作平滑(Action Smoothness):对动作序列的变分施加平滑先验 ∥a − a ∥ 。 t+1 t
16.2.7 评估指标体系
世界模型的评估是一个多维问题,需要从视觉质量、物理一致性、长时域与可控性、任务效能与计算效率四个维度综合考 量,单一指标无法涵盖其全部能力。
- 视觉质量 衡量生成的视频或图像是否真实、清晰、无伪影。主要指标包括 FVD(Fréchet Video Distance)、LPIPS(Learned Perceptual Image Patch Similarity)和人类偏好评分(Human Preference Score, HPS)。FVD 将 FID 推广到视频域, 衡量生成视频分布与真实视频分布之间的 Fréchet 距离。
- 物理一致性 这是世界模型独有的评估维度,传统的图像与视频生成模型并不评估物理正确性: •物体恒存率(Object Permanence Rate, OPR):在遮挡场景中,物体离开视野再返回后,模型是否保持了该物体的存 在性和属性。物理上 OPR 应为 100%。 •守恒定律违反率(Conservation Law Violation Rate, CLVR):能量、动量、质量在封闭系统中是否守恒。检测方法是 比较预测序列中守恒量的均值和方差偏移。 •因果评分(Causality Score):给定干预(如向场景中移除某物体),衡量模型预测与真实因果效应的一致程度: ∥Effectpred − Effecttrue ∥ Causality Score = 1 − ∥Effecttrue ∥
- 长时域与可控性 长时域准确性刻画推演误差随步数的增长: •推演误差曲线(Rollout Error Curve):Error(h) = ∥o − o^ ∥ 随 h 增长的曲线。正常世界模型的误差近似指数增 2 长,Error(h) ≈ α ⋅ e ,其中 β 越小越好。 t+h t+h
βh •有效预测时域 H :误差超过某个阈值 δ 时的推演步数,H = arg min {Error(h) > δ}。 eff eff h 可控制性刻画模型对动作条件的响应: •动作响应准确率(Action Response Accuracy, ARA):给定动作 a,模型生成的变化方向与预期方向的余弦相似度期 望: ∂o^ ∂o ARA = Ea [cos ( , )] ∂a ∂a •干预成功率(Intervention Success Rate):指定干预(如让红色球向左移动)后,预测视频正确反映干预的比例。 4) 任务效能与计算效率 任务效能是世界模型好不好的终极标准:比较仅真实交互训练与真实加想象训练的策略性能差距,如果世界模型的想象能 帮助智能体在真实环境中表现更好,那么它就是有效的。计算效率关注推理延迟、内存占用和能耗,对实时应用而言这些 指标与模型质量同等重要,评估方式是在目标硬件上测量端到端延迟、吞吐量和峰值功耗。 综合评分体系: WorldScore = w1 ⋅ FVD−1 + w2 ⋅ Heff + w3 ⋅ ARA + w4 ⋅ OPR 目前尚无公认的统一 WorldScore 标准,但各研究团队正逐步在这四个维度上建立共识。
16.3 Cosmos 3 全模态世界模型
NVIDIA Cosmos 3 是 2026 年发布的全模态世界基础模型(Omnimodal World Foundation Model),项目在 GitHub 上 获得 9.24k stars,标志着世界模型从学术研究向工业化部署的关键转折。Cosmos 3 的核心理念是“一个模型,理解一切 物理世界模态”——统一处理文本、图像、视频和动作信号,为 Physical AI(具身智能、自动驾驶、机器人)提供通用的 世界理解与生成能力。
16.3.1 设计哲学
Cosmos 3 区别于 Sora 等通用视频生成模型的设计哲学在于其 Physical AI 定位:模型不仅需要生成好看的视频,更需要 生成物理上正确的动力学行为,以支撑自动驾驶的感知-规划闭环、机器人的动作-反馈循环和工业数字孪生的实时仿真。 形式化目标: WCosmos3 (text, image, video, action, trajectory) → text, image, video, trajectory 这一万物到万物的映射覆盖了 Physical AI 的核心使用场景: •文本→视频:描述驾驶场景生成对应的传感器数据; •图像→视频:从单帧向前预测未来数秒的视觉变化; •视频→视频:视频扩展、视角变换、天气条件迁移; •动作→视频:给定控制指令,生成相应的视觉反馈; •视觉→轨迹:从场景理解直接输出运动规划。
16.3.2 统一全模态架构
Cosmos 3 的架构核心是一个模态自适应 Transformer(Modality-Adaptive Transformer, MAT),通过统一的 Tokenization 接口和模态特定的编解码器适配,在同一个 Transformer 骨干网络中处理所有输入输出模态。架构总览如 图 16-3 所示。 Input Modality Encoding Text Image Video Action Cosmos-VAE Encoder Cosmos-VAE Encoder MLP Projection T5-XXL Encoder (8×8×4 Spatiotemporal c (8×8×4 Spatiotemporal c (6-DoF -> d) ompression) ompression) Cosmos Core Transformer Unified Tokens DiT Block × 48 AdaLN-Zero + 3D RoPE Joint Attention Cross-modal Cross-Attenti on Output hidden state z ∈ ℝ ^{T×H×W×d} Output Modality Decoding Text head Cosmos-VAE Decoder Cosmos-VAE Decoder MLP head -> text tokens -> Image -> Video -> Action/trajectory 图16-3 Cosmos 3 统一全模态架构 关键架构设计包括四点:
- Cosmos-VAE:专为物理世界设计的视频自编码器,时空压缩率 8 × 8 × 4(宽 × 高 × 帧),将 256 × 256 × 16 帧的视 频压缩为 32 × 32 × 4 的潜 token。相比于标准 VAE,Cosmos-VAE 在潜空间中保留了高频纹理信息,这对模拟 LiDAR 点云和保持细粒度几何结构至关重要。
- DiT 骨干:基于 48 层 Diffusion Transformer Block,每层包含 AdaLN-Zero(自适应 Layer Norm,零初始化门控)和 3D Rotary Position Embedding(3D-RoPE),以建模时间维度的位置信息。
- 联合注意力(Joint Attention):在 Transformer 的中间层引入跨模态交叉注意力机制,使文本嵌入与视觉 token 实现 深度融合:文本描述关注的空间区域在注意力权重中获得加权,视觉 token 的语义被对齐到文本表征。
- 流匹配训练:采用连续归一化流(Continuous Normalizing Flow, CNF)中的条件流匹配(Conditional Flow Matching, CFM)作为训练目标,替代传统扩散模型的分数匹配: LCFM = Et,pt (x) [∥vθ (t, xt ) − (x1 − x0 )∥2 ]
其中 v 是学到的速度场,x = (1 − t)x + tx 。流匹配的优势在于允许更少的推理步数(通常 N = 20 ∼ 50,扩散模型 0 1 为 N = 100 ∼ 1000),这对自动驾驶等实时应用至关重要。 θ t 推理延迟通过蒸馏步数压缩进一步降低:训练一个学生模型,以仅 20 步的流匹配推演近似教师模型 100 步的生成质量。 蒸馏损失为: Ldistill = Ex0 ,t [∥xteacher 1 − xstudent 1 ∥2LPIPS ] 其中 LPIPS 作为感知损失,比 MSE 更忠实地衡量视觉质量。蒸馏后的 20 步模型在 FVD 指标上仅比 100 步教师模型低 3.2%,生成延迟从 2.0s 降至 500ms(Pro 版本)。
16.3.3 训练数据与一致性过滤
Cosmos 3 的训练数据涵盖从多个来源精心筛选的物理世界视频和合成数据,配比如表 16-6 所示。 数据来源 时长 特性 占比 真实驾驶视频(NVIDIA DRIVE 车队) 2.0M 小时 多传感器同步(8 相机 + LiDAR + Radar) 40% 机器人操作视频 500K 小时 第一人称视角、含动作标签 10% 开放域视频(经过物理质量过滤) 1.5M 小时 爬取 + 物理一致性评分筛选 30% Cosmos Reason 合成数据 1.0M 小时 3D 引擎渲染 + 物理模拟标注 20% 表16-6 Cosmos 3 训练数据配比 总计约 5M 小时的训练视频,约 10 tokens。15 物理一致性过滤(Physical Consistency Filter)是数据筛选的关键创新,使用预训练的物理推理模型对每段视频打分, 仅保留物理一致性得分高于阈值的数据。过滤器 PCF 是一个轻量级的二分类模型,对每段视频给出 [0, 1] 的物理合理性评 分,其训练方式为:
- 正样本:从 NVIDIA DRIVE 真实驾驶数据中截取的视频片段,天然物理一致;
- 负样本:通过随机扭曲正样本生成的物理矛盾视频,如物体突然消失、违反重力、碰撞无反应等。 PCF 的输入为视频的时空特征,输出为物理一致性概率: PCF(v) = σ (fPCF (ST-ViT(v)))
其中 ST-ViT 为时空视觉 Transformer。训练后的 PCF 在与人类物理学家标注的一致性分数上达到 r = 0.87 的 Spearman 相关性。数据筛选中仅保留 PCF(v) > 0.7 的视频,过滤掉了约 42% 的原始爬取视频,这一高过滤率说明互联网视频的物 理一致性远低于普遍预期。
16.3.4 五大核心能力
- 文本到视频生成 给定自然语言驾驶场景描述,生成高保真多视角视频。例如输入提示“A rainy night in Tokyo, pedestrians crossing Shibuya intersection, wet road reflections, 8-camera surround view”,Cosmos 3 生成 8 个同步的相机视角视频。物 理约束包括: •各相机间的外参一致性,同一物体在不同相机视角的位置一致; •雨滴的光学折射和反射物理建模; •行人运动轨迹的横穿速度限制。 生成过程可形式化为:给定文本提示 t 和可选的相机外参 e , … , e ,通过流匹配迭代去噪: 1 x(k−1) = x(k) − Δt ⋅ vθ (k, x(k) , Enc(t), {Enc(ei )})
其中 Δt = 1/K 为步长,K = 20(Pro)或 K = 50(Ultra)。多相机一致性通过在外参嵌入上施加交叉注意力实现,每个 相机视角的 token 仅关注与之对应的外参嵌入,但所有视角共享底层去噪网络。 2) 图像到视频预测 从单帧或多帧历史预测未来视频,这是评估世界模型是否学会物理动力学最核心的能力。Cosmos 3 支持两种模式: •开环预测(Open-Loop):给定前 T = 4 帧,自回归地生成后 T = 120 帧,误差随推演步数累积。 ctx pred •滑动窗口预测(Sliding Window):每生成 W = 8 帧,将生成的帧追加到上下文并重新编码,以最新 T 帧作为条件 ctx 预测后续,将有效预测时域从 120 帧扩展到约 300 帧。 Cosmos 3 在 4 秒预测时域(约 120 帧 @ 30fps)上保持结构一致性,物体恒存率高于 94%;滑动窗口模式下 H 可达 eff 187 帧(约 6.2 秒),为当前所有开放基准上的最优结果。 3) 动作条件生成 输入动作(方向盘转角、油门、刹车、机器人关节力矩等),生成对应的视觉反馈,回答“如果我左转 30 度,下一帧会看 到什么”。这是 Cosmos 3 区别于所有其他视频生成模型的标志性能力。 动作编码为 6-DoF 向量 (v , v , v , ω , ω , ω )(线速度加角速度),通过可学习的 MLP 投影为动作 token a ∈ R ,插入 token d 到去噪 Transformer 的条件 token 序列中: x y z x y z t x(k−1) = x(k) − Δt ⋅ vθ (k, x(k) , Enc(t), {atoken ) T }t=1 pred t 动作条件生成的质量用动作响应准确率(Action Response Accuracy, ARA)衡量,Cosmos 3-Pro 达到 0.91,意味着在 91% 的情况下,动作条件的施加方向和生成视频中的运动方向一致。 4) 跨域迁移 将晴朗白天的驾驶视频转换为雨夜场景,或反之。这依赖于 Cosmos-VAE 潜空间的解耦表示,天气、光照、纹理等域特 定因素被编码在可操作的潜方向上。 跨域迁移通过潜空间插值(Latent Interpolation)实现: ztarget = Enc(vsource ) + α ⋅ (zˉtarget_domain − zˉsource_domain ) 其中 zˉ 为目标域的平均潜编码(在 Cosmos-VAE 的潜空间中计算),α 为迁移强度。解码 z domain target 即得到域迁移后的视 频。Cosmos 3 在 10 个天气和 5 个时间段的域迁移任务上(共 50 种组合)FID 均值为 28.3。 5) 多传感器仿真 同时生成相机图像、LiDAR 点云和 Radar 距离-多普勒图,三者在潜空间中共享同一世界状态: (Camera, LiDAR, Radar)t = D(st ) 其中 D 是传感器特定的解码器分支。传感器一致性通过跨传感器感知一致性损失确保: Lcross = ∥MF(Camerat ) − MF(LiDARt )∥ + ∥MF(Camerat ) − MF(Radart )∥ 其中 MF(Matched Features)为在共享世界坐标中匹配的特征。如果相机图像中检测到 x 米处有一辆车,LiDAR 和 Radar 输出也必须在相同位置有对应的响应。传感器一致性测试中,Cosmos 3 的跨模态定位误差均值为 0.32m,满足 L2 级自动驾驶仿真需求。
16.3.5 物理一致性评估
Cosmos 3 引入了系统化的物理一致性评估基准,超越传统视频生成模型的 FVD/IS 指标,结果如表 16-7 所示。 评估维度 指标 Cosmos 3-Pro 得分 说明 物体恒存 OPR(%) 94.2% 在遮挡-重现场景中的物体保持率 运动学 VAE(m/s²) 0.08 预测加速度与真实值的平均绝对误差 刚体约束 RBD(%) 97.8% 刚体间距离保持恒定的帧比率 碰撞检测 CDR(%) 91.3% 碰撞预测的准确率(检测到碰撞÷真实碰撞) 光照一致性 LCS 0.91 光源方向与阴影方向的 Pearson 相关系数 流体定性 FQS(1-5) 4.2 人类评估者对水/烟/火模拟的打分 评估维度 指标 Cosmos 3-Pro 得分 说明 长期一致性 H (帧) eff 187 误差 < 阈值的有效推演帧数 表16-7 Cosmos 3 物理一致性评估结果
16.3.6 与同类模型的系统对比
表 16-8 将 Cosmos 3 与主流视频生成模型进行了系统对比。 维度 Cosmos 3-Pro Sora (OpenAI) Kling 2.0 (快手) Gen-3 Alpha (Runway) 参数规模 28B 未公开(估计 30-100B) 未公开 未公开 模态范围 文本+图像+视频+动作 文本+图像+视频 文本+图像+视频 文本+图像+视频 动作条件 原生支持 无 无 无 物理一致性 显式优化(OPR, RBD) 隐式涌现 隐式 隐式 多传感器 Camera+LiDAR+Radar 无 无 无 推理速度 150ms/frame(Pro) 约 2-10s/frame 约 1-5s/frame 约 3-8s/frame 闭环控制 支持(Nano/Mini) 无 无 无 开源程度 权重 + 代码开放 API only API only API only Physical AI 核心设计目标 通用生成 娱乐创作 影视制作 GitHub Stars 9.24k N/A N/A N/A 表16-8 Cosmos 3 与主流视频生成模型的系统对比 Cosmos 3 的核心差异化优势集中在四点: •原生动作条件支持,使模型可直接用于自动驾驶和机器人闭环控制; •多传感器联合仿真,超越纯视觉的视频生成; •物理一致性显式优化,而非依赖模型规模的涌现; •流匹配加速,满足实时控制的延迟要求。
16.3.7 规模变体与部署架构
Cosmos 3 提供从边缘到云端的全谱系规模变体,如表 16-9 所示。 变体 参数量 训练 FLOPs 推理延迟(单帧 512²) 适用场景 Cosmos 3-Nano 2.5B 8 × 10 21 50ms 边缘设备、实时机器人 Cosmos 3-Mini 7B 5 × 1022 150ms 桌面级自动驾驶仿真 Cosmos 3-Pro 28B 2 × 1023 500ms 云端高保真世界模拟 Cosmos 3-Ultra 85B 1 × 1024 2.0s 研究级、最高质量 表16-9 Cosmos 3 模型规模变体 Ultra 在推理时需要约 5 倍于 Pro 的去噪迭代步数,延迟显著更高。NVIDIA 推荐在闭环控制场景中使用 Nano 或 Mini, 仅在离线高保真数据生成中使用 Ultra。 Cosmos 3 部署在 NVIDIA 的 DGX Cloud + OVX 平台上,提供三个层次的 API,如图 16-4 所示:
- Cosmos Reason:高层推理 API,接受自然语言指令并返回多模态理解结果;
- Cosmos Generate:世界模型生成 API,支持文本到视频、图像到视频、动作到视频的多模态生成;
- Cosmos Sim:实时仿真 API,以 WebSocket 推送视频流和 LiDAR 点云,供自动驾驶和机器人闭环使用。 Cosmos Reason Ultra 85B Multimodal Understandin Offline Reasoning g Developer/User Cosmos Generate Pro 28B World Model Generation High-quality generation Mini 7B Real-time control ≤150ms
Cosmos Sim Real-time closed-loop sim ulation Nano 2.5B Edge deploy ≤50ms 图16-4 Cosmos 3 三层部署架构 三层架构使 Cosmos 3 既能服务于离线高保真生成场景(使用 Ultra),也能部署在车载设备上实现实时闭环仿真(使用 Nano/Mini 加 TensorRT-LLM 量化加速)。 Cosmos 3 代表了世界模型从生成好看的视频到理解物理世界的根本转折。其全模态架构、动作条件和物理一致性优化使 其成为 Physical AI 时代的第一个系统级世界基础模型。
16.4 OmniDreams 实时驾驶世界模型
NVIDIA OmniDreams(2026)是全球首个满足实时闭环自动驾驶仿真三大严苛约束(照片级真实感 + 物理精确性 + 实时 速度 ≥ 30Hz)的生成式世界模型。与离线世界模型(如 Cosmos 3-Ultra, Sora)不同,OmniDreams 必须在严格的时 间预算内完成世界状态的推演与渲染,这对架构设计、模型压缩和系统集成提出了极致要求。
16.4.1 问题定义
自动驾驶仿真长期面临一个不可能三角困境: Traditional Solution Graphics Engine OmniDreams Solution (Unreal/Unity) Real-time + physics No photorealism Hybrid Architecture Latent dynamics + neural r endering + hardware accel Photorealism eration All three Neural Rendering (NeRF/3DGS) Realistic No real-time + multi-senso r Physical Accuracy Real-time speed Real-Time ≥ 30Hz 图16-5 自动驾驶仿真的不可能三角与 OmniDreams 突破 传统方案的两难: •图形学引擎:CARLA、AirSim、NVIDIA DRIVE Sim 等。基于传统渲染管线,可以满足实时和物理精度要求,但缺乏照 片级真实感,合成图像与真实传感器数据之间存在显著的领域差距(Domain Gap),导致在仿真中训练的策略迁移到 实车时性能大幅下降。 •神经渲染方法:NeRF、3D Gaussian Splatting 等。能重建逼真的场景,但推理速度慢(NeRF 渲染一帧通常需要数 秒),且缺乏对物理动力学的显式建模,场景是静态的快照,而非动态演化的物理世界。 OmniDreams 的解决方案是将潜空间动力学建模(Dreamer 风格)与实时神经渲染(基于 TensorRT 优化的 3DGS 变体) 结合,并在 NVIDIA DRIVE 硬件平台上进行端到端加速。
16.4.2 核心架构
OmniDreams 的架构分为三个子系统:世界状态编码器、潜动力学引擎和传感器解码器,整体结构如图 16-6 所示。 Sensor Input (60Hz) 8×Camera LiDAR Radar Vehicle State 1920×1200 @ 30fps 300k pts/frame @ 20fps Range Doppler @ 15fps (Position/Velocity/IMU) World State Encoder Multi-camera ViT Encoder PointNet++ Encoder 1D-CNN Encoder MLP Encoder -> latent scene representat -> latent geometry represe -> latent velocity represent -> latent state representati ion z_s ntation z_g ation z_v on z_a Cross-modal Fusion Cross-Attention + gating Latent Dynamics Engine Lightweight RSSM (3-layer GRU, d=512) s_t s_th_t, s_t z_t s_t Sensor Decoder Camera Decoder LiDAR Decoder Radar Decoder Planning Module 3DGS rendering head Diffusion point cloud head MLP head -> control command a_t -> 8×Camera output -> LiDAR output -> Radar output 图16-6 OmniDreams 系统架构
- 世界状态编码器 编码器将多模态传感器流编码为统一的潜场景表示。设计要点: •多相机 ViT 编码器:将 8 个相机图像通过共享的 ViT-L/14 编码器嵌入后,在空间维度拼接并通过跨相机交叉注意力 (Cross-Camera Cross-Attention)融合为统一的鸟瞰图(BEV)潜表示。融合公式: C N 1 c zs =
∑ ∑ αc,i ⋅ vc,i C c=1 i=1 其中 α 为跨相机注意力权重,N 为第 c 个相机的 token 数。 c,i c •PointNet++ 编码器:将 LiDAR 点云编码为 1024 × d 的几何特征。为满足实时性,点云首先经过体素下采样(Voxel Downsampling, 体素大小 10cm)将点数从 300K 压缩至约 30K。 •时间注意力:各模态编码器包含时间注意力层(Temporal Attention),将当前帧编码与过去 K = 5 帧的历史编码进行 交叉注意力融合,捕获运动信息。 2) 潜动力学引擎 潜动力学引擎是 OmniDreams 的核心,它需要在 512 维的潜空间中模拟物理世界的动力学。关键设计决策: •轻量 RSSM:相比 DreamerV3 的深层 RSSM,OmniDreams 采用 3 层 GRU(隐藏维度 512),将动力学前向传播的延 迟控制在 5ms 以内(DRIVE Orin 上的测量值)。减少参数量的代价是潜空间的信息承载能力降低,这通过更细致的编 码器设计(多传感器融合 + 时间注意力)来补偿。 •确定性-随机分解:潜状态 s = [h ; z ],其中 h 为 512 维确定性状态(GRU 输出),z 为 64 维分类随机变量(32 类 × 32 分类分布),仅占 DreamerV3 潜变量的 1/4,以平衡表达力和速度。 t t t t t 3) 传感器解码器 解码器将潜状态映射回各类传感器输出: •相机解码器:基于 3D Gaussian Splatting(3DGS)的实时渲染头。关键在于将潜状态 s 映射为 3DGS 的参数(均 值、协方差、颜色、不透明度),再通过高效的 CUDA 光栅化器渲染为多视角图像。3DGS 的渲染速度天然适合实时应 t 用,在 GPU 上可达 30-60fps。 •LiDAR 解码器:采用条件扩散模型生成点云,但使用极少的去噪步数(K = 4)+ 一致性模型(Consistency Model) 加速。 •Radar 解码器:轻量 MLP 直接映射距离-多普勒张量。
16.4.3 训练策略
OmniDreams 的训练分三个阶段进行:
- 自监督表示学习 此阶段约消耗 100 GPU-days,在每个传感器模态上独立训练编码器-解码器(Autoencoder),目标为重建损失。此阶段 不涉及动力学,模型仅学会将传感器数据压缩到低维潜空间并重建。 LStage1 = ∥o − D(E(o))∥2
相机编码器采用逐通道训练策略:先在单个相机上训练 ViT 编码器 + 3DGS 解码器的重建,然后在多相机配置上联合微 调。这一策略避免了多相机重建中常见的视角遗忘(Viewpoint Forgetting),模型倾向于优先重建中心视角而忽略侧方 视角。 多相机联合微调的目标函数引入多视角一致性损失(Multi-View Consistency Loss): LMV = ∑ ∥Warp(o^i , oj ) − o^j ∥2 i,j∈overlap 其中 Warp(o^ , o ) 是将相机 i 的预测图像通过已知的相机外参投影到相机 j 的视角上得到的图像。这一损失强制相邻相机 在重叠区域的预测保持一致,这对消除全景拼接中的视觉断裂至关重要。 i j 2) 动力学学习 此阶段约消耗 200 GPU-days,冻结编码器,训练潜动力学引擎,给定连续帧的潜状态对 (s , s ) 和动作 a ,学习状态转 移函数: t t+1 t LStage2 = ELBO + λpred ⋅ ∥s^t+H − st+H ∥2 其中 H = 30(即 1 秒 @ 30fps)。这是最关键的训练阶段,动力学引擎必须学会预测未来大量帧的状态,同时保持物理一 致性。 动力学训练中一个关键的技术创新是动作增强(Action Augmentation):在训练时对输入的车辆控制命令施加微小的高 斯噪声 ϵ ∼ N (0, 0.05 ⋅ I),强制模型学习在不确定条件下进行鲁棒的状态预测。这种增强的本质是输入平滑性正则化: s^t+1 = fRSSM (st , at + ϵ) 在推理时不添加噪声,使模型的平滑行为自然优于训练时的噪声环境表现。 3) 闭环微调 此阶段约消耗 50 GPU-days,将学习到的世界模型与一个预设的规划模块(基于 Model Predictive Control, MPC)组成 闭环系统,进行端到端微调。此阶段的训练损失包括闭环推演误差: H LStage3 = ∑ ∥oreal h t+h − D(rollout (st , at:t+h−1 ))∥ h=1 闭环微调中的关键问题是策略利用世界模型的漏洞(Policy Exploitation),策略可能学会执行一些在仿真中看起来好但 在现实中不可能的动作(如违反物理极限的急转弯)。OmniDreams 通过物理约束正则化(Physical Constraint Regularization)来缓解: Lphys = ∑ max(0, ∣asteer,t ∣ − amax max steer ) + max(0, ∣aaccel,t ∣ − aaccel ) t 其中 a 和 a 是车辆物理可执行的最大转向角和加速度。 max steer max accel
16.4.4 系统优化
达到 30Hz(33ms 帧间隔)的严格时限需要对整个系统进行极致的工程优化: 优化技术 目标子系统 加速效果 说明 TensorRT-LLM 量化 Transformer 编码器 2.1× INT8 量化,精度损失 < 0.5% LPIPS 3DGS 合并渲染 相机解码器 8× 8 相机共享同一 3DGS 场景,单次渲染 体素下采样 LiDAR 编码器 10× 300K → 30K points,精度损失可忽略 步数压缩 LiDAR 解码器 6× 扩散去噪步数 K=20→4,配合一致性模型 CUDA Graph 预录制 全管道 1.3× 消除 kernel launch 开销 FP16 推理 全管道 1.7× 精度损失 < 1% MSE NVLink 多 GPU 协作 编码器+解码器 1.5× 编码器 GPU1,动力学 GPU2,解码器 GPU3 表16-10 OmniDreams 的系统优化技术汇总 在 28.3ms 的端到端延迟中,各子系统的耗时分布如表 16-11 所示。 子系统 延迟 占比 相机编码(ViT 前向) 8.1ms 28.6% LiDAR 编码(PointNet++) 3.2ms 11.3% 跨模态融合(交叉注意力) 2.5ms 8.8% 动力学前向(RSSM GRU) 4.8ms 17.0% 3DGS 渲染(8 相机) 6.3ms 22.3% LiDAR 解码(扩散 4 步) 2.1ms 7.4% 通信与调度开销 1.3ms 4.6% 表16-11 OmniDreams 各子系统延迟占比 相机的编码和渲染合计占延迟的 50.9%,是优化的重点。3DGS 合并渲染(8 相机共享同一场景)将相机渲染从 8×6.3ms = 50.4ms 直接压缩到 6.3ms,这是 OmniDreams 实现实时性能最关键的单点优化。 综合优化后,OmniDreams 在 NVIDIA DRIVE Thor 平台上达到: •端到端延迟:28.3ms(标准差 2.1ms) •帧率:稳定 35.3 fps •峰值功耗:175W(含 3 GPU) •内存占用:24.5 GB(共享) 28.3ms 包含了完整的世界模型推演,不仅包括下一帧的生成,还包括潜状态动力学 10 步推演(约 333ms 的真实世界时 间窗口),以满足规划模块的多步前瞻需求。
16.4.5 闭环评估
OmniDreams 的最终评价标准是闭环自动驾驶性能,即在世界模型的闭环仿真中训练出的驾驶策略迁移到真实世界后的 表现。 评估协议如表 16-12 所示:在 OmniDreams 模拟的闭环环境中训练一个基于 MPC 的驾驶策略(不接触任何真实世界数 据),然后直接部署到配备 NVIDIA DRIVE 平台的测试车辆上。 指标 仅仿真训练(OmniDreams) 实车数据训练 差距 车道保持偏差(cm) 12.4 ± 3.2 10.1 ± 2.8 -2.3 碰撞率(/千公里) 0.31 0.18 +0.13 路口通过成功率 94.7% 97.2% -2.5% 行人避让成功率 98.2% 99.1% -0.9% 平均车速(km/h,市区) 38.5 42.1 -3.6 表16-12 OmniDreams 仿真训练到实车迁移的闭环评估 OmniDreams 仿训策略的实车表现与纯实车数据训练策略之间的差距已缩小到约 2-3%——这在两年前是不可想象的(通 常领域差距为 15-30%)。
16.4.6 与传统仿真器的对比
表 16-13 从渲染方式、物理动力学、闭环能力等维度对比了 OmniDreams 与传统自动驾驶仿真器。 维度 CARLA Waymo Open Sim NVIDIA DRIVE Sim OmniDreams 渲染方式 传统光栅化 神经重建 + 渲染 混合 潜动力学 + 3DGS 照片真实感 低(合成感强) 中高(NeRF 重建) 中(混合渲染) 高(3DGS 实时渲染) 物理动力学 刚体(Bullet) 无(静态场景) 刚体 + 软体 学习型(数据驱动) 闭环仿真 支持 不支持(仅回放) 支持 支持 最小帧延迟 20ms N/A(离线) 25ms 28ms 多传感器 部分(Camera+LiDAR) 仅 Camera Camera+LiDAR+Radar Camera+LiDAR+Radar 场景多样性 手工制作 真实记录 程序化生成 无限(生成式) 开源 是 是(数据集) 否 否(2026 年底计划开源) 表16-13 OmniDreams 与传统自动驾驶仿真器的系统性对比 OmniDreams 的根本优势在于生成式范式:传统仿真器受限于能构建什么场景,而 OmniDreams 可以生成训练数据中从 未同时出现过的场景组合(雨天 + 夜间 + 拥堵 + 异常行人行为)。这种组合泛化能力(Combinatorial Generalization) 是生成式世界模型相较于基于规则的仿真器的最根本优势。
16.5 策略与世界协同训练
策略与世界协同训练(Policy and World Modeling Co-Training, PWM-CT)是 2026 年提出的语言 Agent 训练范式,核 心思想是将策略模型(Policy Model)和世界模型(World Model)联合优化——让策略在世界模型的反馈中学习规划与 决策,同时让世界模型在策略的探索轨迹上学习更准确的动力学预测。这一范式打通了“想象-规划-执行-反馈”的完整学 习闭环。
16.5.1 问题动机
语言 Agent(Language Agents,即使用 LLM 作为决策核心的自主智能体)在 2024-2025 年间在网页导航、游戏、代码 生成等任务上取得显著进展。然而,这些 Agent 存在一个根本性局限:它们不理解行动的物理后果。 考虑一个网页导航 Agent 的任务:“在购物网站上找到价格低于 200 元的无线降噪耳机并加入购物车”。当前 Agent 的运 作方式是:
- 解析页面 HTML → 提取可交互元素;
- 使用 LLM 推理 → 决定点击哪个元素;
- 执行动作 → 获得新的页面状态;
- 回到步骤 1。 这个循环中的每一步都需要实际执行才能获得反馈,Agent 无法在脑海中预演点击某个按钮后的结果。这意味着: •错误动作的代价是真实的(触发弹窗、错误页面、超时); •探索效率低(必须实际尝试每一种路径); •无法进行多步前瞻规划(Multi-Step Lookahead Planning)。 策略与世界协同训练的本质解决方案是:训练一个世界模型 W ,让 Agent 的策略 π 可以在世界模型的想象中尝试动作并 立即获得预测反馈,而无需每次都与真实环境交互。
16.5.2 形式化框架
设真实环境为 E (如网页浏览器、游戏引擎、物理世界)。策略 π 是语言 Agent 的动作生成器,世界模型 W 是环境动力 学模拟器。协同训练的目标是联合最小化两个损失: θ ϕ min Eτ ∼πθ ,E [− ∑ R(st , at )] + Eτ ∼πθ ,E [∑ D(Wϕ (st , at ), st+1 )] θ,ϕ t t 策略损失 L π 世界模型损失 L W 其中: •τ = (s , a , s , … , s ) 是策略在与真实环境交互中产生的轨迹; 1 1 2 T •D 是状态预测的距离度量(如交叉熵或 L2); •R(s , a ) 是任务奖励。 t t Real Environment Interaction State s_t Policy π_θ Action a_t Real Environment E Parallel branch Action a_t Multi-step rollouts Predict ŝ_{t+1} Predict reward ŕ_t Reward r_t State s_{t+1} Real supervision Joint optimization L_W = D(ŝ_{t+1}, s_{t+1}) Real reward World Model Imagination World Model W_φ Imagined reward L_π = -ΣR 图16-7 策略与世界模型协同训练的完整环路
16.5.3 共享表征架构
协同训练的关键架构设计在于,策略和世界模型共享底层表征。这避免了两套独立的编码器重复学习相同的环境信息,同 时确保了策略和世界模型使用一致的世界理解。 共享编码器设计: 设输入为环境状态 s (如网页 HTML 文本或游戏截图),共享编码器 f 将其映射为统一表征 h : t ψ t ht = fψ (st ) 在此基础上,策略头(Policy Head)和世界模型头(World Model Head)各自执行不同的前向计算:
- 策略头 at ∼ πθ (⋅ ∣ ht , task_desc) 即策略基于当前状态表征和任务描述,生成动作分布。
- 世界模型头 预测下一个状态的表征 h^ 和奖励 r^ : t+1 t ^ t+1 = g (s) (ht , Embed(at )) h ϕ (r) r^t = gϕ (ht , Embed(at )) 世界模型头的设计不是直接预测原始状态 s^ (这在网页文本等离散高维空间中计算量巨大),而是在表征空间中预测下 一步表征 h^ (Latent Prediction),然后用真实环境提供的 h = f (s ) 作为监督:
t+1
t+1
t+1ψ t+1 ^ t+1 − ht+1 ∥2 + CE(r^t , rt ) LW = ∥h 这种设计大幅降低了世界模型的计算成本,预测一个 768 维的向量远比重建一个可能有 100K tokens 的 HTML 页面容 易。 SharedEncoder f_ψ State s_t (Web HTML/game screens hot) Transformer Encoder World Model head W_φ Embed(a_t) Representation h_t ∈ ℝ^d Policy head π_θ Action embedding fusion MLP + task embedding Transformer Predictor Action a_t Predict ŕ_t Predict ĥ_{t+1} L_W = ||ĥ_{t+1} - h_{t+1}||² 图16-8 共享编码器策略-世界模型架构
16.5.4 训练动力学
协同训练中一个关键的算法设计决策是:策略和世界模型是交替优化(Alternating)还是联合优化(Joint)。
- 交替优化 在每个训练步中:
- 固定世界模型 W ,只用世界模型的想象推演来更新策略 π (想象中学习); ϕ θ
- 固定策略 π ,用策略探索的真实轨迹来更新世界模型 W (现实中学物理); θ ϕ
- 交替进行 1 和 2。 公式表达: θ(k+1) ← θ(k) − ηπ ∇θ Lπ (θ, ϕ(k) ) (k+1) (k) ←ϕ − ηW ∇ϕ LW (θ(k+1) , ϕ) ϕ
- 联合优化 在每个训练步中同时更新两个模型: (θ(t+1) , ϕ(t+1) ) ← (θ(t) , ϕ(t) ) − η∇θ,ϕ (Lπ + LW ) 这两种策略的优劣比较如表 16-14 所示: 特性 交替优化 联合优化 训练稳定性 高(各模块独立更新) 中(两个损失竞争梯度) 共享表征学习 慢(交替更新共享编码器) 快(共享编码器同时接收两个梯度) 世界模型准确性 高(始终用真实轨迹更新) 中(可能过拟合到策略的探索分布) 策略学习效率 中(世界模型固定时想象质量受限) 高(世界模型与策略同步进化) 计算开销 高(两次反向传播) 中等(一次联合反向传播) 实际最佳实践 早期训练(前 20% 步) 中后期训练(后 80% 步) 表16-14 交替优化与联合优化的系统性对比 2026 年的 PWM-CT 论文推荐混合策略(Hybrid Schedule):前 20% 的训练步采用交替优化以稳定表征学习,后 80% 切 换到联合优化以加速策略能力提升。实验表明,混合策略的任务成功率比纯交替优化高 +7.3%,比纯联合优化高 +3.8% 。
16.5.5 想象增强的梯度估计
当策略使用世界模型的想象来学习时,面临梯度偏差(Gradient Bias)问题,世界模型的预测误差会传播到策略梯度 中,可能导致策略学习错误的行为。PWM-CT 引入想象增强的梯度估计(Imagination-Augmented Gradient, IAG)来缓 解这一问题: ∇θ J (θ) ≈ Eτ real [∑ ∇θ log πθ (at ∣ st ) ⋅ R(τ real )] + λ ⋅ Eτ imag [∑ ∇θ log πθ (at ∣ s^t ) ⋅ R ^ (τ imag )] t t 真实轨迹梯度 想象轨迹梯度 其中 λ 为想象梯度的权重,R^ 为世界模型预测的奖励。λ 的关键设计是随世界模型的不确定性自适应调整: Uncertainty(Wϕ ) λ = λ0 ⋅ exp (− ) σ 当世界模型对其预测高度不确定时,λ → 0,策略主要依赖真实交互学习;当世界模型自信时,λ 增大,策略在想象中大 幅加速学习。 世界模型的不确定性通过集成分歧(Ensemble Disagreement)估计:训练 K = 5 个独立初始化的世界模型头(共享编 码器),用它们对同一状态的预测方差作为不确定性度量: K Uncertainty(ht , at ) = ∑ ∥h ^ (k) ˉ t+1 − ht+1 ∥ K
16.5.6 案例研究
k=1- 网页导航 在 WebArena 基准上,PWM-CT 训练的策略在 812 个真实网站任务中的表现如表 16-15 所示。 方法 成功率 平均步数 超时率 GPT-4o(Prompt only) 28.3% 12.4 18.2% GPT-4o + RCI(迭代细化) 35.1% 14.8 14.5% 专用 SFT Agent 41.7% 10.2 11.3% PWM-CT(仅真实交互) 47.2% 9.8 9.8% PWM-CT(真实 + 想象) 58.6% 8.1 6.3% 表16-15 PWM-CT 在 WebArena 上的网页导航性能 PWM-CT(真实 + 想象)相比仅真实交互提升 +11.4% 成功率,验证了世界模型想象对策略学习的实质性加速效果。尤其 是对于需要 5 步以上操作的复杂任务(如多条件筛选购物),想象 + 真实组合的成功率优势最为显著(+17.8%)。
- 游戏智能体 在 NetHack(迷宫探险游戏)的简化版本上,PWM-CT 展示了更显著的优势,结果如表 16-16 所示。 方法 平均分数 探索楼层 道具使用率 空洞 Agent(随机) 145 1.2 3% SFT Agent 1283 4.7 28% RL Agent(无世界模型) 2187 6.3 45% DreamerV3 Agent 3102 8.1 62% PWM-CT Agent 4215 10.8 78% 表16-16 PWM-CT 在 NetHack 上的游戏性能 PWM-CT 相对于 DreamerV3(纯 RL 世界模型方法)的关键优势在于语言基础:策略基于 LLM 的预训练语言能力理解任 务文本描述,世界模型则在这一语言理解的基础上做物理预测,两者的协同产生了 1 + 1 > 2 的效应。
16.6 世界-语言-动作统一
世界-语言-动作统一模型(World-Language-Action Unified Model)代表了 2026 年世界模型研究的终极形态——将世界 建模、语言理解和动作合成三种核心 AI 能力集成到同一个神经网络架构中,实现从看到世界到理解世界再到作用于世界 的端到端一体。这一范式有两个代表作:World-Language-Action Model(WLA, 2026)和 WALL-WM(2026, 1.05k GitHub stars),分别从架构融合和事件级对齐两个角度推进了这一方向。
16.6.1 统一范式的必要性
为什么需要将三种能力统一到一个模型中? •效率论证:独立的三个模型需要三倍的编码成本、三倍的中间表征存储和三重的通信延迟。在机器人等实时应用中,相 机帧、世界模型、语言推理再到动作生成的流水线延迟可能超过 200ms,无法满足亚秒级闭环控制的要求。 •共享论证:世界理解、语言推理和动作执行共享大量底层知识,物体的空间关系既用于世界预测(球会滚到哪里),也 用于语言推理(为什么球会掉下来),也用于动作规划(如何接住球)。独立训练的三个模型各自从零学习这些共享知 识,造成计算浪费。 •泛化论证:统一模型在模态间的联合训练产生跨模态泛化(Cross-Modal Generalization),在世界模型中学习到的物 理规律可以迁移到语言推理中,在语言推理中学习到的语义知识可以指导动作规划。 独立流水线与统一模型的对比见图 16-9。 Three Independent Models (Traditional Solution) Observation o World Model W ô_{t+1} Latency: >200ms Parameters: 3×(N+redund Unified Model (WLA/WALL-WM) ancy) WLA Unified Model Language Model L Latency: <50ms Parameters: 1×(N+share ReasoningText d) Efficient + Generalization ô_{t+1}, Reasoning, a_t Action Model A a_t Execute 图16-9 独立三模型 vs 统一模型范式对比 统一范式的训练目标可以概括为世界、语言、动作三项任务损失加上一致性约束: Lunif ied = Lworld + Llanguage + Laction + λLconsistency 其中 L 约束三个能力对同一场景的表示相互一致:语言描述必须与世界模型的预测一致,动作必须在物理上可 行。WLA 三阶段课程与 WALL-WM 事件级对齐都是这一目标的具体化。 consistency
16.6.2 WLA 统一架构
World-Language-Action Model(WLA)采用三塔一基(Three-Tower-One-Base)架构,共享一个预训练的多模态基础 模型(Foundation Backbone),三个轻量任务特定头(Task-Specific Heads)在共享表征上做精细化的前向计算,结构 如图 16-10 所示。 Shared backbone (Frozen + LoRA Adapters) Modality alignment modul Text Token Image/Video Token Action Token e Multimodal Transformer (Based on LLaMA-3 Archite cture + 3D-RoPE + Visual Encode r) Shared hidden layer h Three Task-Specific Heads Shared hidden layer h World Head -> (ô_{t+1}, ŕ_t) Shared hidden layer h Representation alignment loss Language Head Physical consistency const -> Reasoning text y_lang raint Semantic-action mapping Action Head -> a_t = (Δx, Δy, Δz, Δθ) 图16-10 WLA 统一架构的三塔一基设计 基础骨干的构成: •基于 LLaMA-3 的多模态扩展版本(28B 参数),使用 3D Rotary Position Embedding 处理时空 token; •视觉编码器:InternViT-6B,将图像和视频帧编码为视觉 token; •动作 token:6 自由度(3D 位置加 3D 旋转,a ∈ R ),通过可学习的 MLP 投影到与文本 token 相同的维度; •骨干使用 LoRA 适配器进行参数高效微调(仅训练约 2% 的新参数),保留了原始语言模型的知识。 三个任务头的设计:
- 世界头 o^t+1 , r^t = WorldHead(ht , Embed(at )) 输出分为两部分,视觉解码器(Cosmos-VAE 风格)生成下一帧,奖励预测器(MLP)估计动作的即时奖励。
- 语言头 P (ylang ∣ ht , query) 标准的自回归语言生成头,在共享表征基础上执行推理任务,回答“如果执行动作 X,可能会发生什么”类问题。
- 动作头 at ∼ ActionHead(ht , goal) 输出连续动作分布 (μ , σ ) 或离散动作分类。 a a
16.6.3 训练课程
WLA 的训练遵循三阶段课程学习(Curriculum Learning),按照从基础到复合的顺序逐步激活三个头的能力,流程如图 16-11 所示。
- 世界建模优先(Steps 0-100K) 冻结语言头和动作头,仅训练骨干 LoRA 适配器与世界头。训练目标为:给定当前观测和动作,预测下一帧的视觉表示。 LStage1 = ∥o^t+1 − ot+1 ∥2latent
此阶段的目的是让模型首先建立对物理世界的稳定内部表示,理解时空因果关系、物体动力学和动作的物理效果。这一世 界先验将成为后续语言推理和动作规划的认知基础。 2) 语言对齐(Steps 100K-250K) 激活语言头,引入语言推理任务:给定观测序列和问题,生成推理文本。 LStage2 = LStage1 + CE(ylang , y^lang ) 关键约束是跨模态对齐损失(Cross-Modal Alignment Loss),确保世界模型的内部表征与语言表征在语义上一致: Lalign = − cos (fworld (ht ), flang (ht )) 这迫使模型在看到球从桌上滚落和读到球从桌上落下时产生语义一致的内部表征。 3) 动作整合(Steps 250K-500K) 激活动作头,引入行为克隆(Behavioral Cloning)和强化学习联合训练: ^] ^ t ) − α ⋅ Eπ [ R LStage3 = LStage2 + MSE(at , a 最后一阶段的关键发现是:在世界模型和语言能力稳定之后再加入动作训练,动作头的收敛速度提升了 3.2 倍,因为此时 模型已经理解了动作的物理后果和语言描述,只需学会生成正确的动作即可。 Stage 2: Language Alignme Stage 3: Action Integration Stage 1: World Modeling nt (250K-500K steps) (0-100K steps) (100K-250K steps) Semantic understanding o L += MSE(a, â) End-to-end closed loop Complete WLA Model L = ||ô_{t+1} - o_{t+1}||² Establish physical priors L += CE(y_lang, ŷ_lang) + Cross-Modal Alignment verlay - α·E[ŕ] 图16-11 WLA 三阶段训练课程
16.6.4 零样本泛化到新环境
WLA 统一架构的关键特性是其零样本泛化(Zero-Shot Generalization)能力:在一种物理环境(如桌面操作台)上训练 的 WLA 模型,可以零样本迁移到新环境(如厨房操作台)上执行类似任务。 泛化的来源有三:
- 共享骨干的语言锚定:LLaMA-3 骨干在预训练中已经学习了广泛的常识知识,这些知识对新环境仍然适用(如“杯子 应该正立放置”)。
- 世界模型的结构化物理先验:世界头学习的物理规律(重力、碰撞、支撑关系)是跨环境一致的,球在桌面和厨房的滚 动规律基本相同。
- 语言作为泛化桥:新环境通过自然语言描述向模型传递关键信息,如“这是一个厨房操作台,上面有碗、杯子、餐 具”,语言头理解这些描述,将其转化为对世界头和动作头的隐式调适。 零样本泛化实验(在 RLBench 基准上)结果如表 16-17 所示。 训练环境 测试环境(零样本) 任务成功率 关键挑战 桌面操作台 厨房操作台(不同物体) 62.3% 物体尺度变化、背景干扰 单臂操作 双臂协作(新增协调需求) 41.7% 双臂解耦、动作空间增加 刚体操作 可变形物体(布料、绳子) 28.5% 物理动力学质变 室内日间 室内夜间(光照剧变) 71.8% 视觉领域偏移 已知物体 未知物体(全新形状) 55.4% 几何泛化 表16-17 WLA 零样本泛化实验结果 刚体到可变形物体的泛化(28.5%)是最困难的情况,物理动力学发生了质变,世界头需要适应完全不同的潜状态动力学 规律。这一瓶颈是未来研究的关键方向。
16.6.5 WALL-WM 事件级对齐
WALL-WM(Carving World Action Modeling at the Event Joints, 2026)从另一种角度推进了统一范式。其核心思想 是:物理世界由离散的事件(Event)组成,世界-语言-动作的对齐应该在事件的边界(Event Joints)上进行,而非在连 续的每帧上。 事件边界检测: WALL-WM 定义“事件”为世界状态的显著变化,如物体被拿起、碰撞发生、门被打开。事件边界通过潜状态的变化量自 动检测: Event(t) = 1 [∥st − st−1 ∥2 > τevent ] 其中阈值 τ 通过统计潜状态变化量的分布(取第 95 百分位)自适应设定。 event 事件级多模态对齐: 在检测到的事件边界上,WALL-WM 施加三重对齐:
- 世界-语言对齐:在事件边界,世界状态的潜变化 Δs 应与描述该事件的语言嵌入 Emb(event_desc) 对齐: t LW-L = 1 − cos(Δst , Emb(event_desc))
- 世界-动作对齐:在事件边界上执行的动作嵌入 Emb(a ) 应与事件导致的潜变化一致: t LW-A = ∥Δst − Proj(Emb(at ))∥2
- 语言-动作对齐:动作的语言描述应与实际执行的动作在嵌入空间中一致: LL-A = ∥Emb(action_desc) − Emb(at )∥2
事件级与帧级对齐的方法论差异如表 16-18 所示。 特性 WALL-WM(事件级) WLA(每帧级) 对齐粒度 事件边界(稀疏) 每帧(密集) 监督密度 低(约每 5-20 帧一事件) 高(每帧) 计算开销(训练) 低 高 物理直觉 符合,变化发生在事件 过度参数化 细粒度控制 弱(事件间插值) 强 泛化性能 较好(抽象到事件级) 依赖帧级数据覆盖 GitHub Stars 1.05k 未开源 表16-18 WALL-WM 与 WLA 方法论对比
16.6.6 与多模态大模型的对比
世界-语言-动作统一模型与当前主流多模态大模型之间存在根本性的架构差异,对比如表 16-19 所示。 维度 WLA WALL-WM GPT-4o Gemini 2.0 世界动力学建模 支持(显式 RSSM/扩 支持(事件级动力 不支持(隐式,仅视频生 不支持(隐式) 散) 学) 成) 动作生成 支持(原生动作头) 支持(事件对齐动 作) 不支持 不支持(需 API 编排) 闭环交互 原生支持 原生支持 仅文本/图像 仅文本/图像 物理一致性训练 显式约束 事件级约束 依赖涌现 依赖涌现 实时推理 支持(LoRA 量化) 支持(稀疏事件) 不支持(云 API,>500ms) 不支持(云 API, (<100ms) >300ms) 模型规模 28B + LoRA 7B(量化) 未公开 未公开(估计 50-100B) 训练范式 世界→语言→动作 课程 事件联合对齐 多模态预训练 + 对齐 多模态预训练 + 对齐 适用领域 通用 Physical AI 机器人精密操作 通用对话 + 视觉理解 通用多模态推理 开源性 未开源(论文描述) 开源(1.05k stars) 闭源 闭源 表16-19 世界-语言-动作模型与多模态大模型架构对比 核心差异在于:GPT-4o 和 Gemini 2.0 虽然具备强大的视觉理解和语言推理能力,但它们的架构中不存在显式的世界动力 学模块和原生动作生成能力。它们理解视频内容,但不预测物理后果;它们描述动作,但不执行动作。 WLA 和 WALL-WM 填补的正是这一从理解到行动的空白,通过将世界模型、语言模型和动作模型统一到一个架构中,使 AI 具备了感知-预测-推理-行动的完整闭环能力。
16.7 从语言智能到世界智能
语言智能(Language Intelligence)和世界智能(World Intelligence)之间存在一道语义鸿沟——理解苹果从树上落下 的文本含义,与理解重力使苹果加速下落的物理因果,是两种不同的认知能力。模型层面的统一架构与范式层面的协同训 练是弥合这一鸿沟的两条主线,本节从世界模型与语言模型的互补性出发,讨论通向世界智能的具身路径与尚待解决的开 放挑战。
16.7.1 语言模型与世界模型的互补
Tencent 于 2026 年 6 月发表的“World Models Meet Language Models”系统研究了两种模型的互补性,结论如表 16- 20 所示。 维度 世界模型优势 语言模型优势 互补方式 推理速度 并行预测快 串行推理慢 世界模型做底层预测 物理精度 高(训练目标包含物理) 低(文本描述有损失) 世界模型提供物理约束 抽象推理 弱(缺乏符号操作) 强(自然语言是强抽象工具) LLM 做高层规划 泛化 在训练域内强 跨域迁移强 LLM 引导跨域 表16-20 世界模型与语言模型的互补 实证发现:在物理推理任务上,将世界模型的预测作为 LLM 的附加上下文,准确率提升幅度为: •刚体动力学问题:+15.2% •流体动力学问题:+22.8% •因果推断问题:+18.5% 这表明世界模型提供了 LLM 缺乏的物理直觉,而 LLM 的符号抽象能力又弥补了世界模型在高层次规划上的短板。两者结 合的系统在物理推理上超过任何单一模型,验证了统一架构与协同训练路线的合理性。
16.7.2 通向世界智能的具身路径
通往世界智能的关键路径是具身智能(Embodied AI),让模型通过与物理世界的交互来学习。2026 年的两个标志性进 展: •Cosmos 3 的应用:NVIDIA 的 Cosmos 3 被用作机器人策略训练的精神沙箱,在纯虚拟环境中生成海量物理交互数 据,训练策略后再迁移到真实世界。 •Dream.exe:2026 年 6 月的研究证明,视频生成模型能够梦见可执行的机器人操作序列,意味着生成式世界模型已经 内化了足够的物理规律,足以支撑可靠的动作规划。 这两项工作分别代表了世界基础模型的仿真价值与生成式世界模型的规划价值。前者在纯虚拟环境中生成海量物理交互数 据,供策略训练后迁移到真实世界;后者证明视频生成模型已内化足够的物理规律,可直接支撑动作规划。
16.7.3 开放挑战与展望
尽管进展显著,从语言智能到世界智能仍有明显距离: •场景泛化差距:当前世界模型在单一场景(堆放、抓取、推动)中表现良好,但场景切换时的泛化能力仍有显著缺口, 可变形物体与流体的动力学质变尤其困难; •长期一致性:长时域推演中的误差累积尚未根本解决,有效预测时域距离实用化的分钟级闭环仍有数量级差距; •多模态对齐:语言、视觉、动作三模态在事件粒度上的精细对齐仍依赖大规模标注或精心设计的课程。 打通“语言→世界→动作”的完整链条,使 AI 在统一架构内完成感知、预测、推理与行动,是未来 3 到 5 年的核心挑 战,也是世界模型研究通向世界智能的路线图。