通用世界模型:第一性原理与发展路线

概要

人为什么能逐渐学会骑自行车、开车,甚至完成更复杂的操作?

刚开始练习时,人的动作往往不够协调;经过反复训练,才会逐渐稳定、准确。一个重要原因是,大脑在与外部世界持续互动中形成了"内部模型",能够预判行动的后果[5]。

在人工智能领域,能够在内部表征世界状态并学习其演化规律的模型,通常被称为世界模型。相关研究已延伸到视频生成、环境模拟和机器人控制,但"通用"仍缺少共同定义。

本文从第一性原理出发,回答三个问题:

  1. 什么让世界模型具有"通用性"?
  2. 它如何从生成世界演进到自主行动与世界组织者?
  3. 这条路线需要什么支撑,现有系统又验证到了哪一步?

核心结论是:通用性来自理解、预测和行动的持续反馈闭环;能力沿五级路线逐步积累;实现依赖数据、架构与算力。当前实践已覆盖 L1 至 L3,但 L4 和 L5 仍有关键缺口。

理解—预测—行动闭环示意图
图 1:行动不是闭环的终点。它改变环境、带来新的观测,并反过来更新下一轮理解、预测与决策。

从专用模型走向通用世界模型

从大模型发展的视角来看,我们希望构建的,不只是服务于某个任务或场景的专用模型,而是一个能够理解世界、预测未来并采取行动的通用基座模型。

因此,判断一个世界模型是否"通用",关键不在于它能否完成某项生成或控制任务,而在于是否具备三项相互关联的核心能力:

  1. 理解世界:整合不同信息,判断当前状态;
  2. 预测未来:推演接下来可能发生什么,以及不同动作会带来怎样的结果;
  3. 采取行动:影响数字或物理环境,并利用真实反馈修正理解和预测。

这三项能力不能彼此割裂。只有当理解、预测与行动相互衔接,并通过环境反馈持续循环时,模型才能在与世界的交互中不断更新判断。

通用世界模型不是单一的生成器、模拟器或机器人策略,而是一个能够理解现在、预测未来、采取行动,并从结果中持续学习的通用基座。

为了说明这一闭环如何运转,可以将模型接收和处理的信息概括为四类变量。在任意时刻 t

  • xₜ 表示模型看到、听到或感知到的信息;
  • aₜ 表示可能改变世界的输入,例如用户控制或机器人动作;
  • g 表示条件、任务或目标;
  • sₜ 表示模型对当前世界状态形成的内部判断。
四类变量示意

动作 aₜ 和目标 g 不一定同时出现:视频生成模型可能只需要生成条件,交互式系统则可能持续响应用户操作,却没有明确的长期目标。

状态、动作、观测循环示意

模型根据历史理解当前状态,预测未来并选择行动;行动改变世界、产生新观测,模型随之更新状态,进入下一轮循环。

通用世界模型的五级路线图

在这一闭环之上,世界生成、实时交互和物理行动成为自主性逐步增强的连续层级:生成世界 → 与世界交互 → 在世界中行动 → 自主完成目标 → 组织多主体协作。

通用世界模型五级路线图
图 2:通用世界模型沿着"像素—交互—行动—自主—组织"逐级演进;后一个层级建立在此前能力之上。

L1:生成世界(World Generation)。 模型生成连贯的世界演化过程,学习人物、物体、运动和场景变化。但"看起来真实"不等于掌握因果与行动后果。

L2:与世界交互(Interactive World)。 模型接收实时输入、维护世界状态,并据此改变后续内容,由一次性生成走向持续互动。

L3:在世界中行动(Actionable World)。 世界动作模型(WAM)统一环境理解、未来预测和动作生成,直接输出机器人可执行的动作,并利用真实反馈更新判断。

L4:自主世界智能体(Autonomous World Agent)。 模型围绕长期目标主动感知、探索和规划,由执行指令走向自主决策。

L5:世界组织者(World Orchestrator)。 自主性从单个智能体扩展到系统级组织。模型围绕共同目标,组织多个机器人、数字智能体、人类、工具和资源,统一制定计划、分配角色与资源、协调行动,并根据环境反馈持续调整方案。

五级路线对应的建模目标
表 1:五个层级对应不同的建模目标;自主性的提升来自能力积累,而非对前一层级的替代。

如何构建通用世界模型?

要把前面的五级路线真正变成可以运行的系统,需要同时解决三个问题:用什么数据训练、用什么架构连接不同能力,以及如何利用算力完成训练和实时运行。也就是三个核心要素:数据、架构与算力。

数据:构建从观察到行动的数据金字塔

网络视频规模庞大,却很少记录动作;机器人交互数据能连接环境、动作和结果,但成本高、数量少。因此,需要一个由观察走向行动的数据金字塔:海量网络视频 → 特定领域视频 → 第一视角人类视频 → 带动作记录的人类示范 → 真实机器人交互数据。

数据金字塔示意
图 3:底层视频提供规模和广度,越向上越强调任务、动作与具身对齐;合成数据和"不完美数据"可贯穿各层。

缺少动作标注的视频可通过逆动力学、潜空间预测和生成式建模学习动作线索与动态结构[16,18,19],再用示范和机器人数据完成行动对齐。合成数据可扩大场景覆盖 [41],但仍需真实交互校准;失败、纠正和恢复同样包含学习信号。

架构:让不同模态各有所长、协同推理

语言、图像、视频和机器人动作模态不同,却需要在理解、预测和行动时交换信息。

MoT(Mixture-of-Transformers)为不同模态配置专门参数,同时通过共享注意力进行跨模态交互[22],使理解、预测和行动能够在同一模型中协同完成。其原则是:在表示存在差异的地方保持专用,在推理需要协作的地方实现共享。

算力:支撑规模化训练与实时反馈闭环

算力既决定预训练规模,也决定模型能否进入实时闭环。交互和机器人控制必须在环境变化前完成预测与决策,因此少步生成、模型蒸馏、高效注意力、量化、缓存和流式处理都是模型设计的一部分 [69]。

实践:从 Vidu 到 Motubrain,L1–L3 的实践验证

通用世界模型横跨生成、交互和行动,无法用单一指标衡量。现阶段主要考察视频一致性、实时响应、任务成功率、推理延迟和泛化能力。在这条路线的前三个层级,生数科技已经有了具体落地。

生数科技系统对应的层级验证
表 2:Vidu、Vidu S1、Motus 与 Motubrain 分别验证了 L1 至 L3 的关键能力,也标出了当前边界。

Vidu 验证了什么?

Vidu 于 2024 年 4 月发布,能够生成高质量、前后连贯的视频,为学习视觉规律、时序一致性和世界动态提供基础 [23]。它验证了 L1,但仍属于离线生成。

从 Vidu 到 Vidu S1,关键变化是什么?

Vidu S1 于 2026 年 7 月发布,支持用户通过语音实时改变后续内容。模型可实现 540p、最高 42 帧每秒的实时生成 [24]。关键不只是"更快",而是生成世界开始持续接收输入并即时响应。

Motus 与 Motubrain 如何把预测转化为行动?

Motus 于 2025 年 12 月发布并全面开源,以统一架构打通感知、预测与行动 [25]。Motubrain 于 2026 年 4 月发布,进一步统一环境理解、世界状态预测和动作轨迹生成,推动模型从"视觉推演"迈向"物理决策"[26]。

Motubrain 的完整模型以约 5 Hz 运行,较 Motus 提速约 10 倍,Video-to-Action 模式最高可达 11 Hz;在 RoboTwin 2.0 的常规和随机化设置下,平均成功率分别为 95.8% 和 96.1%,并可通过 50 至 100 条轨迹适配新的机器人本体 [26,74]。

这些实践形成了一条连续路线:Vidu:生成世界 → Vidu S1:与世界交互 → Motus/Motubrain:理解世界、预测世界、行动于世界。

当前系统做到了什么,还有哪些边界?

现有系统说明,生成、交互和行动可以沿同一基础模型路线演进。但它们仍主要执行外部目标,运行在有限的任务与本体分布内,尚未具备 L4 的开放式探索、长期记忆和持续学习,也未达到 L5 对机器人、数字智能体、人类、工具和资源进行系统级组织的能力。

展望:迈向 L4 与 L5,仍需突破哪些关键问题

通用世界模型的核心,是用理解—预测—行动闭环统一世界生成、实时交互与物理行动;五级路线则描述了模型从 Pixel 到 Interaction、Action、Autonomy 和 Organization 的能力演进。

更可扩展的路径,是先让通用基础模型学习广泛的世界知识,再用少量真机数据完成本体与任务对齐。

走向 L4 和 L5,还需要突破六项关键问题:覆盖理解、预测、行动与迁移的联合评测;接触、作用力、干预与失败后果等真实物理规律;可持续更新的长期记忆;基于真实交互的在线学习;满足延迟与资源约束的高效部署;以及随自主性提升而强化的安全与可控性

短期目标,是强化前三个层级,并为目标形成、主动探索、持续学习和长期记忆奠定基础。更长远的目标,是构建一个能持续理解世界、预测选择后果、在约束下行动,并从反馈中学习的通用基座。

引用

本文沿用原论文编号,仅列出正文直接引用的代表性文献。完整参考文献请参见论文原文。

  • [5] Daniel M. Wolpert, Zoubin Ghahramani, and Michael I. Jordan. "An Internal Model for Sensorimotor Integration." Science, 269(5232):1880–1882, 1995.
  • [16] Bowen Baker, Ilge Akkaya, Peter Zhokhov, et al. "Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos." NeurIPS, 2022.
  • [18] Mahmoud Assran et al. "V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning." arXiv:2506.09985, 2025.
  • [19] Fan Bao, Shen Nie, Kaiwen Xue, et al. "All Are Worth Words: A ViT Backbone for Diffusion Models." CVPR, 2023.
  • [22] Weixin Liang, Lili Yu, Liang Luo, et al. "Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models." arXiv:2411.04996, 2024.
  • [23] Fan Bao, Chendong Xiang, Gang Yue, et al. "Vidu: A Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models." arXiv:2405.04233, 2024.
  • [24] Jintao Zhang, Kai Jiang, Jintao Chen, et al. "Vidu S1: A Real-Time Interactive Video Generation Model." arXiv:2607.03118, 2026.
  • [25] Hongzhe Bi, Hengkai Tan, Shenghao Xie, et al. "Motus: A Unified Latent Action World Model." CVPR, 2026.
  • [26] Motubrain Team, Chendong Xiang, Fan Bao, et al. "Motubrain: An Advanced World Action Model for Robot Control." arXiv:2604.27792, 2026.
  • [41] Ajay Mandlekar, Soroush Nasiriany, Bowen Wen, et al. "MimicGen: A Data Generation System for Scalable Robot Learning Using Human Demonstrations." CoRL, 2023.
  • [69] Jintao Zhang, Haoxu Wang, Kai Jiang, et al. "TurboDiffusion: Accelerating Video Diffusion Models by 100–200 Times." arXiv:2512.16093, 2025.
  • [74] Tianxing Chen, Zanxin Chen, Baijun Chen, et al. "RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation." arXiv:2506.18088, 2025.

引用

@article{zhu2026generalworldmodels,
  title       = {General World Models from First-Principles},
  author      = {Zhu, Jun and Tan, Hengkai and Zhang, Jintao and Zhao, Min and Bao, Fan and Zhang, Bo},
  institution = {GensPI Technology and Tsinghua University},
  year        = {2026},
  url         = {https://www.motubrain.com/assets/gwm-principles-and-roadmap.pdf}
}