世界模型走到哪一步了

语言模型已经能够编写代码、完成专业考试、生成结构完整的研究文本。进入动态的物理环境后,它们的能力仍然不够稳定。水会向低处流,玻璃坠地可能破碎,被遮挡的物体依然存在,这些人类从日常经验中形成的常识,模型未必能够在具体场景中准确运用。
困难主要出现在知识与行动的衔接环节。当环境持续变化,模型需要识别物体状态、判断空间关系、预测动作后果,并据此调整行为时,单靠语言知识很难完成整个过程。李飞飞曾将语言模型比作“在暗室里写作的文字匠”:表达流畅,却缺少与物理世界相连的感知锚点。
世界模型试图补上这项能力。它需要形成对环境状态的内部表征,学习状态如何随时间和动作变化,并在实际行动前推演不同选择可能带来的结果。沿着这条链路,世界模型的发展可以归纳为三个阶段:生成世界、模拟世界、利用世界行动。

2018年,David Ha和Jürgen Schmidhuber在《World Models》中展示了智能体在内部模型生成的“想象环境”中学习的可能性。模型将环境观测压缩为内部状态,学习状态变化规律,再让智能体在模拟环境中训练策略,从而减少真实交互成本。
2022年,Yann LeCun在《通向自主机器智能之路》中,将世界模型纳入自主机器智能的整体架构。世界模型负责估计当前状态、预测未来,并为行动规划提供依据。LeCun主张在抽象表征空间中预测与任务相关的信息,把计算资源集中在物体位置、运动方向、空间关系和动作后果上。这一思路后来发展为JEPA,即联合嵌入预测架构。
生成式路线选择直接生成可观察的未来。OpenAI在2024年发布Sora时,将技术报告命名为《视频生成模型作为世界模拟器》。按照这一思路,视频模型为了持续生成后续画面,需要学习三维结构、运动规律、遮挡关系和物体恒常性。
两条路线都在预测未来,侧重点有所不同。JEPA关注适合行动和规划的抽象状态,生成式模型则通过图像或视频呈现预测结果。前者具有较高的计算效率,内部表征较难直接检验;后者能够展示可见的未来,同时需要处理大量视觉细节。
2026年6月,李飞飞与World Labs团队提出了一个更具操作性的功能框架,将世界模型划分为三类:渲染器负责生成图像、视频或三维场景;模拟器负责表示世界状态及其变化规律;规划器根据观测、目标和预测结果生成行动。三者共同构成从行动到状态、从状态到观测、再从观测回到行动的循环。
这套框架提供了一个判断世界模型进展的坐标:生成结果能否保持空间与时间一致,状态变化能否反映真实规律,预测结果能否支持行动。
生成式世界模型最直观的进展,是生成内容开始从固定视频转向可以持续探索的环境。传统视频模型完成一次生成后,用户很难继续改变方向或影响后续状态。新一代模型开始接收连续输入,根据用户动作实时生成环境变化。
Genie 3是这一方向的代表。根据DeepMind公开信息,它能够依据文字描述生成动态环境,用户可以在其中移动和改变视角,系统则持续生成后续画面。模型还展示了初步的状态持续能力:用户离开某一区域后再次返回,此前对场景造成的部分变化仍可能被保留。
当前的交互主要集中在移动和视角控制,环境一致性通常维持在数分钟尺度。文字渲染、抓取、拼装和精细碰撞等能力仍然有限。Genie 3已经呈现出生成式交互环境的基本形态,与具有确定性规则、精确物理系统和长期状态管理能力的工程仿真器仍有明显距离。
World Labs的Marble把重点放在三维空间生成上。用户可以通过文字、图片或视频生成空间,并对结果进行探索、编辑和导出。其主要价值体现在空间持续性、可编辑性以及与影视、游戏和设计工作流的衔接。面向机器人仿真和工业数字孪生时,还需要进一步解决精确尺寸、材料属性、碰撞规律和物理过程等问题。
英伟达Cosmos则将世界模型扩展为面向物理AI的平台,覆盖视频数据处理、世界生成、后训练、动作预测和评估等环节,服务于机器人和自动驾驶开发。
总体来看,生成式世界已经从“可观看”走向“可进入”。模型能够构建短时间内具有一定空间一致性和交互能力的环境。长期状态保持、复杂对象交互和精细物理模拟仍处于早期阶段。
进入机器人和自动驾驶领域后,世界模型需要回答更加具体的问题:机器人采用不同抓取方式会产生什么结果,车辆加速、减速或变道将如何影响后续交通状态。
动作条件世界模型将当前状态和候选动作共同作为输入,预测每个动作对应的未来。模型由此获得反事实推演能力,可以比较多个行动方案及其结果。
V-JEPA 2代表了表征预测路线的当前进展。模型使用超过100万小时的无标注视频进行自监督训练,学习对象、运动和时间变化之间的关系。加入动作条件后的V-JEPA 2-AC使用不到62小时的机器人视频进行后训练,随后在新环境中完成基于图像目标的抓取和放置任务。
这项研究形成了一条清晰路径:先从大规模视频中学习通用环境表征,再利用少量机器人数据建立动作与状态变化之间的联系。当前实验主要集中在目标明确、步骤较短的任务。多步骤装配、柔性物体操作和长时间任务仍对模型的状态记忆和预测精度提出挑战。
中国企业的探索更多集中在机器人和自动驾驶场景。极佳视界的GigaWorld-1强调动作条件生成、三维一致性和物理遵循,并在WorldArena评测中取得较高成绩。相关结果反映出评测标准正在从画面质量扩展到动作一致性、物理规律和任务可用性。
华为乾崑采用WEWA架构,直接连接视觉世界表征与驾驶行为。2026年4月发布的WEWA 2.0中,云端世界模型通过多智能体博弈和在线强化学习生成、学习和验证复杂交通场景;车端世界行为模型利用安全风险场进行防御性驾驶决策。华为公布的测试数据显示,该机制可将碰撞风险降低50%,这一结果属于企业披露口径。
Wayve的GAIA系列则逐步把驾驶策略接入生成环境,通过闭环运行观察车辆在不同场景中的表现。世界模型在这里承担了虚拟测试环境的角色,评价重点也从视频效果转向轨迹、碰撞和风险结果。
动作条件预测已经在机器人和自动驾驶等限定场景中获得验证,并开始进入数据生成、策略训练、短时预测和局部规划环节。面对陌生环境、罕见对象和长时程任务时,模型的可靠性仍会明显下降。
世界模型最终需要进入行动闭环。智能体观察环境、估计当前状态、生成候选动作、预测各个动作的结果,再根据目标和风险作出选择。按照使用环节,可以分为训练、测试和在线决策三个层级。
训练是目前成熟度最高的应用。机器人真实试错成本高,自动驾驶中的极端天气、突然横穿和多车冲突等场景也很难大规模采集。世界模型可以生成可控环境,让策略在虚拟场景中反复训练,降低数据采集和设备损耗成本。
测试正在成为另一个重要落点。开发者可以围绕遮挡、碰撞和异常行为主动生成场景,观察机器人或驾驶系统如何反应。评测重点逐渐从生成画面是否逼真,转向虚拟环境中的策略表现能否反映真实风险。
在线决策提出了最高要求。模型需要在有限时间内完成状态估计、未来预测和风险评估,并在环境变化后及时修正。目前,V-JEPA 2-AC已经展示了短程机器人规划能力,WEWA也将世界行为模型接入车端决策。此类实践通常围绕有限动作空间和明确目标展开,同时配合安全规则、冗余感知和传统控制系统。
现阶段,世界模型在训练和测试环节的成熟度明显高于在线自主决策。它已经成为物理AI的数据和仿真工具,部分系统也能够参与局部规划与风险判断。
世界模型正在从技术验证走向实际应用:目前,视频与三维场景生成、短时交互和训练数据生产已经得到较充分验证,动作条件预测、多主体模拟和闭环评测正在进入工程化阶段。面向开放环境的长时一致性、精细物理模拟、稳定迁移和高风险在线决策仍需进一步突破,当前较明确的落地方向主要集中在机器人训练与仿真、自动驾驶测试与评测等场景。

但世界模型仍面临着四项基础挑战。
第一是长时程一致性。模型根据此前生成的状态继续预测,微小误差会不断累积。当前系统能够维持数分钟的相对稳定状态,距离小时级持续运行还有较大差距。
第二是物理与因果正确性。视觉上合理的画面可能包含错误的质量、速度、摩擦和碰撞关系。模型还需要区分事件的先后顺序与真正的因果关系,准确回答“换一个动作会发生什么”。
第三是分布外鲁棒性。罕见对象、异常动作、新环境组合和传感器变化都可能导致预测失效。机器人和自动驾驶的安全上限往往取决于这些长尾情况。
第四是仿真到真实迁移。机器人在虚拟环境中学到的能力能否进入真实设备,驾驶系统在生成环境中的安全表现能否对应真实道路,是衡量世界模型工程价值的核心标准。
截至2026年8月,世界模型已经能够生成短时间内可探索的环境,在限定场景中预测动作所对应的未来,并进入机器人和自动驾驶的训练与测试流程。
从成熟度看,合成数据、虚拟训练和闭环评测已经展现出较明确的应用价值;动作条件预测和局部规划正在进入工程化;长时程状态一致性、复杂物理交互、稳定因果预测和开放环境中的自主行动仍处于研究阶段。
未来的世界模型可能采用混合架构:隐空间模型负责快速预测和规划,生成模型提供数据、可视化与结果校验,物理引擎和结构化状态约束关键规律,策略模型将预测转化为行动。
2026年可以被视为世界模型开始进入工程验证的阶段。世界模型正在成为连接感知、预测、规划和行动的基础能力。下一阶段的竞争将围绕一个更严格的标准展开:模型预测的未来,能否在真实世界中持续成立。
参考文献
Google DeepMind, "Genie 3: A new frontier for world models," DeepMind官方博客, 2025年8月5日. DeepMind, "Genie" . World Labs, "A Functional Taxonomy of World Models"(李飞飞及团队,2026年6月)相关报道:TechTimes, "Feifei Li's World Labs Splits World Model Into Three Types," 2026年6月6日. StartupHub.ai,World Labs融资与商业化系列报道(2026年6月). Fast Company, "Spatial intelligence is the next frontier of AI, says World Labs' Fei-Fei Li," 2026年3月. TechCrunch, "Yann LeCun's AMI Labs raises $1.03 billion to build world models," 2026年3月9日. TechTimes, "Yann LeCun's World Model Earns a Formal Proof," 2026年5月31日. Meta AI, "Introducing the V-JEPA 2 world model and new benchmarks for physical reasoning," 2025年6月11日. NVIDIA Newsroom, "NVIDIA Launches Cosmos 3, the Open Frontier Foundation Model for Physical AI," 2026年6月. Axios, "Nvidia's Cosmos 3 open AI world model helps robots, autonomous vehicles," 2026年6月1日. The Robot Report, "NVIDIA adds Cosmos Policy to its world foundation models," 2026年2月. Wayve, GAIA系列技术博客(GAIA-2/3/4). ; ; OpenAI, "Video generation models as world simulators," 2024年2月;"Sora 2 is here," 2025年9月. ; Nature (News Explainer), Davide Castelvecchi, "'World models' are AI's latest sensation: what are they and what can they do?" Nature 653, 14-15 (2026), 2026年4月28日. arXiv:2606.00133, "World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications," 2026年5月. arXiv:2411.14499 / ACM Computing Surveys, "Understanding World or Predicting Future? A Comprehensive Survey of World Models." ;








