HiDream-O1-World拿下WBench第一,交互世界模型的格局被改写|甲子光年


能交互、懂物理:新一代AI世界模型来了。
先看一个视频。
镜头贴着一片珊瑚礁推进。水面以上的日光穿过折射层,在沙地上投下摇曳的光斑,鱼群四处游弋。镜头拉近,珊瑚表面还有真实的体积感与凹凸纹理。
这并非一段预渲染的CG动画,更不是一段"看起来像3D"的AI视频拼接。这一切,是用户用键盘控制的:前后移动,移动视角。这是用户与AI共建一个世界的过程——一个知道物体有体积、光影有逻辑、运动有惯性的世界。
而构建出这段体验的模型,名叫HiDream-O1-World。
近日,这个“初出茅庐”的模型,以平均分80.9的成绩,登顶交互式视频世界模型评测基准WBench的核心Navi分榜,一举超越了腾讯HY-World1.5与阿里HappyOyster。
更重要的是,在物理一致性的维度——那个所有同行公认最难啃的骨头——它拿到了73.3分,位列第一。

今天,这款模型掀开神秘的面纱,迎来了正式发布。
对智象未来有所了解的人,大概会明白这一刻的分量——从多模态到全模态世界模型,最终抵达AGI,本就是这家公司成立之初就画下的路线图。一家创业公司,敢在技术难度极高、不确定性极强的赛道上押注,还能一步步走通、做成,HiDream-O1-World还做到了WBench榜第一。这件事本身,已经超出了"技术突破"的范畴,它的意义,或许要在更长的时光里才能真正显现。
而此时,这款模型的发布,也不只是智象未来自己的里程碑。它的出现,也正在悄然改变全球世界模型的竞争格局。
1.智象未来走出世界模型的第三条路线

从去年底开始,世界模型赛道明显升温。
在海外,去年11月,AI教母李飞飞创立的World Labs,上线了专注于3D世界生成的首款商业产品Marble。今年1月30日,谷歌Genie 3开放Project Genie,用户首次可以通过文字或图片生成可交互的3D虚拟世界;
在国内,腾讯和阿里发布了各自的世界模型产品。腾讯拿出的是开源的混元3D世界模型2.0(HY-World 2.0),阿里端出的是主打实时交互的HappyOyster。
据统计,今年前7个月就有超过600亿元的投资涌入“世界模型”概念赛道。无论是参与着的分量还是资金的体量,都指向同一个判断:世界模型,正在从一个学术命题,变成一场关于AGI入口的全球抢位战。
所谓世界模型,目前学术界尚无统一定义。综合来看,它是一个能够接收当前世界状态(如图像、传感器读数、动作指令等),并预测未来状态(如下一帧画面、物理反馈、环境变化)的系统。其核心在于三大底层能力——物理规律(重力、惯性、摩擦)、空间结构(深度、遮挡、3D几何)以及动态轨迹(运动、加速、碰撞后的状态变化)。
很多人容易将世界模型与视频生成模型混为一谈——两者看似都在“生成画面”,底层逻辑却截然不同。
我们拿被关停的Sora举例,Sora可以生成一段“汽车飞过路口”的画面,像素精美,场景考究。但从物理学的角度来看,一辆车不会不减速、不碰撞地飞过十字路口。而世界模型则不然,它必须理解场景中每个物体的空间位置、物理属性和因果逻辑——像苹果会落地、车会打滑、碰撞必须守恒等等。
可以说,世界模型被寄予厚望,是很多人意识到大模型路线即将走到瓶颈后,一次技术路线的革新。
其中,谷歌和李飞飞的World Labs是两大代表技术流派。谷歌专注于实时交互式世界建模;今年6月,李飞飞将世界模型渲染器、模拟器、规划器的路线图进行了系统阐述。Marble正是模拟器方向的第一步产品,从三维几何出发生成结构精确、可编辑的3D空间。
而智象未来则走出了另外一条路。
智象未来CTO姚霆表示:“交互式世界模型的价值,不在于生成一个逼真的三维场景,而在于AI开始真正理解空间的深度、物体的质感、运动的惯性与光影的逻辑。这是对物理世界运行规律的系统性认知与重塑。”
智象交互式世界模型的路线,从一开始就锚定了始终困扰行业的核心难题:时空一致性与物理一致性。当前主流玩家的路径各有侧重,也各有盲区。World Labs的Marble把静态场景的结构保真度做到了极致,生成的是持久化、可下载的3D环境。但代价是,它更像一台精密的3D渲染引擎——懂得呈现“世界的样子”,却不懂物理的因果。谷歌Genie 3则押注实时交互,以24帧/秒生成动态世界。然而,当时间拉长、场景复杂化时,物理一致性的裂缝便会显现。而智象选择的方向,恰好是这两条路都没有走通的那一段——让世界在长时间的交互中,不仅“看起来对”,更要“动起来也对”。
2.从理论到落地:
一个可交互、可编辑的世界
那么,这套理论落地到模型上,到底能做到什么程度?
HiDream-O1-World 具备漫游、编辑等功能,支持文本、图像、交互等多模态方式输入。模型提供了第一人称和第三人称两种视角的漫游体验。用户可自由驱动角色行走并任意调整视角方向。以登雪山的场景为例:登山人行进中,脚印在雪面上压出真实凹陷。雪花随风飘落的动作缓急有致。远处群山轮廓与脚下岩石纹理随视角推移,衔接得非常自然。
不止于漫游,HiDream-O1-World 还拥有编辑的功能。用户可对画面进行实时编辑:驱动角色完成抓取、奔跑、下蹲、跳跃等动作,或调度环境变化,如触发降雨、物体坠落等动态事件。而且还不是局部微调,而是基于几何、光照、材质到物理逻辑的全局统一,确保每一次交互都真实自洽。
骑行的画面中,输入“天气变化为雷雨天”,霎时雷声滚过天际,天色骤沉,雨点砸落,地面溅起密匝匝的水花。再输入“天气变化为太阳雨”,阴云渐次透亮,远处阳光破空倾泻,湿润的路面泛起碎金般的反光。整个场景,切换得非常自然。
比如,那只孤鹰在山谷翱翔的画面。输入“出现第二只鹰,同频飞行”的指令后,另一只形神相近的鹰果然从前方浮现,两只鹰此起彼伏,身姿交相呼应,一同穿梭于峡谷之中。
还有降落伞的画面,输入“收伞”指令后,人缓缓落地,接着就开始收伞。伞布一点点皱起来,伞线也根根清晰,收伞的每一步都顺理成章,看着特别真实。
更重要的是,模型支持人类、动物、虚构角色等多种主体,覆盖写实城市街景到二次元幻想世界的多元风格,泛化能力极强。
HiDream-O1-World之所以能在时空一致性与物理一致性上实现突破,根源在于两层设计:原生全模态UiT架构奠定的统一认知框架,以及几何-外观解耦生成的生成范式革新。
HiDream-O1-World基于智象自研原生全模态UiT(Unified Transformer)世界模型架构,则将图像像素、文本Token、视频体素及空间关系等信号全部映射进同一个共享Token空间,直接与同一套Transformer交互。这意味着,当用户发出“向左转”“向前走”的指令时,模型是在同一个认知框架中理解指令的空间含义、预测世界状态、生成视觉结果——“理解”与“生成”从底层便不再分家。
如果UiT架构解决了“用什么框架理解世界”,那么融入几何-外观解耦的生成范式,则解决了“如何生成3D一致的世界”。当前主流的交互生成模型,大多依赖隐式的时空表征来推断场景结构。模型拿到一张图像或者一条指令和相机轨迹后,拟合像素分布,直接“一步到位”生成视频。这种建模方式,一方面在较大视角变化下极易出现几何结构不合理、物体形变、跨视角空间不一致等问题,另一方面直接拟合像素分布,不理解物理规律,一旦遇到训练数据中没见过的物理场景,模型就露馅了。
HiDream-O1-World的解决方案是,与其让模型隐式地“猜”完所有空间推理,不如把“几何结构生成”和“外观生成”拆成两个独立的阶段,即“几何-外观解耦”的两阶段框架。
第一阶段——先完成几何生成: HiDream-O1-World首先构建与目标视角对齐的部分三维观测,并利用预训练的3D基础模型提取多尺度几何特征,再通过轻量级投影模块压缩到适合扩散模型的表示空间。随后,几何视频扩散模型在这一空间中完成缺失结构的推理与补全,生成目标视角完整的几何表示,并将这些几何特征作为显式结构条件,用于指导后续的视频生成。
第二阶段:视频扩散模型生成: 以第一阶段生成的几何表示作为结构条件,在VAE潜空间中进行条件去噪,并最终解码为视频帧。
这个设计的核心是几何-外观输出解耦。几何阶段主要关注结构完整、交叉视图一致性、相机轨迹的遵循。外观阶段则主要关注纹理、视觉细节、写实渲染,无需同时承担结构推理的重担。

图1:与缺少显式 3D geometric grounding 的方法不同,智象将 geometry 作为中间结构表示,引入 3D Foundation Model 的空间结构先验,以提升跨视角一致性与几何稳定性。
几何生成只是第一步,如何让模型在长时交互中记住这个几何结构,同样关键。为此,模型在生成过程中维护了一个持续更新的空间记忆上下文,将场景的几何结构、物体空间关系等3D先验信息编码并存储于Memory中。配合推理阶段针对未知场景动态适配几何约束的能力(Test-Time Training在线自适应),模型在长时序交互中始终保持3D几何一致性。
为实现物理层面的一致性并确保画面符合现实逻辑,模型从训练数据与推理机制两端同时着手,形成合力。
训练阶段:通过大规模合成涵盖刚体碰撞、流体运动、柔性形变等物理交互的模拟数据,配合时序因果建模,让模型在训练中习得物理世界的归纳偏置。
推理阶段:借助Test-Time Training在线自适应机制,模型在交互中针对当前场景的物理属性进行轻量级微调,实现“边交互边适应”,即使在未见过的物理情境下也能保持合理响应。
值得一提的是,这一技术路线已获得国际顶会认可。相关研究论文,正式收录于欧洲计算机视觉国际会议(ECCV 2026),为交互式世界模型在三维空间理解与长时序生成方向上,开辟了一条兼具理论原创性与工程可行性的技术路径。
Project Page: https://yanghb22-fdu.github.io/DreamWorld
传统世界模型如同“画师逐帧作画”,HiDream-O1-World则如同一位拥有“空间记忆”的导演,让模型在生成新视角时先“想清楚”三维结构再“画出”画面,从根本上解决了传统“一步到位”式生成的结构性缺陷。 基于原生全模态的这套组合拳,正是智象区别于谷歌和李飞飞的第三条路线的技术底色。
3.原生全模态架构展现强大潜力
世界模型的兴起,表层驱动力是大语言模型在Scaling Law约束下面临的数据枯竭与边际收益递减;但更深层的变革意义,在于它从根本上降低了“创造”的门槛。它让普通用户一键生成可自由探索的3D世界,让游戏开发者绕开传统引擎的繁重流水线,让影视创作者用文字与图像直接“拍摄”复杂场景,让具身智能的训练得以轻量化开展,也让科研工作者能够便捷地进入微观世界进行推演。从AI互动影游到具身智能仿真,从3D场景生产到微观世界推演——每一个需要“构建一个世界”的领域,都将被它重写一遍。
然而,这一切并非凭空降临。世界模型之所以从理论走向现实,恰恰因为它站在一条清晰可辨的进化路径之上——从单模态到多模态,再抵达原生全模态。智象全模态底层架构,为世界模型提供了贯穿训练、推理与生成全链路的统一基座,使其得以建立连贯、完整的世界认知。而空间理解与记忆机制的突破,则进一步验证了原生全模态作为底层架构的生命力与长期潜力。
如果说“语言符号”是AI的第一重智能,那么“物理认知”便是它正在跨越的第二重关口。这一步跨越,正吸引全球的目光。
当然,眼前还有很多硬骨头要啃:算力成本居高不下,复杂因果推理仍是难题。但这恰恰说明,这不是发展的高潮,只是序幕。
(封面图来源:智象未来)
END.






