2026年8月17日,智象未来(HiDream.ai)正式发布HiDream-O1-World模型。它不是又一个“把提示词变成一段视频”的模型,而是一套原生全模态的交互式世界模型——让 AI 生成的不再是一段只能看、不能碰的画面,而是一个可以走进去、改一改、玩起来的动态世界。
工具地址:智能未来官网

一、它到底新在哪:从“生成视频”到“生成世界”
过去两年,AI 视频的叙事主线一直是“像不像、动不动、稳不稳”。到了 2026 年,这条主线开始分岔:一部分模型继续在画质和时长上卷,另一部分则开始回答一个更本质的问题——能不能让 AI 生成的东西,成为一个可以被探索的世界。
HiDream-O1-World 明显站在后一条路线上。官方给它下的定义是“原生全模态交互式世界模型”,关键词有两个:
- 原生:不是事后拼接,而是在架构层面就为“交互”而设计。
- 交互式世界:用户不只是输入提示词,而是能持续参与、操作、改变画面里的世界。
这背后对应的是两个长期困扰视频生成的难题——长时程时空一致性和物理一致性。前者决定一个世界能不能“推演下去而不崩”,后者决定它“符不符合常识”。

二、三大能力:漫游、编辑、交互
官方把 HiDream-O1-World 的核心能力拆成三件事,正好构成一个完整的体验闭环。
漫游:用户可以控制角色前进、后退、转向,也能在第一人称与第三人称视角之间切换,像玩开放世界游戏一样自由探索。
编辑:不再是“生成完就定格”。用户可以对画面里的物体进行改动,让世界实时响应。
交互:世界对用户的操作给出符合逻辑的反馈,而不是机械地重播一段预设动画。
这三件事合在一起,指向的是一个明确的趋势:AI 生成内容的形态,正在从“被动观看”转向“主动参与”。

三、技术底座:UiT 原生全模态架构
支撑这套能力的是智象自研的原生全模态(UiT)架构。它允许模型以文本、图像、交互操控等多种方式输入,并一键生成时空一致、符合物理规律、可长时推演的完整世界。
这里有两个值得展开的突破:
- 长时程时空一致性——过去视频模型最怕“镜头一长就穿帮”,HiDream-O1-World 的目标是让世界在长时间推演中保持结构稳定。
- 物理一致性——让画面里的物体遵循基本物理规律,而不是“好看但反常识”。
简单说,一致性决定了世界的“可信度”,物理规律决定了世界的“真实感”,二者叠加,才有了“可交互”的前提。
四、成绩单:WBench 登顶
口说无凭,榜单是最直观的注脚。在由美团 LongCat 团队与复旦大学联合推出的交互式视频世界模型评测基准 WBench 上,HiDream-O1-World 在 Navi 分榜以平均 80.9 分登顶。
细分维度上,它在物理(Physical)维度以 73.3 分位列第一,一致性(Consistency)维度达到 88.0 分。这两个数字恰好呼应了前面说的两大突破——物理和一致性,正是交互式世界模型最看重的两项硬指标。

五、为什么这件事值得关注
如果把 AI 生成内容的演进画一条线,大概是这样:
文本 → 图片 → 视频 → 可交互世界
每一步,用户从内容的“旁观者”往“参与者”挪一寸。HiDream-O1-World 的意义,不在于它比上一代视频模型“画质更高清”,而在于它把“交互”从演示特性,变成了一个模型的原生能力。
这带来的想象空间,远远超出“做一段短片”:
- 游戏与影视:实时探索、可编辑的场景,可能改变内容生产与试错的成本结构。
- 模拟与训练:符合物理规律的世界,为具身智能、自动驾驶等场景提供更丰富的测试环境。
- 创作者工具:让普通用户从“描述一个画面”升级到“搭建一个世界”。
当然,也要泼一点冷水:“全球首款原生全模态”是厂商的自述口径,产品开放范围、能力边界和商业化节奏,仍需以智象未来的官方后续说明为准。榜单成绩是当前时点的快照,行业竞争激烈,排名随时可能变化。
但方向本身,已经足够清晰——当 AI 不再满足于“画给你看”,而是开始“造一个让你进去的世界”,内容产业的下一扇门,正在被推开。
说明:本文根据截至 2026 年 8 月的公开资料整理。产品名称、功能、入口、榜单成绩及商业政策可能调整,请以智象未来(HiDream.ai)官方最新说明为准。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:

