Ropedia刘子纬:具身智能的Scaling Law,不是算力,是人类的经验

缺少数据、仿真数据现阶段还不够用,行业内在尝试各种办法去实现数据规模的 scaling law。每家的方式都不太一样,想解决的问题也不一样。
在 Ropedia 联合创始人兼首席科学家,南洋理工大学副教授刘子纬看来,这正是当前物理 AI 面临的差距,AI 读过一切,却从未真正体验过任何事。下一阶段需要 Scaling 的,不只是参数或算力,还有人类关于物理世界的经验。
但经验恰恰难以被规模化。在 AGI Playground 2026 的演讲中,刘子纬聊到团队在研究中反复撞上的同一堵墙:模型不断进步,可供学习的真实世界经验依然稀缺、碎片化,而且获取成本高昂。他们意识到,要让模型真正进入物理世界,首先要补上经验数据的基础设施。
Ropedia 的解法,是构建一套真实世界经验引擎,通过软硬件协同降低数据采集成本,把人与环境的交互转化为可以被模型学习的结构化经验。关键不在于攒出一个大数据集,是让采集、训练与失败反馈持续循环,形成难以复制的经验飞轮。而他们的终局目标,是打造出能够看见世界、记住世界、想象世界,并最终在世界中行动的模型。
编译整理自大会演讲,内容经编辑调整。
⬆️关注 Founder Park,最及时最干货的创业分享
我们将通过「AI 产品市集」、内容报道、社群分发等方式,帮你触达早期用户、获得真实反馈,以及建立关键连接。
如果你正在做 AI 相关的事,欢迎和我们聊聊。
01
物理 AI 的 Scaling Law,
是人类经验
大家都知道 Scaling Law,从大语言模型到多模态模型,再到物理 AI,基础模型的进步一直由 Scaling Law 推动。在我看来,互联网教会了 AI 说话,但人类经验将教会 AI 如何行动。
AI 很擅长解释如何制作一杯咖啡。这是感知 AI,它可以给出流畅的操作说明。生成式 AI 也可以生成一个人制作咖啡的逼真视频。但一旦从数字世界进入物理世界,它就会遭遇巨大的失败。
如果 AI 能理解操作说明,也能想象相应的视频,为什么无法可靠地完成这项任务?
这正是当前物理 AI 面临的差距。AI 读过一切,却从未真正体验过任何事。它从未在物理世界里真正体验过怎么煮咖啡,我们目前也不知道怎么把这种体验教给它。
因此,AI 下一阶段需要 Scaling 的,不只是参数、Token 或模拟,还包括关于物理世界的经验。
什么是经验?它可以是被操作物体的重量和摩擦力,可以是接触发生的瞬间,也可以是延迟带来的后果。经验还意味着从失败中学习,因为和人类一样,AI 在真实世界里的尝试不可能每次都成功。语言模型学习的是人类写下了什么,物理 AI 则需要学习人类做了什么、世界对这个动作作出了什么反应,以及最终发生了什么。
如果经验是当前物理 AI 所欠缺的,我们该如何将经验纳入现有的学习范式?
这里我想分享一个观点,每一代 AI 都从不同的基本单元中学习,正是这个基本单位定义了这一代 AI。
第一代是感知 AI,基本任务是把像素转化为标签,让你知道这是什么,图像里是一只猫还是一只狗。
第二代是生成式 AI,过去五六年,我们见证了生成式 AI 的爆发,它把 Prompt 转化为内容。大家可能用过 Stable Diffusion、GPT Image、Sora 或 Seedance,这些系统回答的问题是,它可能是什么样子的。
下一代物理 AI 的基本单元,是把经验转化为后果,并最终转化为行动。它要回答的是,如果我这样做,会发生什么?接下来我应该做什么?它处理的不再是一张图像、一段视频或一条孤立的轨迹,而是一段完整的经验,从行动到后果,再到下一步行动。
经验与视频有很大不同。视频展示的是发生了什么,经验还要解释为什么会发生,以及接下来会发生什么。它需要同时包含我们看到了什么、身体如何运动、接触发生时触碰和感受到了什么、世界如何响应、我们如何推演可能的结果,以及最终决定下一步怎么做。这就是世界模型,先仿真,再学习。
在普通视频里,视觉、动作、触觉和反馈分散在不同维度,彼此割裂。物理 AI 真正需要的是一个统一的经验闭环。这也是「苦涩的教训」在物理 AI 上的体现。
研究已经反复证明,AI 能够充分利用学习与计算的通用方法,最终会胜过依赖人工规则和领域知识的手工设计方法。对物理 AI 来说,从经验中学到的能力,也会胜过手写的知识。我们不应依赖从视频里手工提炼出来的规则,而是要把整个经验闭环作为整体来学习。
要理解经验的意义,可以回顾 AI 研究的历史,看它如何从「看见世界」走向「在世界中行动」。
10 年或 20 年前,研究人员主要关注感知问题。李飞飞教授带领创建的 ImageNet,是其中一个具有决定意义的里程碑。它让机器能够从原始视觉信号中学习,把像素转化为标签。
大约 5 年前,研究人员开始关注感知之外的问题,包括几何和形状层面的线索。于是出现了 Objaverse 等数据集,用于学习物体结构和 3D 表征。现在,我们又来到一个新的十字路口,物理 AI 需要什么样的新数据源?
我认为答案是面向动作的经验层数据。因此,我们推出了一种新的数据源 Xperience-10M,让模型能够从交互与反馈中学习。这种转变不只关乎数据源或 AI 的学习范式,也改变了数据的获取方式,以及我们究竟该怎么采集这些数据。
ImageNet 的数据主要通过众包和抓取互联网被动收集。Objaverse 同样是被动收集,但它不只是从互联网上众包数据,还需要专家精心策划,比如来自 3D 艺术家的经验。到了 Xperience-10M,数据的获取不再是被动的,而是主动的。人类正在与世界互动,这些互动本身成为数据。最终,它关注的也不只是人类,还包括 Agent 如何与世界互动。
02
具身智能:
能看见、能记住、能想象、能行动
我们的目标,是构建能够看见世界、记住世界、想象世界,并最终在世界中行动的模型。
首先,机器如何看见世界?
我们的判断是,人类是进入物理世界最丰富的入口。我们一直在打造 SMPLer-X,这是第一个能从日常视频中恢复表现力丰富的人体姿态和体型的基础模型。在这个项目中,我们观察到了一条非常清晰的人体感知、捕捉与模仿的 Scaling Law:随着人体训练样本持续增加、人类数据越来越多,模型的估计误差不断降低。
这意味着,人类不是应该被过滤掉的「噪声」数据,而是理解物理世界如何运作的最佳老师,机器应该向人类学习。
看见了世界之后,下一个问题是如何记住世界。
智能需要把今天发生的事与昨天发生的事联系起来。今天的大多数 AI 工具,仍然只擅长为一段 10 秒左右的视频生成描述。但真正的物理 AI 应该能跨越数小时、数天,和不同的人进行推理。
为此,我们做了 EgoLife 项目,邀请 6 个人共同生活 7 天,为每个人采集了超过 50 小时的第一视角视频。这些不是孤立的视频片段,是同步记录的第一人称视角、第三人称视角、音频、视线、动作和人机交互等信息。更重要的是,它们跨越了完整的一周。我们需要为物理世界构建记忆层,让 Agent 能把今天的事与昨天联系起来。
接着是想象。
世界模型绝不只是一个像素效果更好的视频生成器。Seedance、可灵等视频模型并不是真正的现实世界仿真器。真实世界模拟器应该模拟行动的后果。假设你用当前的视频和 3D 模型生成一个盒子,你不知道在某种重力条件下,比如在地球上或在月球上,这个盒子能否能立住。它的几何形态可能很漂亮,但里面没有物理规律,生成出来的物体甚至可能站都站不稳。
一个真正的真实世界模拟器,至少需要具备三个条件。
首先,它要满足物理上的合理性,能够表征重量、材质,以及物体在什么条件下可以保持稳定。其次,它必须以行动为条件,如果以某种方式推动物体,它会发生什么变化。最后,它需要保持长时间跨度的一致性。我们希望能对世界进行长时间建模,不只是接下来的 5 秒,而是一分钟、一小时,甚至一整天。
我们的 PhysX-Anything 项目,可以从一张图像生成可直接用于模拟的物理 3D 资产。只需一部手机或一台头显拍的照片,就可以创建世界模型,它包含的不只是像素,还有物理属性。这些资产可以用于在世界模型中训练机器人策略。我们的目标是从「看起来正确的像素」走向「行为表现正确的资产」。
这是从过去的视频模型到当前世界模型的一次重大转变。生成式 AI 创造的是能看的世界,物理 AI 需要的是能行动的世界。
最后一项能力是行动。
很多人都熟悉今天的 Agent 使用的「Thinking Mode」,但物理世界不会停下来等待模型完成思考再继续运行。因为物理世界是实时运行的,模型必须与真实世界的频率对齐。因此,具身智能本质上是一种受到延迟约束的智能。在数字世界里,模型可以思考一个小时,再完成任务。在物理世界里,它必须实时响应。
在我们的 DynamicVLA 项目中,机器人可以操作正在滚动、滑动和移动的物体。为此,模型必须通过动作的流式输出和连续推理,把延迟直接纳入执行过程。
03
真实世界数据集可以被复制,
但经验飞轮不能
看见、记忆、想象和行动,是我们在实验室里研究的四项能力。但在构建这些系统的过程中,我们不断撞上同一堵墙,模型持续进步,真实世界的经验却依然稀缺、碎片化,而且获取成本高昂。
我们逐渐意识到,在继续构建模型之前,必须先补上缺失的基础设施。
对今天的大语言模型来说,瓶颈通常是算力。只要拥有更多 GPU 和更高预算,通常就能构建更好的模型。在生成式 AI 的 Pipeline 中,数据已经以文本、图像和代码的形式存在于互联网上。只需要标注和清洗这些数据,再用它们进行训练,就可以获得强大的 LLM 和 Agent。
物理 AI 不同,瓶颈已经从算力转向真实世界数据,我们首先必须为真实世界的数据构建基础设施。
在具身智能的 Pipeline 中,互联网上几乎没有机器人数据,这是第一个断点。与此同时,也没有可规模化的标注 Pipeline。你可能不知道应该标注什么,也没有一个基础模型能帮你完成标注。这条 Pipeline 是断的。
数字世界与物理世界的数据,还存在几项根本差异。
网页天然是数字化的,可以直接从网络抓取。但绝大多数物理经验从未被记录下来。
文本的格式基本统一,传感器、机器人和环境却高度异构,很难标准化。数字数据几乎可以以零边际成本复制,但采集物理数据需要硬件、人员和实地作业。Token 很容易组织,但接触、深度、轨迹、动作与反馈必须在同一条时间轴上精准同步。这也是为什么 OpenAI 等公司开始强调 FDE。你必须真正进入现场,而不是坐在电脑前下载数据集。
如果经验是一种稀缺资源,就必须有人把它工业化。
我们的解决方案,是低成本、大规模地把真实世界交互结构化。在 Ropedia,我们正在构建一个把真实世界数据转化为交互数据的引擎,同时利用结构化标注连接人类与人形机器人,最终让这些数据服务于具身 AI 或世界模型。
这不只是构建一个产品,而是定义生态系统中的一层。第一层是感知,许多公司都在开发传感器和动作捕捉系统。第二层是我们想聚焦的经验引擎,构建世界理解与数据智能。最后一层是数据经过交付和验证,在真实世界中产生影响。
目前,我们正在与全球大约 200 个机器人及模型团队合作。我们希望成为赋能者,而不是唯一的主导者。
生态的判断在先,产品自然是随之而来的结果,我们做的是硬件和软件的协同设计。硬件叫作 HOMIE,你可以把它想象成你的「伙伴」。它让数据采集变得轻量、快速且经济,可以让部署速度提高 10 倍,同时把成本降低到原来的十二分之一。
借助 HOMIE,只需要一台头戴式设备,无须任何外部设备,就可以记录第一视角数据,有时也会加入第三人称视角作为辅助信号,得以大规模采集真实世界数据。我们利用轻量化的空间基础模型完成多模态空间交互感知与标注,让系统在真实环境中有效运行。
我们也希望回馈社区,因此开源了 Xperience-10M。它是一个高质量的人类交互数据集,任何人都可以在任何地方采集。数据集包含 1000 万个经验片段,已经发布在 Hugging Face 上。目前,它是 Hugging Face 具身 AI 类别中下载量最高的数据集。
但我想强调的是,这不只是一个数据集,更是一个闭环。我们采集了并结构化数据,把数据输入模型,再让模型在真实世界中行动。模型在执行中暴露失败,这些失败又会告诉我们,下一步应该采集什么数据、补齐哪些经验。数据集随时可以被复制,我们真正想构建的,是一个价值能够随时间持续复利的经验飞轮。
04
物理 AI 真正的壁垒是闭环,
不是数据集
最后,分享在这段研究和创业经历中形成的三个观点。
第一,真正的壁垒是闭环,不是数据集。静态数据随时可以被复制,其价值也可能不断被稀释。但闭环会持续增值并形成复利,这才是决定性的因素。
第二,人类是物理 AI 的启动引擎。提到物理 AI,很多人会想到特斯拉和自动驾驶。自动驾驶今天为什么能够取得这样的进展?是因为道路上有一支大规模车队,可以持续采集海量数据。那么,具身 AI 或物理 AI 的车队在哪里?我们认为,人类就是物理 AI 最大的现成「车队」。我们应该利用这个极其丰富的物理世界经验来源。
第三,先做垂直领域,再走向通用。当我们不只是打造模型,而是打造整个经验层时,会发现越深入一个领域,就越能快速跑通闭环。先在一个垂直场景中把闭环做深,让它产生复利,再逐步扩展到通用场景。
今天我最想传达的信息是,不要只构建一个更大的大脑,还要构建更好的经验闭环。首先是经验,其次是闭环。过去 20 年,互联网完成的是人类知识的数字化。未来 10 年或 20 年,我们相信,下一层基础设施将尝试把人类经验数字化。


