Ropedia发布HOMIE Gen2:具身智能的下一场竞争,是经验的规模化生产|甲子光年


当“经验”成为物理世界的提示词,谁来规模化地生产它?
8月19日,Generalist AI发布了新一代具身基础模型GEN-1.5。展示了一种名为physical prompting(物理提示)的能力:把一段几秒钟的真实演示片段放进上下文,机器人不经重新训练,就能直接上手一个新任务。演示即提示,在10项测试任务上,仅凭单次演示的平均成功率即达59%。
比起技术细节,这件事真正值得注意的是它释放的信号:头部模型公司已经证明了,高质量的人类经验片段,可以像提示词一样直接驱动机器人。既然经验怎么用已经有了答案,那么行业接下来面临的问题是,经验从哪来。
1.供给,卡在成本结构上

供给难,先难在成本。行业主流的采集方式仍是遥操作:一名操作员配一台机器人,手把手逐条示范。机器人本体动辄数十万元,一人一机的配比让数据产能被死死锁在机器人保有量上;换一个场景就要搬一次设备、重做一次布置,多样性也上不去。机器人数据长期又贵又稀缺,原因就在这里。
更隐蔽的一道坎是质量。具身数据圈流行一句话:数据越来越多,能用的始终很少。大量数据处在“混沌状态”,时间戳对不齐、模态不同步、标注残缺,采回来还要再花一遍清洗整理的钱,真正能直接进训练的寥寥。

数据供给的两道坎
因此,产业竞争的逻辑正在换轴:从“谁的模型更大”,转向“谁的数据闭环转得更快”。需求端已被GEN-1.5验证,供给端却仍卡在成本与质量的双重约束里。
2.一台为“生产经验”而造的设备
就在GEN-1.5发布几天后,「甲子光年」获悉,总部位于新加坡的Physical AI公司Ropedia正式发布新一代多模态采集系统HOMIE Gen2,并将在全球多地公开发售。这是这家公司十二个月里的第四代采集硬件;今年3月,他们刚刚发布了千万片段级的数据集Xperience-10M。

HOMIE Gen2示意图
时间上的巧合背后,是同一条产业逻辑:模型侧证明了经验的价值,供给侧就必须有人把经验做成可规模化的产品。HOMIE Gen2对准的,正是这个缺口。
在展开介绍这台设备之前,值得先厘清Ropedia反复强调的一个区分:经验,不等于视频。
联合创始人兼CEO陈昭熹打过一个比方:"学做一道菜,只看别人做的视频,你可能知道最后成品长什么样;但真正亲手做过,才会知道什么时候下锅、该用多大力、食材发生了什么变化。"看视频得到的是画面,亲手做过得到的才是经验:手上的力度、时机的把握、每一步操作和食材变化之间的对应关系。
在他们的定义里,视频、RGB、动作捕捉、深度,任何单一模态都不是经验,把它们简单叠在一起也不是;只有当动作、意图、环境、时序上下文与多模态信息同时在场、互相对齐,一段记录才称得上经验。类比语言模型会更直观:LLM学的是人类写下的内容,Physical AI要学的,是人类做了什么、世界如何回应、接下来发生了什么。

Ropedia HOMIE GEN2 Demo
竞争的焦点随之改变:比的不再是小时数,而是每一小时里,装进了多少对得齐的信息。
HOMIE Gen2的能力,可以概括为三点:沉浸式的人类经验、多模态的协同理解、开箱即用的交付质量。翻译成商业语言:采得全,对得齐,拿来就能训。
采得全,靠的是一台约380g的头戴设备:4目全景实现360°无死角覆盖,外加4路空间音频,支持约13小时连续采集,不需要任何外部布置,家庭、工厂、商场都能直接开工。
对得齐,靠50µs级的多传感器同步:视频、深度、位姿、手部与全身关键点、多层文本标注等十余种模态,被压在同一时间轴、同一坐标系里;多台设备还能同步作业,从不同人的视角一次采全同一个场景。
拿来就能训,则体现在一组可量化的精度指标上。据Ropedia基于金标准样本集的测试:空间定位平均相对误差约千分之二,手部21关键点动捕平均误差4.68 mm,深度范围误差低于2.5%,动作语义标注准确率96.0%。对数据买方而言,这意味着省掉二次处理,直接进训练。

HOMIE Gen2精度测试指标
据Ropedia介绍,相比上一代方案,HOMIE Gen2的部署速度提升约10倍,采集成本降至约1/12.5;量产产能可达约万台规模,面向社区开发者的计划也将推出,入选者可免费获得硬件与API额度。
3.从一台设备,到一条产线
真正让HOMIE Gen2具备规模化潜力的,不只是参数提升,更重要的是它改变了数据采集的成本结构。
传统遥操作需要“一个人配一台机器人”,因此能采多少数据,很大程度上取决于有多少机器人可以投入使用。机器人数量有限、成本又高,数据产能自然很难快速扩大。而无本体采集不需要机器人参与,只要有人佩戴设备,就可以在真实环境中持续产生数据。 换句话说,前者的规模上限是机器人数量,后者的规模上限则是人。
公开研究已经表明,即使只是使用单摄像头记录第一视角视频,当数据规模从两万小时扩大到百万小时,模型能力仍然能够持续受益于数据增长。在 Ropedia 看来,这还只是人类经验最基础的一种形态;如果能够进一步记录更完整、更丰富的多模态经验,其价值还有更大的提升空间。
对Physical AI而言,最庞大的采集网络其实早已存在:每天都在与物理世界打交道的几十亿人。HOMIE Gen2要做的,是让这张天然存在的“人类网络”成为可以持续生产训练数据的网络。当数据采集的节点从昂贵、稀缺的机器人变成人之后,数据生产也就有机会从“小规模项目制采集”,走向真正的大规模复制。
单台设备解决的是采集问题,而Ropedia想做的是把采集、加工和模型反馈串成一个完整闭环。在这套体系里,硬件采集经验,数据基础设施加工经验,模型进一步理解经验并反哺系统,最终以Xperience Dataset的形式向客户交付。
把硬件采回来的原始数据变成可训练经验的,是中间的数据基础设施层:智能体驱动的数据流水线,把处理从手工调参推进到自动化;顶层的多模态模型则自动标注新流入的经验,再部署回硬件,为下游策略模型提供能力。真实世界的经验没法像网页一样被爬取,只能像产品一样被生产,这套三层结构,就是 Ropedia 搭建的“经验生产线”。

Ropedia自研的自我演进基础设施
这套体系已经有了可检验的产出。此前发布的旗舰数据集Xperience-10M包含约1,000万个真实世界交互片段、1万小时带音频的第一视角视频,总规模接近1PB;据了解,Ropedia已服务超过20家全球机器人及基础模型团队,并完成了数千万美元天使轮融资。
这套体系背后,是持续向采集源头延伸的硬件能力。十二个月里,Ropedia从3D打印原型机“竹蜻蜓”,一路迭代到完成首笔销售的R-Ego、产品化的Gen1,再到今天的Gen2;CMOS、PCB与结构件均坚持自研。四代设备的连续迭代,也让采集、数据处理与模型能力得以同步演进。在Ropedia的定义里,这系列设备是一个新品类:Human Experience Engine®。通过采集的经验训练模型,模型的能力缺口反过来定义下一轮采集什么,飞轮每转一圈,数据就更有方向。
4.终局:在马车时代开始“点火”
这条路,通向哪里?陈昭熹把今天的机器人行业,比作汽车尚未普及的马车时代:真正的"汽车",也就是大规模部署的机器人,还没有来到路上;但驱动它们的燃料,可以先准备好。人类经验,正是点燃新时代的"点火阶段"。
因此,他对公司的定位很清晰:"Ropedia绝不只是一家数据采集公司,数据采集只是第一步。"三到五年后,他希望这家公司成为覆盖数据、硬件、基础设施与模型的机器人学习基础设施公司。
回到开头:GEN-1.5证明了经验作为"物理提示词"的用法,而 Ropedia 押注的,是成为这种提示词的规模化供给方。当具身智能的竞争从模型层下沉到数据的成本结构,这场战争,才刚刚开始。
END.





