HOMIE Gen2重磅登场:以人类经验为钥,开启Physical AI新纪元
在人工智能领域,物理智能(Physical AI)的发展正面临关键转折点。尽管当前感知模型能精准解析场景,生成式模型可合成逼真画面,但当机器人进入真实物理世界时,连基础抓取动作都难以稳定完成。这种“知行脱节”的现象,暴露出传统技术路径的深层矛盾——物理智能的突破,不再取决于模型规模,而在于如何将人类经验转化为可规模化学习的数据。
总部位于新加坡的Physical AI企业Ropedia,近日推出第四代多模态采集系统HOMIE Gen2,试图破解这一行业难题。该设备通过全景视觉与空间音频的同步记录,构建出包含动作、环境、反馈的完整经验图谱。其核心创新在于将传统数据采集升级为“经验工程”,通过硬件、算法与基础设施的协同,实现人类经验的工业化生产。
“AI读过所有书,却从未走过路。”Ropedia联合创始人刘子纬用比喻揭示问题本质。传统机器人训练依赖遥操作示范,但高昂的机器人本体成本与有限的操作场景,导致数据产能严重受限。HOMIE Gen2则颠覆这一模式:通过无本体采集技术,将数据产能绑定在人类数量而非机器人保有量上。全球数十亿人日常互动产生的物理经验,成为取之不尽的数据源泉。
新设备的硬件设计充分体现“经验优先”理念。380克的轻量化机身支持13小时连续作业,4目全景摄像头与4路空间音频阵列实现360度环境记录,多传感器同步精度达50微秒。这种设计使采集不再依赖专业实验室,家庭、工厂、商场等开放场景均可自然部署。据测试,其部署效率较前代提升10倍,采集成本降至1/12.5,且支持多设备协同作业,可一次性完整记录复杂场景。
数据质量是经验工程的关键。HOMIE Gen2采集的原始信号经过自动重建与标注,直接生成训练级数据包。金标准样本集测试显示,其空间定位误差仅千分之二,深度误差小于2.5%,手部关键点捕捉精度达4.68毫米,动作语义标注准确率96%。这种“开箱即用”的特性,极大降低了客户的数据处理门槛。
多模态融合技术突破了传统数据孤岛。系统将双目视频、深度图、3D物体跟踪、全身动作捕捉等十余种模态统一到同一时空坐标系,使模型能同步理解“看见了什么”“做了什么”以及“环境如何变化”。这种全景式经验记录,相当于为物理世界构建了“思维链”,让模型能直观把握动作与结果的因果关系。
Ropedia的野心不止于硬件。公司正构建包含硬件采集、数据加工、模型训练的三层基础设施:底层通过HOMIE系列设备捕获原始经验,中层用智能体驱动的流水线实现自动化处理,顶层则训练统一多模态模型反哺系统。这种闭环设计已产生实质性成果——旗舰数据集Xperience-10M包含1000万个交互片段、1万小时带音频视频,总规模近1PB,为行业提供了首个大规模物理经验库。
