北大等高校联合研发ω
家庭场景,向来被视为人形机器人最具潜力的应用领域,却也是技术突破难度最大的挑战场域。工厂中的工业机器人面对的是标准化、可预测的流水线作业,而家庭环境则充斥着各种不确定性:杂乱堆放的物品、突然出现的障碍物、需要灵活调整的操作空间。例如,从冰箱取水时需绕过餐椅,清洁桌面时需随擦拭范围移动身体,这些对人类而言轻而易举的日常动作,对人形机器人而言却是需要突破的多重技术壁垒。
近日,由南洋理工大学、北京大学、香港科技大学(广州)及智源研究院组成的联合团队,推出了一款名为ω-0的隐空间预测世界动作模型。该模型通过创新架构设计,实现了语言指令输入、环境感知、自身状态识别与底层动作生成的闭环链路。实验数据显示,在完成"边移动边操作"的复合任务时,ω-0 Ego第一视角模式成功率达79.1%,全场景Omni模式更突破至81.8%,显著优于π-0.5、EgoVLA等主流基线模型。
传统机器人系统常采用"移动-操作"分阶段策略,即先抵达目标位置站稳,再启动机械臂执行任务。这种模式在简单场景中尚可运行,但在需要连续作业的家庭环境中弊端尽显。以清洁大尺寸桌面为例,机械臂到达极限后必须移动身体,但移动过程中需保持抹布与桌面的持续接触;拖地时手臂动作会改变身体重心,双腿需实时调整支撑点。任何环节的独立决策都可能导致动作中断或失衡,这正是ω-0团队着力突破的技术痛点。
研究团队摒弃了传统的视频到动作逆向转换路径,转而构建统一查询表征架构。该架构通过未来视觉特征提供任务进度与场景演变的宏观指引,动作分支则直接生成可供底层控制器执行的全身动作指令。这种设计使机器人能够像人类一样,将移动与操作视为一个整体动作序列,而非割裂的独立模块。
为提升模型对真实家庭场景的适配能力,研发团队设计了三阶段递进式训练体系:第一阶段进行全身动作视觉语言模型(VLM)专属预训练;第二阶段引入人机动作隐变量融合技术,借鉴V-JEPA框架融合视觉、语言、本体等多维数据,通过视频查询预判环境变化;第三阶段利用真实居家移动操作数据进行精细化微调。这种训练范式使模型能够自主适应不同家庭的布局特征与操作习惯。
支撑这一训练体系的,是团队同步开源的ω-HOME真实世界家庭数据集。该数据集包含40.3小时真实环境数据、4827条任务轨迹及24类典型任务,每条轨迹均同步记录语言指令、多视角视觉信息、本体状态及全身运动轨迹。这种多维数据结构为模型训练提供了丰富的上下文信息,显著降低了对人工示范数据的依赖,为行业研究提供了重要基础设施。
尽管81.8%的任务成功率已属行业领先,但研究团队清醒认识到,要实现真正意义上的家庭服务机器人,仍需突破长期自主运行、跨场景泛化等关键技术。当前成果的价值在于,它验证了将机器人全身视为统一动作系统的技术路线可行性,为从实验室演示向生活化服务转型提供了关键技术支撑。当机器人学会在移动中调整操作姿态,在操作中优化身体平衡,人机共融的未来场景正逐步从设想走向现实。
