北大等联合研发ω
家庭场景,向来被视为人形机器人最具潜力的应用领域,却也是技术突破难度最大的挑战场。与工厂中结构化、可预知的流水线作业不同,家庭环境充满不确定性:堆满杂物的桌面、散落一地的玩具、需要侧身绕过的家具,甚至擦桌子时不断变化的身体姿态,这些对人类而言稀松平常的家务,却让人形机器人陷入“动作卡顿”“接触中断”甚至“失去平衡”的困境。
近日,由南洋理工大学、北京大学、香港科技大学(广州)及智源研究院联合研发的ω-0模型,为这一难题提供了新的解决方案。这款基于隐空间的预测世界动作模型,通过统一架构实现了语言指令、环境感知与动作生成的深度融合。输入指令后,模型可同步识别场景特征与自身状态,直接输出底层控制系统可执行的精简动作指令,支撑机器人完成“边移动边操作”的全身协同任务。
研发团队针对11项高难度居家任务展开实测,涵盖跨区域物品收纳、高低位杂物清理、床上衣物拾取等复合场景。测试结果显示,ω-0在第一视角任务中成功率达79.1%,全场景模式下更突破至81.8%,全面超越π-0.5、EgoVLA等主流基线模型。这一成绩标志着人形机器人从“分步执行”向“动态协同”的跨越式进步。
传统机器人系统多采用“先移动后操作”的分步策略,在简单场景中尚可应对,但面对需要连续作业的家庭任务时,弊端显著。例如擦大尺寸桌子时,机械臂需反复移动身体;拖地时,拖把运动直接影响身体重心,双腿必须随手臂动作实时调整。这种“腿手分离”的决策模式,极易导致动作衔接不畅甚至失衡。
ω-0的创新之处在于摒弃了视频到动作的逆向转换路径,转而构建查询表征架构。该架构通过未来视觉特征提供任务进度与场景演变的宏观指引,动作分支则直接生成全身动作潜在指令。这种设计使机器人能够像人类一样,将身体视为统一整体进行决策,而非将腿和手视为独立模块。
为适配真实居家场景的复杂需求,研究团队设计了三阶段递进式训练体系:第一阶段进行全身动作VLM专属预训练;第二阶段引入人机动作隐变量融合技术,借鉴V-JEPA思路融合视觉、语言与本体数据,通过视频查询预判环境变化;第三阶段基于海量真实数据开展精细化微调,使模型具备自主适配各类场景的能力。与此同时,团队还开源了包含40.3小时真实环境数据、4827条任务轨迹的ω-HOME数据集,为行业训练提供了重要支撑。
尽管81.8%的成功率已属行业领先,但距离真正融入家庭、实现长期自主运行,人形机器人仍需突破多重技术壁垒。ω-0的突破意义在于,它为行业指明了“全身协同”的技术路径——只有当机器人学会在移动中操作、在操作中调整姿态,才能从实验室演示走向真实生活服务。这场关于“腿手一体化”的探索,或许正开启人形机器人技术的新纪元。
