北大等联合研发ω
家庭场景被视为检验人形机器人技术实力的终极考场。相较于工厂内结构化、可预测的流水线作业,家庭环境存在大量非确定性变量:杂乱堆放的物品、动态变化的家具布局、需要多步骤协同的操作任务,这些因素共同构成了机器人技术落地的天然屏障。例如,从冰箱取物时需侧身避开障碍物,清洁桌面时需同步调整身体姿态与工具位置,这些对人类而言简单的动作,对机器人系统却需要突破感知、决策与执行的协同瓶颈。
针对这一技术难题,由多所高校及研究机构组成的联合团队近日提出创新解决方案——隐空间预测世界动作模型ω-0。该模型通过整合语言指令、环境感知与本体状态信息,直接生成底层控制系统可解析的精简动作特征,实现"移动-操作"同步进行的全身动态协同。在包含跨区域收纳、高低位清洁等11项典型居家任务的测试中,其第一视角模式成功率达79.1%,全场景模式更突破81.8%,性能指标全面领先现有主流模型。
传统机器人系统普遍采用"先定位后操作"的分阶段策略,这种模式在连续作业场景中暴露出明显缺陷。以清洁大尺寸桌面为例,机械臂达到工作极限后必须移动身体,但移动过程中需持续保持清洁工具与接触面的有效互动;拖地作业时,手臂施力变化会直接影响身体平衡,要求腿部实时调整支撑重心。现有系统的独立决策机制往往导致动作衔接卡顿、接触中断甚至倾倒风险,难以满足家庭场景的连续作业需求。
ω-0模型的创新性体现在架构设计与训练体系的双重突破。研发团队摒弃了传统的视频-动作逆向映射路径,转而构建基于查询的统一表征框架。该架构通过未来视觉特征提供任务进程与场景演变的宏观指引,动作分支直接生成全身运动潜在指令,实现感知-决策-执行的全链路贯通。为提升模型对真实场景的适应能力,团队设计了三阶段递进式训练方案:首阶段进行全身动作的视觉语言模型预训练;次阶段融合视觉、语言与本体数据,通过视频查询预测环境动态变化;最终阶段引入海量真实居家操作数据,完成场景自适应的精细化调优。
支撑这项技术突破的,是一个包含40.3小时真实环境数据的大型开源数据集ω-HOME。该数据集涵盖4827条任务轨迹与24类典型操作,每条轨迹均同步记录语言指令、多视角视觉信息、本体状态及全身运动数据。这种多维度的数据采集方式,有效降低了下游任务训练对人工示范数据的依赖,为行业提供了可复用的技术基础设施。
尽管81.8%的任务成功率标志着重要技术进展,但家庭机器人的实用化仍面临多重挑战。真实场景中的光照变化、物体遮挡、突发干扰等不可预测因素,对系统的鲁棒性提出更高要求。当前研究为行业指明了关键技术路径——将机器人视为统一运动体而非独立部件的组合,这种整体性思维模式或将成为突破实验室演示阶段、迈向生活化服务的关键转折点。
