从“执行程序”到“自主推理”:千寻智能在人形机器人赛场实现关键跨越
在第二届世界人形机器人运动会上,一场关于机器人能力的“大考”吸引了全球目光。与以往侧重速度、跳跃等本体能力的比拼不同,此次赛事新增的场景赛成为焦点——餐饮、办公等真实场景中,机器人需独立完成复杂任务,自主推理能力成为胜负关键。在这场考验中,首次参赛的千寻智能凭借“全自主推理”策略脱颖而出,斩获办公场景冠军、餐饮场景亚军,成为唯一全程未依赖人工操控完成多环节任务的团队。
场景赛的规则堪称严苛。以办公场景为例,机器人需在20分钟内完成会议布置、文件打印、废弃物处理等长链条操作,任一环节失误即判零分。餐饮场景则要求机器人自主识别随机摆放的热食柜位置,完成餐品加热、饮料制作等任务。这些任务与传统的跑跳、格斗等单点能力测试截然不同,更接近真实生产力场景的需求——机器人需理解指令、规划路径、应对突发状况,并在无人工干预下完成交付。例如,办公场景中纸张易弯折的特性,要求机器人实时调整抓取力度和角度,这对模型的动态适应能力提出了极高挑战。
千寻智能的参赛策略堪称“精准打击”。与其他团队采用“人海战术”或遥控操作不同,千寻仅报名餐饮、办公两项最具代表性的场景,集中资源攻克最难任务。其机器人搭载自研的Spirit v1.6具身基座模型,所有推理均在本地完成,不依赖云端或人工实时操控。这种“全自主”模式难度远高于遥控操作——后者得分需乘以0.5系数,且无法应对真实场景中的随机性。例如,物品位置变化、设备操作差异等细节,均需机器人自主判断。最终,千寻成为唯一从预赛到决赛均以自主推理晋级的团队,用实力证明了“大脑”比“手脚”更关键。
千寻智能的核心突破在于解决了“金鱼记忆”难题。传统机器人只能执行短链条任务,难以保持对长期目标的持续理解。而Spirit v1.6模型通过VLA与世界模型深度融合的架构,让机器人具备“长程规划”能力。例如,在办公场景中,机器人需将“准备会议”这一模糊指令拆解为“布置桌签”“摆放矿泉水”“打印文件”等子任务,并实时跟踪进度。这一能力背后,是千寻构建的“数据金字塔”体系:底层是互联网人类视频数据,用于建立通用场景理解;中层通过可穿戴设备采集真实交互动作,补足接触信息;顶层则利用真机操作产生的高价值数据优化模型。据介绍,其自研的uDAS数采设备已迭代至第七代,数据采集成本降至传统方式的1/10,可用性提升至95%。
这场赛事的背后,折射出机器人行业的深层变革。过去,行业更关注“身体”指标——如奔跑速度、负载能力等,但2026年上半年的融资数据揭示了新趋势:超半数资金流向“大脑派”企业,本体厂商占比不足两成。国内已有8家具身智能企业估值突破200亿元,其核心叙事均围绕通用智能模型展开。业内人士指出,机器人竞争已从“本体能力”转向“具身大脑”,大模型的迭代速度、数据体系的完善程度,将成为决定企业长期价值的关键因素。
千寻智能的夺冠,为这场变革提供了实证。在餐饮和办公两个差异巨大的场景中,其机器人均能自主理解任务、纠正误差并完成交付,验证了同一套模型的跨场景泛化能力。例如,从“把可乐放进冰箱”到“整理会议文件”,机器人需基于对物理世界的通用理解生成差异化动作,而非切换预设程序。这种能力,正是机器人从实验室走向真实生产力的关键门槛。
当机器人不再满足于“看起来聪明”,而是能“证明自己真的聪明”,行业便进入了新的阶段。过去,跑跳、舞蹈等“花活”更容易吸引眼球,但餐饮、办公等场景才是机器人最终的战场。千寻智能的突破表明,世界级身体需要世界级大脑接管——这场关于“大脑”的接力赛,才刚刚拉开帷幕。
