WRC再展"旧"Demo?千寻智能30天进化背后的全栈技术揭秘
在世界机器人大会的展台上,千寻智能的机器人Moz1再次成为焦点。与一个月前在世界人工智能大会上展示的“整理客厅”场景相比,这次演示看似重复,实则暗藏玄机。当观众质疑这是否只是炒冷饭时,技术人员透露,短短30天内,这套系统已经实现了质的飞跃:可乐放入冰箱的成功率从80%跃升至99%以上,碗放入洗碗机的成功率从90%提升至99%以上,导航目标确认时间缩短近一半,垃圾捡拾任务在复杂条件下的成功率达到85%。
这些数据背后,是具身智能领域一个全新概念的实践——时间密度。这个由千寻智能提出的学术指标,衡量的是系统在单位时间内吸收问题、完成训练和验证,并将改进反馈到真实机器上的能力。它关注的不是单次演示的峰值表现,而是整个技术体系的进化速度。在WAIC阶段,Moz1已经展现出不错的性能,但长程任务中的90%成功率与固定工位上的90%有着本质区别。一个环节的失误可能导致整个任务链的崩溃,这正是具身智能面临的真正挑战。
“整理客厅”这个看似简单的任务,实则包含了一系列复杂操作。机器人需要理解模糊指令,环视环境识别需要归位的物品,记住未完成的步骤,跨空间移动,精准抓取,开门放置,关门确认,并在整个过程中不断自我验证。长程任务中,物体姿态变化、机器人站位偏移、背景干扰,甚至开门角度不足等细微因素,都可能让后续动作失去节奏。WRC现场的演示中,技术人员故意增加了难度:观众穿行、物品位置变化、临时遮挡等干扰因素不断出现,考验着系统的现场适应能力。
这种稳定表现的实现,依赖于一套完整的技术架构。当用户发出指令后,感知系统首先建立环境信息,Agent保存上下文并拆解任务,导航系统将机器人引导至合适位置,基座模型Spirit v1.6根据多模态信息生成动作,最后通过数据回流实现持续改进。这个过程中,感知、数据、模型、Agent、导航、本体和基础设施必须紧密协作,任何一个环节的缺失都会导致整个系统的失败。
数据是这套系统进化的燃料。千寻智能构建了覆盖Web视频、第一视角、uDAS、遥操作和真机任务的数据平台,自研的第七代数据采集设备将成本降至传统方式的十分之一,数据可用性提升至95%。但与传统认知不同,他们更看重“脏数据”的价值——现实世界中的杂乱变化被直接纳入训练,使模型具备更强的泛化能力。在后训练阶段,模型学会区分无关变化和关键信息,例如在放置碗的任务中,能够忽略墙面和灯光的变化,而专注于碗的位置和沥水架的状态。
支撑这一切的是Spirit v1.6基座模型,它采用VLA与世界模型深度融合的架构。与传统机器人“感知-规划-控制”的分步模式不同,这个模型实现了边感知、边决策、边调整的实时响应能力。在RoboArena国际评测中,该模型超越英伟达DreamZero等对手登顶全球第一,成为中国具身模型的首个世界冠军。Agent决策层则扮演着任务管理者的角色,持续跟踪任务状态,决定下一步是继续、重试、跳过还是重新规划,防止机器人在长程任务中“失忆”。
硬件与基础设施的改进同样关键。WAIC期间遇到的伺服电机异常、电源故障等问题,促使硬件团队将策略从“事后维修”转向“前置设计质量”,通过改进伺服和电源模块,将问题拦截在设计阶段。26自由度的Moz1本体搭载自研一体化力控关节,能够精准执行模型生成的动作。而设备管理、推理部署、日志回传等底层平台能力,则缩短了训练与真机之间的距离,使现场问题能够快速进入下一轮迭代。
当Moz1在WRC现场实现多项任务100%成功率时,团队反而开始主动制造麻烦:调整起始位置、改变物体姿态、更换背景等。他们深知,单场景的完美表现并不代表系统具备足够的稳定性边界。展会现场的网络波动、观众干扰等因素,反而成为检验系统鲁棒性的天然测试场。这种极端条件下的压力测试,为机器人进入工业场景奠定了基础——Moz1已经在宁德时代动力电池PACK产线承担非标工序,作业成功率稳定在99%以上,单日工作量达到熟练工人的三倍。另一款Moz2则开始探索商超、酒旅等公域服务场景,在WRC现场展示了自然语音交互和拟人化互动能力。
从“能不能做”到“能不能连续做、环境变了还能不能做、失败后知不知道错在哪”,具身智能的发展正在进入新的阶段。时间密度这个指标,不仅衡量任务成功率的提升幅度,更评估技术体系处理真实失败的速度——谁能更快将问题转化为改进,谁就能在竞争中占据优势。这种自我生长的能力,或许正是具身智能终局的关键所在。
