世界模型成焦点,机器人从“会动”到“能干活”还要跨越哪些坎?
在近期举办的世界机器人大会上,机器人依旧是全场焦点。展台上,它们自如地行走、搬运、抓取,吸引着观众的目光。不过,此次大会的讨论焦点已悄然转变,从机器人直观的“身体”动作,延伸到了更为关键的“大脑”智能。
一场以“世界模型到服务人类的现实距离”为主题的圆桌讨论引发关注。之江实验室主任、阿里云创始人王坚率先发问,探讨世界模型与其他模型的区别,以及值得关注的技术路线。随后,话题聚焦到更现实的问题:若世界模型要服务人类,需具备哪些能力,距离目标还有多远?这成为机器人产业面临的分水岭。
过去几年,机器人运动能力提升显著。奥比中光创始人、董事长黄源浩直言,机器人移动能力已不错,困难在于“操作”。从A点到B点的移动,与拧瓶盖、处理复杂物体,是不同性质的问题。后者依赖“手、眼、脑”协同,手要灵巧且有触觉,眼负责感知,脑则靠模型与数据迭代。
当机器人从“会动”迈向“干活”,产业竞争也从本体能力转向智能能力,世界模型由此被推到前台。
如今,机器人能完成的任务越来越多,但“技能增加”不等于“更智能”。智澄AI创始人、CEO胡鲁辉将物理智能问题拆解为多个层面:首先是泛化能力,环境或任务改变后,机器人能否完成同一件事;其次是对物理规律的理解;再者是能否理解任务本身。过去依赖规则、固定路径或模仿学习的系统,交互对象和任务边界相对确定,环境稍变或更换本体,能力就可能失效。
无界动力创始人张玉峰也提到,以模仿学习为基础的范式,如VLA,依赖大量数据和数据分布形成“肌肉记忆”能力,但对物理世界底层逻辑的理解和泛化仍面临挑战。世界模型重新受重视,正是行业希望突破这一限制。
胡鲁辉看重“理解”,他认为世界模型不仅要解决泛化性,还要理解物理世界,就像人以理解的方式做事。他将世界模型视为物理智能核心技术之一,机器人则是人工智能进入物理世界的重要闭环场景。
若机器人要理解物理世界,靠什么学习?黄源浩将答案指向数据。与大语言模型利用互联网文本不同,具身智能数据需从真实物理交互中产生。机器人拧瓶盖,记录的不仅是视频,还有手在三维空间的位置、物体状态变化、接触力,以及视觉和触觉在时间上的准确对应,这些都会影响模型学习。
不同本体让问题更复杂。黄源浩举例,不同机器人使用的相机视场角、帧率、触觉设备不同,A机器人采集的数据B机器人无法使用,每家公司都要重复采集和训练,数据规模扩大不一定降低成本。因此,具身智能缺的不仅是数据,还有标准化、可迁移的数据。他希望将3D空间、时间序列以及触觉、力等信息统一记录,实现精确同步,让部分数据跨本体、跨模型使用。
这一判断改变了奥比中光的商业定位。作为长期从事3D视觉感知的企业,奥比中光此次不再只谈“让机器人看见”。黄源浩强调3D视觉、手部姿态、物体状态以及与触觉设备同步的重要性,将公司定位为具身智能的“数据基础设施”,希望从视觉供应商向数据采集硬件平台延伸。
这反映出产业变化:当感知硬件成为机器人基础能力,产业链企业开始向数据入口延伸。卖传感器收入来自硬件,进入数据采集、接口和标准环节,企业则试图建立与模型、本体和训练体系的长期连接。黄源浩直言,硬件易被替代,进入数据层业务黏性会改变。世界模型的竞争,不只在模型公司之间,数据提供、格式定义和数据流通都影响模型训练效率。
这种对机器人“大脑”和数据入口的争夺,已引起资本市场关注。胡鲁辉称世界模型获学术界、工业界和资本市场共同关注。黄源浩也表示,具身智能领域从模型、仿真、数据采集、本体到行业落地,聚集大量创业企业,一些年轻企业获较高融资和估值。
然而,资本热度不等于商业模式验证。黄源浩承认,目前不少机器人应用的投资回报率(ROI)不理想,一些任务人工更经济。最先可能跑通的场景是危险、重复和人不愿意长期从事的工作。机器人先进入这些场景产生数据,数据回流推动模型迭代,能力提升后进入更多场景,改善ROI。
这构成了具身智能商业化的关键循环:模型需要真实场景数据,但真实场景需要成熟模型和合理成本才愿大规模部署机器人。资本市场可为未来定价,但世界模型能否从概念转化为产业价值,取决于这个闭环能否运转。
行业在讨论具身智能的“GPT时刻”,不同模型公司判断不一。但更值得观察的是,模型、数据和真实场景何时首次形成持续正向循环。
智澄AI押注机器人“大脑”能力提升,解决“机器人如何理解世界”;奥比中光从视觉硬件进入数据基础设施,解决“机器人靠什么学习世界”,两家公司处于具身智能产业链不同环节。资本热度之外,它们都要接受现实检验:机器人能否在真实场景中持续、稳定、经济地完成任务。从展台动作到真实环境长期完成任务,中间隔着模型、数据复用、成本下降和客户买单等问题。
