星海图高继扬:具身智能的终极商业模式,是售卖「物理世界 Token」 | WRC 2026

经典的“吉列刀架与刀片”模式,正在具身智能领域上演?
编辑丨岑峰
过去两年,具身智能行业掀起了一场激烈的“硬件军备竞赛”:能后空翻的人形机器人、刷新奔跑速度纪录的机械腿,以及在精密设定下倒水、叠衣服的机械臂层出不穷。
但在这些炫酷的展示背后,一个极其现实的问题摆在了所有从业者面前:具身智能到底该怎么赚钱?
目前,行业的主流玩法依然是“卖机器”:将昂贵的硬件本体搭配针对特定场景写死的工作流软件卖给 B 端客户。但硬件制造天然受制于供应链和规模效应,毛利率在残酷的价格战下不可避免地会走向极度微薄。
如果具身智能真的是继智能手机之后的下一代计算平台,它的商业终局,绝不可能仅仅是一家“硬件设备制造商”。
在正在进行的 2026 世界机器人大会(WRC)上,星海图联合创始人高继扬,指出,具身智能的商业模式最终将彻底颠覆,走向以“物理世界 Token”的销售为主体。
高继扬认为,在未来的终局里,机器人硬件(整机)甚至可能沦为“负毛利”的载体,其唯一目的就是把更多的终端铺到真实世界中去。而产业真正的价值核心,将100%向“具身大脑”迁移。
就像今天的 OpenAI 按大语言模型吐出的“文本 Token”向开发者收费一样,未来的具身智能巨头,将按照机器人在物理世界中执行的每一个有效动作、完成的每一次任务,即“物理世界 Token”,来攫取难以估量的商业红利。
当然,要支撑起如此庞大的“Token 经济”,底层大脑必须跨越一道天堑。作为一家坚定的“具身大脑”公司,星海图在底层模型上给出了自己的解法:用统一自回归架构打通零样本泛化、通用抓取和长程任务。
在演讲中,高继扬不仅分享了上述领域的底层突破,还对“泛化性”这一学术词汇给出了极其精准、通俗易懂的商业化转译:“泛化性本质上就是培训成本”。这种从实验室走向商业逻辑的独特认知,正是我们强力推荐这篇演讲的原因。
以下是高继扬在 WRC 2026 上的演讲实录,雷峰网(公众号:雷峰网)在不改变原意的前提下进行了精编与整理:


01
商业模式的演进:从卖整机,到卖“物理世界 Token”
随着机器人的智能通用性不断取得进展——从单一场景有用,跨越到多场景跨任务有用,具身智能产业的核心商业模式将会发生一次根本性的变化:最终将演变为以“物理世界 Token 销售”为主体的模式。
在这个整体进程中,我们看到具身智能包含两方面:一方面是整机(硬件),另一方面是智能(大脑)。整体的价值量会从整机逐渐向智能迁移。
去年和今年,我们看到行业里(包括我们自己)销售整机产品,毛利率大概在 40% 到 60%。我们相信,到了第二阶段,也就是“方案订阅”阶段,整机的毛利率可能会降到 20% 左右。
而到了真正“Token 销售”的第三阶段,整机甚至有可能变成一个负毛利的状态。因为那个时候,我们要的是让更多的终端出现在物理世界当中,去消耗更多具身智能基础模型的 Token。这是一个完全由模型能力牵引的具身智能产业化过程。
正是带着这样的认知,星海图将自己的核心定位明确为一家“具身大脑公司”。过去几年,我们的基础模型在不断迭代,不仅发布了 G0.5 模型,还推出了 fast-wam 最新的模型架构,持续在底层能力上寻求突破。

02
基础模型的三大核心能力:零样本泛化、通用抓取与长程任务
如何去描述我们当前的具身大模型能力?我们可以用一句话概括:创新地采用了统一自回归架构,用单一模型贯通了零样本泛化、通用抓取和长程任务的能力。
第一个关键词是“零样本泛化”。 通俗一点说就是“言出法随”。我给模型下达一句指令,它就能跟随完成。比如,对它说“把面包从盘子里拿起来放到面包机里”,或者“把碗里的食材倒进锅里”。在这些场景中,模型其实是第一次看到这些物品和环境,但依然能完成任务,这就是零样本泛化能力。
第二个关键词是“通用抓取”。 抓取是具身智能非常基础且重要的能力。所谓的“通用”,就是不经过任何的后训练(Post-training)和再编程,机器人就能够把大的、小的、胖的、瘦的、不同材质的物体,从任意地方放置到另一个地方。
第三个是“长程任务能力”。 为什么长程任务如此重要?因为在真实的物理世界中,几乎没有一个工作流(Workflow)是靠单一或少数几个动作就能完成的。它们基本上都是由几十个、甚至上百个动作串联而成。如何让模型连续完成上百个动作?我们通过叠纸盒等复杂精细操作验证了这种能力。这是基础模型走向真实商业价值的核心所在。
当然,仅靠强大的基础模型预训练还不够,我们还需要后训练。在后训练中,除了基于模仿学习的 SFT(监督微调)外,还有一个非常重要的技术就是强化学习(RL)。
目前,我们已经完成了几十台机器分布式的编队强化学习规模化训练。这带来的效果是突破性的:我们可以把通过预训练完成的“厘米级”操作,进化到“毫米级甚至亚毫米级”,同时将任务的成功率大幅提升至 99.9%。 这一切都源于真机强化学习的能力闭环(如包含人机协同的 DAgger 机制)。
03
衡量机器人的“泛化性”,本质是衡量“培训成本”
基础模型底层能力的持续突破,是带领具身智能走向“生产力时刻”的核心变量。当我们真正进入生产力场景时,会发现衡量基础模型有三个非常关键的指标:速度、精度、泛化性。

速度,核心描述的是作业效率。坦率来讲,今天机器人的执行效率还不如人类快,大概是人类的 70% 到 80%。精度,目前依靠预训练可以稳定完成厘米级精度,但毫米级精度必须依靠强化学习,我们目前正在推进这一进程。
最关键的是泛化性。很多人问,泛化性到底是什么?我们觉得一个最通俗的解释就是:泛化性 = 培训成本。
就像我们雇佣一个人类员工,上岗前需要培训;未来雇佣机器人,同样需要培训。这个培训成本的高低,直接反映了泛化性的强弱。 培训成本高,说明泛化性低;如果培训成本趋向于无穷大(即一直教不会),那就说明泛化性极差。
目前,星海图完成一个新长程任务的后训练大约需要 10 个小时。我们希望到明年,能把这个“培训时间”压缩到一个小时,甚至只需要提供几条数据,就能完成长程任务的后训练。
04
走向真实生产力:1+3+N 的战略生态
基于这些模型能力,我们正在围绕电商零售、工业制造、快递物流和商业服务四大场景展开解决方案落地。
在真实的商业落地中,我们非常注重全自主与模型驱动。比如在与京东合作的全自主机器人前仓中,从货物的拣选、抓取、放置,到最难的柔性打包(打开袋子、放入物品、系上封口),全流程没有任何人工干预,且能支持数千到上万级的 SKU。在海外市场,比如洛杉矶的 3PL 仓储,因为用工难度和培训成本更高,具身智能落地的迫切性和速度可能会比国内更快。
对于整个产业的未来,我们确立了 “1 + 3 + N” 的品牌战略:
“1”代表不变的战略:整机 + 智能。 具身智能绝不是纯软件的人工智能,一定是软硬结合的完整解决方案。
“3”代表三大产品序列。 我们围绕生产力场景打造了轮臂旗舰产品(主打 0.1毫米位控精度的“刚柔并济”);围绕非结构化场景(如能源电力)推出了双足产品;同时围绕创客和开发者群体推出了高性价比的硬件与开源工具,降低具身智能的开发门槛。
“N”代表产业生态伙伴。 独木不成林,我们希望与更多上下游的硬件、算法、场景伙伴一起做大做强,将具身智能真正转化为物理世界的生产力。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈

