腾讯开源三大具身基座模型,首席科学家张正友详解“三层脑”如何破解机器人反应慢

OpenClaW 龙虾框架火起来以后,腾讯 Robotics X 实验室曾做过一次移植。
团队把机器人的各项能力封装成 Skill,交给这个通用智能体框架去调度。结果,"整个效果非常之差",实验室主任张正友对 InfoQ 表示,“甚至明显不如我们去年给宇树做的导览系统”。
张正友分享经验,OpenClaw 这类框架服务的是数字系统里的智能体,"OpenClaw 操控的身体相当于浏览器,不是机器人"。浏览器可以等,机器人却不能。一个任务从下达到响应要几十秒,"肯定受不了"。

图注:从左至右依次是腾讯云异构计算研发总监陈煜东,腾讯首席科学家、Robotics X 实验室主任张正友,腾讯云存储产品总经理陈峥
随后,团队为机器人的任务调度和模型协同专门设计了一套原生的智能体框架 TairosAgent,将响应时间压到 2—3 秒。这个时间主要对应上层任务理解与智能体交互。真正涉及碰撞、失衡和力觉变化的身体反应,必须快得多。

由此,腾讯将具身智能进一步拆成了三个同时在线、但运行频率不同的层级:Hy-Embodied-VLM-1.0(负责空间与场景理解)、Hy-Embodied-RxBrain-1.0(负责认知规划与未来状态想象)、Hy-Embodied-VLA-0.5(负责高层目标到连续动作的转化)。
配合持续在线的 具身智能体 Apexio 和 原生框架 TairosAgent,共同构成了腾讯具身智能的完整矩阵,以解决一个常被大模型叙事掩盖的事实:机器人面对的世界,并不是按照同一种速度运行的。
WAIC 2026期间,腾讯正式开源三款具身基座模型,腾讯首席科学家、Robotics X实验室主任张正友携团队在上海接受了包括InfoQ在内的媒体采访,回顾了具身智能开放平台 Tairos 发布一年来的实质进展。在行业陷入同质化竞争、“Demo90 分即落地”的幻觉时,腾讯通过这套系统化的技术底座,与越疆、宇树等头部厂商深度打磨落地场景。
他们选择用“最难的”养老场景倒逼技术,给出了具身智能走出实验室的“腾讯解法”。
当前具身智能最受关注的路线之一,是视觉语言动作模型 VLA。它希望用一个端到端模型,将摄像头看到的画面、接收到的语言指令,直接转化为机械臂或机器人身体的动作。
但张正友认为,现阶段的 VLA 存在一个较少被讨论的痛点:视觉理解和动作生成经常在同一个运行频率下执行。很多 VLA 前端包含 VLM,后端包含 Action Expert,真正的问题是认知、感知和执行被迫共用同一条计算链路。
然而在实际物理世界中,不同信息对延迟的容忍度差异极大。触觉反馈只有约 1 毫秒,底层运动控制甚至以 500Hz 至 1000Hz 运行。如果让大模型以底层控制的高频率运行,算力难以承受;让底层动作等待大模型,延迟又变成安全风险。
因此,腾讯此次架构的核心不是简单“分成三个模型”,而是让不同类型的智能以不同频率运行:
最上层认知系统按需唤醒,负责复杂任务理解和深度推理;
中间层感知行动系统以约 15Hz 持续接收多模态信息,并快速调整动作;
最下层执行系统以更高频率运行,像条件反射一样处理碰撞、失衡等突发情况。
这种分层是否只是当前算力和模型能力不足下的过渡方案?
张正友的判断是否定的。他认为,这套架构可能在相当长时间内保持稳定,因为它对应的不是某一代模型的性能限制,而是物理世界本身存在的时间尺度差异。
“分层我认为是比较合理的一个架构,这个架构在很长的时间里面不太会变。”张正友向 InfoQ 表示。
但分层运行并不意味着模型之间彼此割裂,更不意味着退回传统机器人时代的模块拼装。张正友强调“分层运行、闭环训练”:不同模型在推理时承担不同职责和频率,训练时仍然可以根据任务结果、动作表现和环境反馈进行联合优化。
这条路线并不是简单反对端到端,而是 质疑让一个单体模型、以同一种频率,包办机器人所有认知和身体控制的设计。它试图保留端到端学习的能力,同时把已经明确的物理约束提前写入架构。
背后的现实原因是,具身数据远没有互联网文本那么充足。
理论上,只要模型足够大、数据足够多,一个统一神经网络或许能够自行学会哪些能力应该高频运行、哪些任务可以慢速思考。但真实机器人数据采集昂贵、效率低,物体、光线、本体和场景一旦变化,原有数据就可能失效。
与其等待模型从有限数据中自行发现合理结构,不如先将不同频率、不同感知和不同安全等级的任务进行分工。
频率之外,腾讯还试图解决另一个更隐蔽的问题:大模型习惯用语言思考,但物理世界中的大量信息,很难被完整翻译成文字。
过去一代 Tairos 系统依靠文本传递左右脑信息。例如接到“整理餐具”任务,系统会拆分成文字步骤。但用语言描述盘子、酒杯的距离需要大量文字且易产生歧义。给机器人看一张完成后的照片,信息反而更直接。
“有时候视觉信息远远高于文本信息。给它一张照片,马上就知道怎么摆。”张正友表示。
此次发布的认知模型 RxBrain,正是针对这一问题进行的升级。
它不只用语言生成任务步骤和约束,还会 预测 每一个子任务完成后,物理世界应该呈现什么状态。也就是说,系统不仅告诉机器人“下一步做什么”,还尝试 提前生成“做完以后应该是什么样”。
语言表达目的约束,视觉承载位置姿态。这是 RxBrain 相较一般语言规划模型最有辨识度的地方。
这也解释了腾讯此次提出的“裂脑”实验:语言只是认知的一种低带宽容通道,RxBrain 把视觉状态放进信息通路,相当于拓宽了认知带宽,使“推理”和“想象”出现在同一条认知链路中。
目前,世界模型在具身智能领域尚未统一。因此,RxBrain 更适合被定义为“具身世界认知模型”,解决任务规划中的未来状态表达。结合 Hy-Embodied-VLM(看懂世界)、Hy-Embodied-VLA(超 1 万小时示教数据,RoboDojo 评测综合第一),腾讯试图补齐 认知与身体之间过去缺失的信息链路。
架构是否合理,最终仍然要回到机器人能否在真实环境中稳定工作。
张正友在采访中强调:“Demo 做到 80 分、90 分,真正没有落地,几乎就等于零。”实验室里成功抓取一次物体,与生产线上连续完成数万次任务,是完全不同的考验。
在 Demo 中,物体位置、光线和背景通常经过设计,机器人只需要完成一次被选中的动作;到了工厂,模型还要面对 SKU 频繁变化、物料随机摆放、节拍要求、设备故障和产线中断。机器人一旦需要人工持续照看,所谓自动化反而会增加新的运维成本。
“假如失败概率太大、不稳定,要人照顾机器人,还不如让这个人完成任务,效率更高。”张正友表示。
腾讯披露,Hy-Embodied-VLA 已经进入一家日化品工厂进行生产测试。在高混合、小批量、SKU 频繁迭代的产线上,其作业成功率超过 95%,单件节拍快于 6 秒;面对新增 SKU,留给数据采集和模型 后训练的时间不到 3 天。
模型能力只是第一步,最后的几个百分点往往需要大量系统工程才能补齐。数据也是同样的问题。
张正友将具身数据划为“金字塔”:底层互联网视频,往上是第一人称视频、UMI(无本体)设备采集示教、遥操作数据,越往上越昂贵且依赖特定本体。
腾讯让 不同层级数据服务不同模型,且 UMI 数据可通过统一动作表征迁移到不同机械臂。跨本体适配,正是腾讯接下来需要证明的另一项能力。
Tairos 最初部署花三个月,后缩短至五天,最近 接入越疆机器狗只用一天。关键在于增加了 硬件抽象层,统一转换传感器与控制接口,这就是平台做“Tairos 钛螺丝大脑”的潜力。

腾讯目前主要与 宇树、智元、越疆 等头部本体企业合作,一个重要原因就是 头部硬件相对稳定。否则,一旦任务失败,团队 很难判断问题 究竟出在模型、本体,还是底层控制系统。
与此同时,具身智能对算力的需求也在快速上升。
腾讯云异构计算研发总监陈煜东透露,过去 部分客户使用 数百张卡 完成模型训练,如今具身智能客户开始提出 千卡、万卡规模 需求,相关需求呈现约 200% 至 300% 的增长,部分模型甚至两三天便迭代一个版本。
这也说明,行业正在进入 高强度的数据处理和模型试错阶段。机器人需要处理视频、图像、点云、力觉和触觉等多模态数据,数据清洗、标注和训练带来的成本,正在成为竞争的重要组成部分。
工业之外,腾讯选择养老作为技术试验场。
此次展示的“小六”机器人可以通过双臂完成按摩动作。腾讯邀请专业人员提供手法,通过 自研的视觉、力觉与触觉采集系统 记录动作轨迹和力度,再以强化学习进行复现。目前,小六只学习了 四种双臂协同 手法,下一步也不是马上推出“小七”,而是希望进入养老院等真实环境继续迭代。
张正友强调,腾讯并不准备销售养老机器人本体。选择养老,是因为与人发生物理接触,几乎集中了具身智能最困难的问题。
工业抓取力度稍大或可完成任务,但搀扶老人、按摩时力度姿态不能严重偏差。视觉判断、触觉反馈、力觉控制必须紧密结合,安全性不能只做到 95%。

“进入家庭这样的非结构性环境,安全性是 100% 一定要保障的。没有达到绝对安全,进入家庭几乎不太现实。”张正友表示。
在腾讯看来,养老并不是一个容易变现 的展示场景,而是 其对分层架构的极限测试:高层模型要理解人的意图,中层系统要根据姿态和肌肉状态调整动作,底层则必须在出现异常力道时立即停止。
在被问及腾讯为何 重点关注养老 / 康养赛道 时,张正友强调:“养老不是我喜欢,而是它很重要。喜欢和重要,不是一回事。”
这句话同样适用于当下的具身智能。
WAIC 期间,我们看到了无数机器人已经可以跳舞、递水、导览和抓取,但具身行业真正重要的进步,已经不再是机械式地完成一个看起来聪明的动作,而是能否在环境发生变化、任务被打断、身体遭遇碰撞时,仍然可靠地工作。
语言模型可以等用户说完再回答,机器人却不能等世界停下来再思考。
会议推荐
做 AI 的谁还没点技术焦虑,来 AICon 深圳站,吃颗技术定心丸! 大会限时 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理13269078023 进行咨询。

今日荐文
最强模型“跳票”,市值一夜蒸发2000亿美元!谷歌连上三款“省油”模型,死磕每一个token的钱
智谱的算力野望浮出水面!自建1GW机房、数亿收购中科系Infra企业、布局自研芯片,加速去“英伟达化”
Hugging Face遭攻击取证受阻,只能靠国产GLM 5.2救场?白宫AI顾问急眼喊话:我们在失去竞争力
“要么Fork,要么走人”!Linus怒怼AI反对派:Linux不搞“反AI”
暂不跟进视频生成!Kimi K3 力压 Fable 5、登顶 Arena 榜单,提价近4倍对标Sonnet 5

