GPT时刻终于降临具身智能!宇树智元同脑协同,10分钟零打断,不用人管!

来源:综合整理自量子位等
今天,量子位发了一条视频拆解,标题很直白:《宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底》。
说实话,第一眼看到“10分钟一镜到底”这几个字,我是带着挑刺心态点进去的。具身智能这行,Demo看太多了。精修、剪辑、遥操作、固定机位、脚本化任务,几乎成了行业潜规则。但这条视频不一样。它粗糙、真实、甚至有点“素”。一个15平米左右的出租屋,家具密集,过道狭窄,两台不同品牌的机器人——宇树和智元——在同一个空间里干活。没有剪辑,没有切镜,没有人工指令介入。更关键的是,它们用的是同一个大脑。

看完之后,我缓了很久。不夸张地说,这条视频可能不只是“又一个Demo”,它更像是具身智能行业的一个新时刻。
量子位对这条视频的判断,我基本认同。在今天之前,具身智能的“GPT时刻”被谈论了无数次,每次都觉得还差一口气。但这条10分钟的一镜到底,让我第一次觉得,那口气可能补上了。不是明年,不是五年后,就是现在,在一个逼仄的出租屋里,两个被绳子拴着的机器人,用一个我们尚不知道名字的“大脑”,完成了一次对全球具身智能行业的降维打击。
一、先别急着吹,这视频到底“真”在哪?
具身智能行业有个公开的秘密:
Demo是可以“做”出来的。
固定机位、固定光线、固定物体摆放、甚至固定机器人运动轨迹,再加上后期剪辑和倍速播放,就能让一个只能走直线的机器人看起来像在自主探索。更隐蔽的做法是遥操作——人在隔壁房间戴着VR设备远程控制,机器人只是执行端,视频里却宣称“全自主”。
所以当我看到“10分钟一镜到底”时,第一反应是:这团队疯了吗?
一镜到底意味着什么?意味着你不能剪辑,不能重拍,不能遮掩任何失误。意味着机器人每一秒的行为都是实时发生的,没有“NG重来”的机会。意味着机器人一旦中途卡住、撞墙、摔倒,整个视频就废了。
而这条视频不仅一镜到底,还用了两台机器人,在同一个狭窄空间里并行作业。这几乎是在用最苛刻的条件,向全世界证明:我们没有作弊。

图源:量子位
更“狠”的是,视频里出现了两个完全不同的本体:宇树G1和智元远征A3。这两款机器人在硬件架构、运动自由度、传感系统上完全迥异,甚至在商业上是竞品。没有哪家公司会把自己的模型同时部署到两个竞争对手的机器人上,除非它想证明一件事——我的大脑是通用的,跟硬件无关。
这种“黑色幽默”般的选择,恰恰是整条视频最核心的宣言:这不是某个硬件厂商的专属算法,而是一套真正跨本体的通用具身智能。
视频的粗糙感也增加了可信度。没有电影级的运镜,没有精心设计的灯光,甚至有些画面看起来像手机随手拍的。机器人撞了一下玻璃,冰箱门没关严,围巾戴了两次才挂上。这些“不完美”反而成了最有力的证据:剪辑出来的东西,这些瑕疵早被修掉了。

图源:量子位
但“粗糙的真实”只是这条视频最表面的一层。量子位的逐帧拆解里提到一个细节:拍摄场地是一个15平米左右的出租屋,家具密集,过道狭窄,连转身都费劲。这种环境,基本没有遥操作的可能性——因为根本站不下人。也没有预设脚本的空间——因为环境太复杂,变量太多,任何预设轨迹都会在十秒内撞墙。
这意味着什么?意味着这条视频从环境设计上,就“怼脸”排除了两种最常见的作弊手段。它不是“选择了一个简单场景来展示能力”,而是“故意选择了一个最难的场景来证明能力”。这种操作,在具身智能行业里,我从未见过。
还有一点值得注意:视频中有一台机器人是被牵引绳拴着的。这个“战损版”的设定,看似是随手一拍的不讲究,实际上却在传递一个信号——不需要精心的硬件准备,不需要完美的实验条件,甚至不需要机器人是全新的。这种“随便”,恰恰说明团队清楚这套模型到底能做什么。

二、擦玻璃:一个动作,暴露了模型的真实水平
视频里第一个让我停下来的画面,是宇树机器人擦玻璃。
它拿的是刮水器,不是抹布。用过刮水器的人都知道,这个工具对力控的要求极高:轻了擦不干净,重了会有异响,角度不对还会留水痕。机器人擦了几下,发现有一处没擦干净。然后,它做了一个让我没想到的判断:脏东西可能在窗户外面。
于是它侧身、后仰、探头、展臂,把拿着刮水器的手伸出了窗外。

图源:量子位
这个动作拆开看,至少包含三层能力。
精确的力控,是基础。刮水器贴窗移动的力度必须控制在很窄的区间。现有的具身模型,能把力控做好已经是极限。而视频里的机器人,在精确力矩控制的基础上,还同时完成了空间感知和动力学解算,这种“三位一体”的统一表现,在行业里几乎找不到对标。
空间感知,是第二层。伸出手臂的过程没有撞到窗框,说明它清楚知道自己和窗户之间的相对位置,知道窗外空间的边界在哪里。这需要在动力学解算的基础上,融合视觉、触觉、空间感知,形成统一的感知模型。量子位的原文里用了一个很精准的表述:“模型把视觉、触觉、动力学等融合为统一感知”。
自主推理与决策,才是最让我后背发凉的部分。它判断“擦不干净”的原因可能在外面,然后自己决定“把手伸出去试试”。这不是预设脚本能做到的。预设脚本只会让机器人重复固定轨迹,不会让它“怀疑脏东西在窗外”。
量子位的原文里有一句话让我印象深刻:
“在没有办法擦干净的情况下,它立即推理决策,将手伸出窗外擦玻璃,这是我第一次看到了模型像人一样的一次自我推理、自我进化。”
这句话一点都不夸张。我们见过机器人拧螺丝、搬箱子、倒水,但那些都是“执行”。而这个动作是“思考”——它遇到了问题,分析了原因,提出了假设,并付诸行动。这是一个完整的“感知-推理-决策-执行”闭环,而且是在一个从未训练过的场景中自主完成的。

图源:量子位
这就是为什么我说它可能是“GPT时刻”。GPT之所以震撼,不是因为它能写出通顺的句子,而是它展现出了某种“理解”和“推理”的能力。同样,这个机器人展现出的不是“背下来的动作”,而是“面对新问题时的自主求解”。
仔细看视频里擦玻璃的整个过程,会发现更惊人的一点:机器人在发现“擦不干净”之后,并没有立即把手伸出窗外。它先是继续用刮水器在室内一侧擦了几下,确认问题依然存在,然后才做出了“脏东西可能在外面”的判断。
这个过程说明,它不是在随机尝试,而是在系统地排除可能性。这种逻辑推理的能力,在人类身上再普通不过,但在机器人身上,还是头一回。
三、闹钟响了:全球第一个实现“断点续做”的模型
如果说擦玻璃是“单点能力”的体现,那接下来这个细节,直接拉高了整条视频的技术上限。
视频中段,一声闹钟响了。两个机器人同时中断手头任务,开始执行新的指令:收纳桌面和冰箱。注意,这不是简单的任务切换。关键是,在完成新任务之后,它们又回到了被打断之前的任务节点,继续干了下去。

图源:量子位
量子位的报道把这称为“断点续做”,并且强调这是全球第一个实现的断点续做。
这个能力为什么重要?
因为传统的VLA模型最怕的就是长序列任务。任务一长,误差会累积,动作会漂移,一旦被打断,基本就崩盘了。而这两个机器人表现出来的,是人类级别的任务优先级判断和动态调度能力。打断,切换,恢复。三步走完,动作没有变形,任务没有丢失。
这意味着模型内部有一套稳定的全局任务调度框架,而不是简单的“走一步看一步”。它能够记住“我刚才在干什么”“我接下来要干什么”“现在有新任务,我该怎么插进去”“新任务完成后,我该回到哪里”。这涉及情景记忆、工作记忆、空间注意力等多个认知能力的协同。
更关键的是,这个能力不是预设的。视频里没有人在闹钟响之前告诉机器人“你待会儿要切换任务”。闹钟是一个突发的外部刺激,机器人需要在几秒钟内理解这个刺激的含义,调整自己的任务优先级,并且在完成新任务后,准确恢复到原来的任务流。

图源:量子位
在人类看来,这很简单。但在机器人领域,这是一个巨大的跨越。它意味着模型不再是“单线程”的执行者,而是一个能够处理多任务、动态调度、记忆上下文的“智能体”。
量子位的文章里还提到了一个非常专业的判断:这个模型实现了“情景记忆与提取功能”,能够回忆“某情景下,发生过什么”;还具备“工作记忆和空间注意力”,能并行保持和处理多个时空片段。这些认知科学的概念,第一次被用来描述一个机器人的实际行为,这本身就说明了问题的严重性。
我们再来拆解一下“断点续做”背后的技术难度。当机器人被闹钟打断时,它正在执行一个长链条的收纳任务。这个任务涉及多个物品、多个目标位置、多步操作序列。被打断后,它需要:
第一、识别闹钟是一个新的任务触发器。这个看似简单的步骤,实际上涉及对外部信号的语义理解——为什么一个声音信号意味着“要切换任务”?这不是数据能教会的,除非模型内部有某种“规则理解”的机制。
第二、安全地中止当前动作。机器人不能把手里拿的东西随便一扔,而是要找一个合适的临时放置点,或者把物品先放在一个不影响后续任务的位置。
第三、切换到新任务。收纳桌面和冰箱,这本身就是一个复杂的多步任务,需要拆解、规划、执行。
第四、完成新任务后,回到原来的任务流。它需要记住“我刚才在收纳哪个区域”“已经完成了哪些物品”“还有哪些物品没有处理”。这需要工作记忆的持续保持和更新。
这四步中的任何一步出了问题,整个任务链就会断裂。而视频里的机器人,就像人类一样自然地完成了这个“切换-恢复”的过程,没有停顿,没有卡住,没有遗漏。
四、两个“竞品”机器人,自主协作
整条视频最大的高潮,出现在智元给宇树戴围巾的那一幕。
宇树机器人身上挂满了要收纳的物品,双手已经占满。智元机器人走过来,拿起桌上的一条围巾,挂在了宇树脖子上。围巾太长,智元用双手捧起,宇树弯下腰,智元把围巾绕过宇树的头,挂好。


图源:量子位
整个过程没有任何语言指令,也没有预设分工。
量子位的判断很精准:这不是提前设定好的剧本,而是模型在跨本体的两个机器人之间,自主探索出的协作方案。
宇树和智元,是两款硬件架构、运动自由度、传感系统完全不同的机器人。在商业层面,它们是竞品。但在这个视频里,它们共享同一个大脑,并且能够理解彼此的能力边界,自主分工,互相补位。
这说明什么?
说明这套模型已经实现了跨本体的统一建模。它不关心自己控制的是宇树还是智元,它只是在调度“手”和“脚”,分配“角色”和“任务”。这是具身智能行业第一次真正意义上的“软硬件解耦”。
这个能力一旦被验证为可复现,整个行业的竞争逻辑都要改写。过去,机器人公司要同时研发硬件和算法,算法和硬件深度绑定,换一个型号就要重新训练。而现在,有一套通用大脑可以适配任何硬件,硬件厂商只需要做好硬件,算法厂商只需要做好大脑,行业分工将彻底重构。

图源:量子位
更重要的是,这种跨品牌协作展现出的“智能”远远超出了单机任务的范畴。它不再是“一个机器人在干活”,而是“一群机器人在组队干活”。它们能理解彼此的能力边界,能判断谁更适合完成某个任务,能在没有语言沟通的情况下达成默契。这是群体智能的雏形。
视频里还有一个细节:宇树够不到高处柜子时,智元主动走过来帮忙,把围巾从宇树脖子上取下,折了三折,放进了柜子。这个动作看似简单,但包含了极致的力度控制、空间感知和对物品属性的理解。围巾是软的,折叠它需要知道它的形状和材质,放进柜子需要判断柜子内部的空间。这些都不是预设脚本能覆盖的。
量子位的原文对这一幕的描述非常传神:
“像毕业授勋一样,宇树弯腰低头,智元缓缓地拿下了围巾,放到了架子上。”
这个比喻很好,因为它捕捉到了两个机器人之间的某种“默契感”。它们之间没有语言交流,没有显式的指令传递,但每一个动作都像是商量好的。
这种“沉默的协作”,比任何预先编排的“机器人舞蹈”都要震撼。因为它意味着模型内部有一套共享的意图理解和目标推理机制,让两个不同的硬件本体在同一个任务空间中自主协调。
五、学会“偷懒”和“用工具”,才是真智能
视频里还有两个细节,我觉得比那些大开大合的动作更值得琢磨。
一个是智元机器人拿起一条毛巾,尝试了三次,最终把毛巾挂在了自己肩膀上。它没有把毛巾拿在手里,因为那样占用手部空间,影响后续任务。它选择了“挂在肩上”这个更省力的方案。
另一个是宇树机器人整理拖鞋时,拎的是拖鞋的挂绳,而不是鞋体本身。因为拎绳子更省劲。

图源:量子位
这两个动作的背后,不是训练数据里的“标准答案”,而是模型在与环境交互中自主探索出的最优解。它理解了“省力”这个概念,并且主动寻找更高效的执行方式。这种对物理效率的自主追求,是智能的重要标志。
量子位的原文里有一句评论非常精彩:
“在其他机器人还在为干活而精心打扮的时候,这个模型居然不光把活干了,甚至直接学会‘偷懒’了?这真是太聪明了。”
“偷懒”在这里不是一个贬义词。恰恰相反,它是人类智能的重要特征。人类之所以能成为地球上最高效的生物之一,不是因为我们能干活,而是因为我们能想办法让干活变得更轻松。用工具、找捷径、优化流程,这些“偷懒”行为,本质上是智能对物理世界的深度理解。
再来看那个让我反复看了好几遍的“踢箱子”名场面。
宇树机器人够不到第三层柜子,它没有卡住,没有放弃,而是自己找了一个箱子,企图站上去。发现自己弯不下腰搬不动箱子之后,它一脚把箱子踢到了柜子边。

图源:量子位
用脚踢箱子,这是一个没有任何教学、没有任何预设的动作。
它是机器人在了解自己身体边界之后,做出的一个“创造性”选择。这意味着模型不仅理解了物理世界的规则——箱子可以承重,站上去能增加高度——还理解了自身的限制——弯不下腰——并且找到了绕过限制的方法——用脚踢。
量子位的原文把这一幕称为“神性的一幕”。我觉得这个形容一点都不夸张。因为在这一刻,机器人展现出了某种“自我意识”的雏形。它知道自己的能力边界在哪里,知道如何在环境中寻找工具来扩展这个边界,知道如何在尝试失败后调整策略。
这个“自我认知-环境理解-策略调整”的闭环,正是通用智能的核心特征。
六、技术底层的范式变化:跳出VLA/WAM之争
量子位的文章里提到一个关键信息:这套模型跳出了当前主流具身模型的固有框架。
目前市面上的主流路线,一类是VLA,本质是“看图猜动作”,靠海量数据做端到端拟合,缺乏物理推理能力,长序列任务会累积误差,陌生场景泛化能力差,且高度绑定专属本体。另一类是世界模型(WAM),试图先建模世界规律再规划动作,但存在“知行割裂”问题,面对需要物理动力学推理的实操场景,依旧依赖训练数据推演。
两者的共同底层缺陷是:数据驱动的任务拟合。所有动作都是基于海量数据的“概率猜测”,而不是对物理规则的深度理解。
量子位把这套模型的能力总结为四个维度:
动力学建模:轨迹满足动力学可行性,能计算补偿力矩和前馈项,外推泛化能力极佳。
自我认知能力:不像VLA靠条件反射,也不像WAM靠时序统计,它像人一样思考“下一步最接近目标的动作是什么”。
自适应能力:能补足因果推理,解决长尾问题,边做边进化。
自我进化能力:在完成任务的过程中,技能自增长,策略自进化。
支撑这一切的,是三个底层技术内核:物理约束动力学学习、跨本体统一建模、长时序鲁棒闭环。
这些名词听起来很学术,但翻译成大白话就是:
它不是在“背动作”,而是在“理解物理”。
它不是在“适配硬件”,而是在“调度身体”。
它不是在“执行脚本”,而是在“解决问题”。
文章里另一个信息更值得深挖:这套模型“只用了几十个小时的视频数据训练”。这个数据量,在传统具身模型面前几乎可以忽略不计。
过去两年,全球具身智能行业都在赌一件事:只要数据量足够大,模型就能涌现出通用智能。OpenAI在语言模型上的成功,让所有人都相信这个逻辑可以复制到机器人领域。于是我们看到各家公司在疯狂收集数据、构建数据管道、扩充训练集。
但这条视频里的模型,确实只用了几十个小时的数据,就实现了这样的泛化能力。整个行业的数据战略,可能都需要重新审视。Scaling Law是否还适用于具身智能?数据驱动是否真的能通向通用智能?还是说,我们需要回到物理规则本身,去寻找新的范式?
报道里还有一句很尖锐的判断:“美股大跌预告。”虽然是调侃,但背后的含义是严肃的:具身智能的底层范式一旦被颠覆,那些押注数据驱动路线的公司,估值逻辑都要重新评估。
这可能意味着,过去一年行业里热火朝天的VLA与WAM路线之争,在这个神秘模型面前,突然变得没有那么重要了。因为无论哪条路线,都没有跳出“数据拟合”的底层逻辑。而这个模型,似乎直接跳到了“物理智能”的层面。
几十个小时的数据,换来这样的泛化表现,整个具身智能的技术路线,可能都需要重新评估。
七、行业的新时刻,可能真的来了
具身智能行业谈了很多年“ChatGPT时刻”。但说实话,之前看到的多数Demo,距离那个时刻还有明显距离。要么是短时长精修,要么是单任务演示,要么是遥操作撑场。
这条10分钟一镜到底的视频,第一次让我觉得,那个时刻可能比想象中更近。
不是因为某个单一动作有多惊艳,而是因为整套系统表现出来的完整性、鲁棒性和自主性,已经超出了我对当前技术水平的认知。跨本体协作、断点续做、自主使用工具、实时决策切换任务、在陌生复杂环境中稳定运行——这些能力同时出现在一条未经剪辑的视频里,意义远大于任何单项技术的突破。

图源:量子位
量子位的文章在结尾有一段非常精准的总结:
“当其他团队的Demo还在堆砌短时长、精修、单任务时,这个神秘视频已经完成了10分钟无修剪、跨品牌、多协同、全流程、自进化的真实实景落地。当其他模型还在‘靠数据猜动作’时,这套模型仿佛已经实现了完全的自我决策、自我学习、自我进化。”
这段话我读了三遍。因为它道出了这条视频真正的历史意义:它不是在某个单点上超越了同行,而是在整个范式上实现了代差级的领先。
我们再来看看这条视频对行业格局的潜在影响,其实已经不只是“潜在”了。
最直接的变化会落在硬件厂商身上。通用大脑一旦真的做到跨本体适配,硬件厂商的核心竞争力就从“硬件+算法”的整体方案,转向纯粹的硬件能力和成本控制。宇树和智元在这条视频里的“同台竞技”,本身就是对“硬件绑定算法”模式的直接颠覆。
另一个可能被改写的是软件和模型公司的位置。一套模型能够驱动任何硬件,意味着模型的所有者掌握了行业话语权。就像Android之于手机行业,一套开放的通用大脑,很可能成为具身智能时代的“操作系统”。
更深远的影响在技术路线层面。那些重仓VLA或WAM路线的公司,一旦发现自己的底层逻辑被动摇,面对的就是痛苦的转型。而那些一直在探索“物理智能”方向的小团队,可能突然发现自己站到了正确的赛道上。
最后,也是最快能看到变化的是落地场景。机器人真能像这条视频里展示的那样,在陌生环境中自主完成长链条任务,家庭服务、工业柔性制造、物流分拣这些场景的商业化时间表,会大幅提前。
当然,现在还不知道这个神秘模型出自谁家。量子位的文章结尾也在问:“到底是谁!!!”
但这个问题,可能已经不那么重要了。
真正重要的是,这条视频让我们看到:具身智能的竞争,正在从“谁能做出更好的Demo”转向“谁能做出真正通用的具身大脑”。硬件本体的竞争,会逐渐让位于底层模型的竞争。
当模型开始学会“偷懒”、学会“用脚踢箱子”、学会“给同伴戴围巾”的时候,我们讨论的已经不是“机器人能不能干活”了。
我们讨论的是:当机器人开始像人一样思考,这个行业的下一个十年会变成什么样。
从家庭全屋家务,到工厂柔性产线,到快递分拣,到医疗服务,一个真正通用的具身大脑,意味着机器人不再需要为每个场景单独开发算法,不再需要为每个硬件重新训练模型。它可以像人类一样,面对新环境、新任务、新工具,快速适应并完成任务。
这就是“GPT时刻”的含义:一个模型,多种能力,通用泛化。
今天,这条视频可能只是一个开始。但它已经足够让我们相信,具身智能的新时刻,真的来了。
当其他团队还在争论VLA和WAM谁才是未来时,这支团队已经用结果给出了答案:都不是。
未来属于那些真正理解物理世界、真正实现自主推理和自我进化的模型。
量子位在文章里有一句话,我觉得可以作为今天这篇文章的结尾:
“一个不知道是哪里来的团队,仿佛颠覆了所有的技术路径,颠覆了Scaling Law,做出了真正的具身‘智能’,逼近了具身智能的ChatGPT时刻。”
而这场变革的序幕,已经在这个普通的出租屋里,悄然拉开。
我们,正在见证历史。
点击上方“机器人全球资讯”,关注后了解更多有意思的知识! 欢迎把本公众号推荐给您的同道中人! (麻烦读者小伙伴加个星标,不加星标经常看不到新文章。)
