从“看见”到“行动”:安谋科技与港科大共探VLA模型重塑具身智能产业格局
(电子发烧友网 文/张迎辉)在刚刚落幕的世界
人工智能
大会(W
AI
C 2026)上,具身智能(Embodied AI)无疑是全场最耀眼的明星。当人形
机器人
能够流畅地完成复杂动作时,行业关注的焦点已从单纯的“运动控制”转向了更为深邃的“大脑”构建。
在安谋科技(
Arm
China)与香港科技大学(HKUST)的联合采访中,安谋科技市场及生态副总裁梁泉与香港科技大学讲席教授、物理AI研究
中心
主任郭嵩,就视觉语言动作模型(VLA)的技术路径、专属芯片架构的底层支撑以及“数据飞轮”的构建进行了深度对谈。双方透露,通过深度绑定VLA模型与底层芯片IP,正在试图解决具身智能从“
仿真
”走向“现实”的最后一公里难题。
一、 技术分野:从“视频生成”到“物理干预”
当前,AI领域存在两条看似平行实则殊途的路线:一条是以Sora为代表的视频生成模型,另一条则是以VLA为代表的具身智能模型。(注:业界常将 Sora 这类模型称为“世界模型”(World Model)的早期形态)

(图:安谋科技市场及生态副总裁梁泉与香港科技大学讲席教授、物理AI研究中心主任郭嵩在接受媒体采访)
“视频生成模型本质上是一个渲染器,它能逼真地
模拟
物理世界,但它缺乏与世界的互动性。”郭嵩教授一针见血地指出。他解释道,视频模型只能“看”到世界并根据描述生成场景,却无法改变世界。而具身智能的核心在于“干预”——VLA模型能够分析物理世界的当前状态与目标状态,端到端地生成具体的动作指令。
这种“端到端”的能力对底层硬件提出了截然不同的要求。梁泉从芯片IP设计的角度分析认为,VLA模型的结构相对稳固,主要由视觉Transformer(VIT)和扩散Transformer(DIT)组成,这种架构的稳定性为芯片的量化优化和落地提供了坚实基础。“对于芯片公司而言,越稳固的模型架构,越有利于我们进行底层的适配和加速,这是VLA相比其他尚在剧烈变动的世界模型架构最大的落地优势。”梁泉表示。
二、 架构演进:Unified VLA与“大脑”的仿真能力
针对业界关于“VLA是否会被世界模型吸收”的讨论,港科大团队给出了前瞻性的答案:两者正在走向融合。
郭嵩教授透露,港科大已在2026年发表了关于“Unified VLA”的研究成果。这一架构在传统的“视觉-语言-动作”链路中,创造性地加入了一个“仿真(
Sim
ulation)”环节。
“VLA是一个弱规划器,它知道要做什么,但不知道做了之后会发生什么。”郭嵩解释道,“Unified VLA引入了世界模型的仿真能力,让机器人在执行动作前,能在‘隐空间’里预演动作的后果。就像
自动驾驶
遇到突发状况,系统会模拟加速、刹车、绕行等多种后果,选择得分最高的方案执行。”
这种“想清楚再做”的机制,打通了智能的传递链路,将世界模型的预测能力赋能给了VLA的执行能力。然而,这种复杂的推理对算力提出了极高要求。梁泉指出,这正是安谋科技与港科大合作的意义所在——将前沿的
算法
模型通过工程化手段,适配到功耗受限的边缘侧芯片上,让“大脑”不仅聪明,而且高效。
三、 专属
ASIC
芯片:大小脑协同与系统级统筹
在本次
问答
环节中,电子发烧友网针对“专属人形机器人ASIC芯片的能力要求”以及“端侧VLA部署中算力、延迟与精度的平衡”两大核心问题,郭嵩教授与梁泉总给出了深度解答。
郭嵩教授指出,与自动驾驶主要关注场景下的快速决策不同,人形机器人需要与人及复杂的物理世界深度交互,这要求芯片具备强大的语言理解与复杂逻辑推理能力,尤其是处理长序列任务(如桌面清理分类)的“长思维链”能力。在架构层面,专属ASIC芯片需实现“大小脑”协同:一方面提供支撑VLA长程推理的强大“大脑”,另一方面通过专用芯片实现高效、安全且实时的自动控制“小脑”闭环。
而在平衡算力约束、推理延迟与动作控制精度时,仅靠单一硬件或算法无法破局,必须依赖高效的具身
操作系统
(如AIOS)进行系统级统筹。此外,针对边缘侧部署,芯片需具备低功耗与量化支撑特性。当前产业真正的难点并非克服工程化的量化与实时部署,而是如何通过AIOS等基础设施将“数据飞轮”真正转动起来。梁泉总则补充表示,具体的算力指标仍需由芯片厂商根据车厂及具身机器人客户的实际需求进行更确切的定义。
四、 破局之道:构建“数据飞轮”与开源生态
具身智能落地的最大瓶颈在于“数据”。与大语言模型拥有互联网海量文本不同,机器人缺乏真实的物理交互数据。郭嵩教授表示,“具身智能的落地有两个痛点,最大痛点是“数据”。数据对于具身来说是稀缺的。简单来说大语言模型为什么成功呢?因为数据,所有互联网上的数据都有,而具身没有。但是有一个案例大家可以看到,比如
特斯拉
,特斯拉把模型(VLA)部署到车端,就可以不停收集数据,这个数据是真实世界的数据,所以能够把数据大量产生。”
“真机数据采集慢、场景有限,而纯合成数据又缺乏物理真实性。”郭嵩教授提出了“数据飞轮”的概念。他认为,必须通过开源和生态合作,利用世界模型生成高质量的长尾数据(即“错题集”),反哺VLA模型的训练。开源是中国AI产业快速迭代的关键。我们需要共享那些失败的、边缘的数据,让生态伙伴共同反思、共同训练,这个飞轮才能真正转起来。
为此,安谋科技发起了“开源AIOS联盟”,并联合港科大推动VLA模型的开源与适配。梁泉强调,这不仅包括模型权重的开放,更包括仿真工具、微调工具链以及针对不同本体(如机器狗、人形机器人)的参考设计,旨在降低下游厂商的开发门槛。
五、 沪港联动:产学研一体化的“双城记”
此次合作的背后,是沪港两地在AI产业上的深度互补。郭嵩教授介绍了港科大“人工智能+创业”硕士项目的创新模式:学生第一年在香港学习理论,第二年在上海安谋科技等头部企业实习,由“双导师”联合培养。这种模式不仅解决了人才落地问题,更打通了“科研-实习-产业”的闭环。
梁泉则透露了安谋科技的战略布局:除了深耕上海西岸的AI生态,进行AIOS核心能力开发,安谋科技还在香港河套地区设立了模型工程团队。“河套对面就是深圳的供应链,”梁泉说,“我们在香港做模型研发,转身就能在深圳找到硬件供应商进行验证。这种‘前店后厂’加‘科研高地’的模式,正是沪港合作在具身智能领域的最佳实践。”
随着VLA技术的不断成熟和底层IP的持续优化,具身智能正从科幻走向现实。安谋科技与港科大的这次联手,或许正是开启通用机器人时代的一把关键钥匙。(完)
Vla
Vla
+关注
关注
0
文章
37
浏览量
5963
安谋科技
安谋科技
+关注
关注
0
文章
140
浏览量
8506
具身智能
具身智能
+关注
关注
0
文章
700
浏览量
983
