具身智能 Robotwin2.0 统一测评结果发布,腾讯混元 VLA 领先,生数 Motus 第二 | EmbodiedCLUE-VLA
在首期评测中,EmbodiedCLUE-VLA 基于RoboCasa-GR1-Tabletop的具身智能桌面操作场景统一测评搭建,围绕模型基础任务能力、中文指令适配能力等维度,对视觉-语言-动作模型(Vision-Language-Action, VLA)进行了统一测试。
本次评测,EmbodiedCLUE-VLA 进一步引入 RoboTwin 2.0 作为拓展方向,选取其中代表性的 10 项操作任务,考察复杂的双臂操作任务以及随机化环境中的任务。统一部署并评测 8 个代表性VLA模型,以下为结果及分析:
# 结果概览
总榜


一、评测基准
1.基准介绍
RoboTwin 2.0 是面向通用双臂机器人操作研究的大规模仿真数据生成与评测平台,基于 SAPIEN 物理仿真环境构建。
RoboTwin 2.0 官方当前提供 50 项双臂操作任务,并支持多个机器人本体进行数据采集与模型评估。任务覆盖物体抓取、放置、排序、堆叠、工具使用、双臂协作、关节物体操作以及连续动作等不同类型。与相对固定的桌面操作场景相比,RoboTwin 2.0 的一个重要特点在于其较强的环境随机化能力。这些随机因素使模型不能简单依赖固定的场景纹理、物体位置或视觉模式完成任务,而需要具备更稳定的视觉理解、空间定位和操作能力。
因此,相比上一阶段的 RoboCasa-GR1-Tabletop,本阶段更关注:VLA 模型在随机环境、有限执行预算以及复杂双臂操作条件下的任务完成能力。
RoboTwin 2.0 官方包含 50 项双臂任务。为了突出模型能力区分度,本阶段 EmbodiedCLUE-VLA 从中选取 10 个具有代表性的任务,覆盖单点接触、抓取放置、双臂协作、多目标排序以及关节物体操作等多种操作能力。

{ "benchmark": "RoboTwin 2.0", "benchmark_extension": "EmbodiedCLUE-VLA", "embodiment": "Aloha-AgileX", "environment": { "difficulty": "Hard", "task_config": "demo_randomized" }, "evaluation": { "num_tasks": 10, "episodes_per_task": 20, "episodes_per_model": 200, "seeds": "0-19", "control_hz": 10 }, "tasks": [ "hanging_mug", "blocks_ranking_size", "click_bell", "move_stapler_pad", "turn_switch", "place_mouse_pad", "place_can_basket", "handover_block", "click_alarmclock", "open_microwave" ], "metrics": { "primary_metric": "Success Rate", "aggregation": "Macro Average over 10 Tasks" }, "execution_protocol": { "name": "EmbodiedCLUE Short-Horizon", "type": "Task-specific Control Step Budget" }, "statistics": { "confidence_interval": "95%", "bootstrap_method": "Task-stratified Bootstrap", "bootstrap_resamples": 100000, "bootstrap_interval": "Percentile", "bootstrap_seed": 20260807 }}
当前全部模型均在:demo_randomized / Hard环境下完成评测。这意味着场景中会开启包括杂乱物体、随机背景、随机光照以及桌面高度变化等扰动,从而增加模型对环境变化的适应难度。
同样需要说明的是,本评测采用区别于 RoboTwin 2.0 官方完整 Horizon 的 Short-Horizon 协议。根据任务复杂度,10 项任务的最大执行预算设置在 60-300 steps(约 6–30 秒,10 Hz)范围内,其中多阶段、双臂协作和多目标连续操作任务给予相对更长的执行时间。该设置一方面能够减少长时间无效动作和低效轨迹对评测结果的影响,另一方面也避免复杂任务因执行时限过短而产生明显的地板效应。因此,本次评测更关注模型在有限控制预算下的任务完成能力与执行效率,其结果与 RoboTwin 2.0 官方完整 Horizon 成绩不直接等价。
在具体评测中,EmbodiedCLUE-VLA 根据不同任务的操作复杂度与所需动作阶段,为每项任务分别设定最大执行步数,并确保所有参评模型在同一任务上使用完全一致的执行预算。
二、评测评分
1.评分方法
对于每一个任务:

其中每项任务执行:

最终模型总分为 10 个任务 Success Rate 的等权平均:

最终分数范围为(0∼100),分数越高,说明模型在当前随机环境和有限执行预算下完成任务的比例越高。
2. 95% 置信区间
本阶段在 Success Rate 之外进一步加入:95% Bootstrap 置信区间。
评测采用任务分层 Bootstrap(Task-stratified Bootstrap):每个任务固定 20 个 episode,在各任务内部独立进行有放回采样,并保持 10 个任务在总分中的权重不变。共执行 100,000 次 Bootstrap 重采样
并取 Bootstrap 分布的 2.5% 与 97.5% 分位数形成 95% CI。
榜单采用相对于模型当前分数的格式展示,形式如下:
-Lower / +Upper
三、评测总结

总榜

数据分析
从总分来看,目前模型大体可以分为三个区间。第一梯队Hy-Embodied-0.5-VLA、Motus、InternVLA-A1.5 ,三者得分分别达到:
HyVLA:73.0 Motus:68.5 InternVLA:61.0
整体明显高于其他模型。
其中 Hy-Embodied-0.5-VLA 当前取得最高平均成功率,在当前 10 项随机化任务中表现出较好的综合操作能力。Motus 与 InternVLA 同样表现出较强的随机环境适应与基础操作能力。
可视化分析
















在目前测试任务中 hanging_mug、blocks_ranking_size、turn_switch表现出了较高的整体难度。这三项任务分别代表了几种不同的困难来源。
hanging_mug 要求模型完成抓取 → 姿态调整 → 精确移动 → 杯柄/支架空间对齐 → 悬挂,其难度远高于普通物体放置。
blocks_ranking_size 则要求模型理解多个物体之间的相对属性,并连续执行多次操作,对任务规划与累计误差控制提出更高要求。
turn_switch 虽然动作序列较短,但目标区域小,对末端执行器的精确定位和接触轨迹要求非常高。
这也说明:任务执行时间长并不一定意味着任务困难,精细接触、小目标定位以及多阶段动作同样可能成为 VLA 模型的重要瓶颈。

