具身大脑测评体系9月更新!体系精简,任务难度加强
发布时间:2026-09-17来源:CLUE中文语言理解测评基准

随着多模态模型和具身智能大脑能力持续提升,我们对 EmbodiedCLUE 具身智能大脑测评进行了新一轮调整。本次更新主要围绕任务体系精简与重点任务难度增强展开:取消区分度相对较低的“常识认知”独立任务,同时进一步加强任务规划、物体定位等重点类别的题目难度,以提升测评对当前主流及前沿模型的区分能力。
排行榜地址:www.SuperCLUEai.com
# EmbodiedCLUE-VLA测评体系

既有维度定义、题库构建流程、评估方式,均沿用上一期方案。可回顾:具身智能(大脑)第二期测评:中小参数模型Qwen3-VL-32B、RoboBrain-2.5领跑 | EmbodiedCLUE
1. 测评方案变化
(1)任务体系更新
本次更新中,我们取消了原有的“常识认知”独立二级任务。在此前测评中,常识认知主要关注基础生活常识以及场景知识等能力。这类题目的完成度已经较高,继续作为独立任务的区分度不足。因此,本次将其从独立任务体系中移除,使整体测评更加聚焦于当前模型仍存在明显能力差异的具身感知、推理与规划任务。
(2)加强重点任务的难度
物体定位任务将更多考察模型在复杂场景中结合属性、局部特征和目标关系完成精确定位,而不是仅根据简单类别名称寻找物体; 功能感知任务将更多结合当前任务需求、环境条件与物体功能进行判断,而不是仅依赖基础常识识别物体用途; 任务规划则在原有多步骤规划基础上进一步增加更长的操作链和更长跨度的任务流程,考察模型能否在连续多个操作步骤中持续保持正确的任务目标与执行顺序。
2. 测评方法
本次EmbodiedCLUE-VLA具身大脑测评所有题目均提供参考答案,根据不同类别的题目使用裁判模型/规则脚本对模型的答案进行严格的0/1评分,模型的答案与参考答案一致则该题得1分,反之,该题得0分。具体的类别评价标准可以参考上期的榜单文章。
时间规划
测评流程
1.邮件申请
2.意向沟通
3.参测确认与协议流程
4.提供API接口或大模型
5.获得测评报告

转载说明:本文系转载内容,版权归原作者及原出处所有。转载目的在于传递更多行业信息,文章观点仅代表原作者本人,与本平台立场无关。若涉及作品版权问题,请原作者或相关权利人及时与本平台联系,我们将在第一时间核实后移除相关内容。
