2026年9月中文通用大模型测评通知!
发布时间:2026-09-15来源:CLUE中文语言理解测评基准
SuperCLUE-2026年9月通用大模型测评通知
为全面评估截至2026年9月中文大模型的综合性能和发展进程,SuperCLUE团队计划将于2026年9月30日发布《中文大模型通用基准测评2026年9月测评结果》。
结合当前大模型技术重点与行业实践现状,本次测评将在2026年7月SuperCLUE通用测评基准体系的基础上,作出以下调整:1.超长上下文:将超长上下文处理能力作为独立测评维度,重点测评模型在长文本信息检索、逻辑输出等方面的综合表现。历史测评可见Kimi-K3、GLM-5.2中文超长上下文多轮检索测评结果发布!2.数理推理:对数学、科学推理进行合并,统一为数理推理测评维度,综合考察模型在数理计算、逻辑推导、科学问题分析求解上的能力水平。3.维度精简优化:移除智能体任务规划测评维度,受限于纯文本测评场景,未体现真实智能体的行动闭环能力,本次暂不保留。
4.难度升级,强化区分度:对各任务内部的子类划分与试题难度进行优化调整,整体抬升测评基线难度,拉大模型能力分层,更精准识别高阶能力差异。即日起-2026年9月18日:报名申请、模型对接
9月19日-9月27日:模型测评
9月28日-9月29日:结果统计9月30日:发布文章
2026年9月SuperCLUE通用基准测评总分由五大核心任务的得分构成,设置每个任务的权重w_n。即:
总分= w_1*数理推理+w_2*智能体编程+w_3*超长上下文+w_4*精确指令遵循+w_5*幻觉控制
针对每个题目,每个模型每次请求的超时时长为30分钟,未获取到答案的题目计0分;同时,针对非智能体编程任务,每个模型有最多3次回答的机会(即如果没有正常获取答案,可尝试的次数)。请各大模型团队于2026年9月18日18:00前使用单位邮箱参与申请,发送至:
contact@superclue.ai
邮件内容包括:单位信息、大模型简介、联系人和所属部门、联系方式。
2026年9月基准测评将会发布【总榜】、【模型象限】及【各专项榜单】等,总体表现和各任务分数将同步更新在www.superclueai.com官方排行榜网站。用户意见征集:
诚邀您推荐希望我们评测的大语言模型,您的建议可通过下方评论区留言,我们将认真考量每一条意见,并酌情纳入后续评测计划。
另:
请关注CLUE官网:
转载说明:本文系转载内容,版权归原作者及原出处所有。转载目的在于传递更多行业信息,文章观点仅代表原作者本人,与本平台立场无关。若涉及作品版权问题,请原作者或相关权利人及时与本平台联系,我们将在第一时间核实后移除相关内容。