2026年7月中文大模型基准测评结果发布!Qwen3.8、Kimi-K3并列第一,DeepSeek轻量版并列第二!

SuperCLUE团队
2026/07
点击 文末阅读原文 或 复制下方网址到浏览器 即可跳转SuperCLUE官网查看完整的测评内容:
SuperCLUE官网地址:www.superclueai.com

一、SuperCLUE智能指数(2026年7月)



四、智能体编程—效能区间(2026年7月)


六、Token实际花费数据明细(2026年7月)


测评摘要
Qwen3.8-Max(max)(71.48分)与Kimi-K3(max)(70.68分)以0.80分差并列第一,头部竞争激烈。Doubao-Seed-2.1-pro(high)(65.94分)、DeepSeek-V4-Flash(max)(65.60分)并列第二;DeepSeek-V4-Pro(max)(64.40分)第三,形成明显的领先梯队,国内整体实力稳步提升。
2. 智能体编程能力分化明显,头尾差距显著。
智能体编程是本次测评能力分化最明显的任务。Kimi-K3(max)以75.79分领跑,Qwen3.8-Max(max)(68.42分)、GLM-5.2(max)(64.13分)紧随其后,头部模型展现出领先优势;而尾部模型得分明显偏低,榜首与末位差距接近50分,智能体编程能力梯队分化严重。
3. 模型性价比较高,DeepSeek-V4系列表现突出。
DeepSeek-V4系列模型处于高性价比区间,以更低的API价格实现了更高的推理质量;Hy3(high)、GLM-5.2(max)等5款模型位于中性价比区。国内模型在性价比优势明显。
4. 推理能力分差明显,推理效能差异显著。
高效能区由DeepSeek-V4-Flash(max)、GLM-5.2(max)、Hy3(high)三款模型占据,推理效能突出。中效能区包括DeepSeek-V4-Pro(max)、MiniMax-M3、LongCat-2.0、MiMo-V2.5-Pro四款模型。而Qwen3.8-Max(max)、Kimi-K3(max)、Doubao-Seed-2.1-pro(high)虽推理能力得分领先,但其推理时间过长,位于低效能区。
中文大模型测评基准SuperCLUE持续对国内外大模型的发展趋势和综合效果进行实时跟踪,本次2026年7月通用基准测评聚焦国内模型,共有12个国内模型参与,测评集包括六大任务:智能体编程、智能体任务规划、数学推理、科学推理、精确指令遵循、幻觉控制。
本次测评权重向智能体编程能力倾斜(25%),重点考察模型在典型编程智能体下的端到端任务完成能力;数学、科学推理、指令遵循、幻觉控制作为基础核心能力配置接近的权重;智能体任务规划受限于本次纯文本测评场景,给予相对较低权重。最终权重占比为:
智能体编程:25%
数学推理:18%
科学推理:16%
精确指令遵循:16%
幻觉控制:16%
智能体任务规划:9%

「 基准重大更新:代码生成 ➡ 智能体编程 」
传统代码生成测评存在场景割裂、脱离工程实操等问题;而基于多轮交互的智能体编程测评,贴合真实开发者工作流程。因此,本次通用测评基于终端AI 编程工具(Claude Code)中文场景软件工程SWE测评方案发布!,依托多轮智能体交互模式,能够更客观、全面、真实地量化大模型在本土化开源工程场景下的实战编码能力。

测评结果与分析
一、智能体编程对比分析
1. 编程能力分化明显:Kimi-K3断层领先,模型平均在60分以下。


推理时间效能区别明显:
从单题平均推理耗时来看,模型间跨度近3倍:Hy3(high)位居最快,DeepSeek-V4-Pro(max)位列第二,Step-3.7-Flash(high)、MiMo-V2.5-Pro同样处于快速响应区间;而Kimi-K3(max)耗时垫底,约为Hy3的三倍,以高资源消耗取得更好的成绩。

交互轮数与单轮效能:少而精 vs 多而廉
从交互效能来看,Kimi-K3(max)以42.23轮的中等交互量取得卓越单轮产出,是典型的"深思熟虑型"——每轮投入较多推理时间,但轮次克制、产出精准。表现最差的MiniMax-M3以75.18轮的最高交互量分数排名却靠后,是全场单轮效能最低的模型,陷入"多轮纠缠"——反复修正却难以收敛到正确方案。

在Token消耗策略上,模型间差异更为显著:
各模型在单题平均总Token消耗上呈现近9倍的悬殊差距:MiMo-V2.5-Pro与Kimi-K3(max)以约4.9万tokens/题的消耗位居最低区间,ERNIE 5.1(max)则以42.6万tokens/题位居最高,后者消耗量是前者的8.7倍。
二、模型对比分析
1. 国内头部模型竞争激烈,Qwen3.8、Kimi-K3领跑榜单。
Qwen3.8-Max(max)(71.48分)与Kimi-K3(max)(70.68分)以0.80分差并列第一,头部竞争激烈。Doubao-Seed-2.1-pro(high)(65.94分)、DeepSeek-V4-Flash(max)(65.60分)并列第二;DeepSeek-V4-Pro(max)(64.40分)第三,形成明显的领先梯队;GLM-5.2(max)(63.27分)、Hy3(high)(62.13分)紧随其后,MiniMax-M3(56.90分)及以下模型与头部差距逐步拉大,榜单呈现出清晰的梯队化格局,国产模型整体实力稳步提升。

象限分析显示,Qwen3.8-Max(max)(推理能力72.51分、应用能力73.61分)综合表现最佳,Kimi-K3(max)(72.63分、69.72分)紧随其后。DeepSeek-V4-Pro(max)与ERNIE 5.1(max)位于实用主义者象限,应用能力表现优于推理能力;GLM-5.2(max)、Hy3(high)位于技术领跑者象限,推理能力领先于应用能力;而MiniMax-M3、LongCat-2.0、MiMo-V2.5-Pro、Step-3.7-Flash(high)位于潜力探索者象限,推理与应用两项能力均有较大提升空间。

2. 六大任务对比图
(1)智能体编程

(2)智能体任务规划

(3)数学推理
DeepSeek-V4-Flash(max)以78.95分夺得数学推理榜单第一,实力强悍;Qwen3.8-Max(max)与Hy3(high)以77.19分并列第二,Doubao-Seed-2.1-pro(high)以75.44分位居第四,头部模型竞争胶着。

(4)科学推理
Doubao-Seed-2.1-pro(high)以77.19分领跑科学推理榜单,Hy3(high)以75.44分位居第二,Qwen3.8-Max(max)与DeepSeek-V4-Pro(max)以71.93分并列第三,国内模型整体表现出色。

(5)精确指令遵循

(6)幻觉控制

三、性价比区间分布(2026年7月)

国产模型主导中高性价比区。
高性价比区由DeepSeek-V4系列独占,以极低的API价格实现了较高的推理质量。中性价比区包括Qwen3.8-Max(max)、Doubao-Seed-2.1-pro(high)、GLM-5.2(max)、Hy3(high)、MiniMax-M3五款模型。而Kimi-K3(max)虽以70.68分位居总榜第二,但40元/百万Tokens的高价使其落入低性价比区;ERNIE 5.1(max)、LongCat-2.0、MiMo-V2.5-Pro、Step-3.7-Flash(high)因总分相对偏低,同样位于低性价比区。
四、推理效能区间分布(2026年7月)

推理能力分差明显,推理效能差异显著。
从推理效能区间分布来看,高效能区由DeepSeek-V4-Flash(max)、GLM-5.2(max)、Hy3(high)三款开源模型占据,它们以较短的推理时间实现了较高的推理能力得分,推理效能突出。中效能区包括DeepSeek-V4-Pro(max)、MiniMax-M3、LongCat-2.0、MiMo-V2.5-Pro四款模型。而Qwen3.8-Max(max)、Kimi-K3(max)、Doubao-Seed-2.1-pro(high)虽推理能力得分领先,但推理时间过长,落入低效能区;ERNIE 5.1(max)与Step-3.7-Flash(high)因推理能力得分偏低,同样位于低效能区。
附:
2026年5月通用测评模型列表

测评的更多详细内容,请点击文章下方 阅读原文 或 复制以下链接到浏览器 查看:
https://www.superclueai.com


扩展阅读
[1] CLUE官网:www.CLUEBenchmarks.com
[2] SuperCLUE排行榜网站:www.superclueai.com
[3] Github地址:https://github.com/CLUEbenchmark/SuperCLUE

