DeepSeek-V4-Pro中文测评出炉:总榜第二,智能体编程能力大幅提升!
发布时间:2026-08-18来源:CLUE中文语言理解测评基准
模型介绍
点击 文末阅读原文 或 复制下方网址到浏览器 即可跳转SuperCLUE官网查看完整的测评内容:
SuperCLUE官网地址:www.superclueai.com



三、Token实际花费数据明细(2026年7月)



五、推理效能区间分布(2026年7月)

六、性价比区间分布(2026年7月)




测评说明
本次2026年7月通用基准测评共有13个国内模型参与(包括补测模型),测评集包括六大任务:智能体编程、智能体任务规划、数学推理、科学推理、精确指令遵循、幻觉控制。详细的测评说明可见介绍文章:2026年7月中文通用大模型基准测评结果。
本次测评权重向智能体编程能力倾斜(25%),重点考察模型在典型编程智能体下的端到端任务完成能力;数学、科学推理、指令遵循、幻觉控制作为基础核心能力配置接近的权重;智能体任务规划受限于本次纯文本测评场景,给予相对较低权重。最终权重占比为:
智能体编程:25%
数学推理:18%
科学推理:16%
精确指令遵循:16%
幻觉控制:16%
智能体任务规划:9%



扩展阅读
[1] CLUE官网:www.CLUEBenchmarks.com
[2] SuperCLUE排行榜网站:www.superclueai.com
[3] Github地址:https://github.com/CLUEbenchmark/SuperCLUE
转载说明:本文系转载内容,版权归原作者及原出处所有。转载目的在于传递更多行业信息,文章观点仅代表原作者本人,与本平台立场无关。若涉及作品版权问题,请原作者或相关权利人及时与本平台联系,我们将在第一时间核实后移除相关内容。

