DeepSeek-V4-Pro-0813 智能体终端编程测评结果发布|低成本跻身超值领航者
本次测评结果用于学术研究,仅供参考
SuperCLUE-Terminal 是面向 AI Agent 终端操作能力的中文化实战测评基准。参考 Terminal-Bench-2.0 的任务组织方式,由代码专家结合本土开发实践设计真实终端任务,重点考察大模型在驱动智能体框架时对中文需求的理解、任务规划、工具调用、文件修改、错误排查与最终交付能力。测评固定使用 Claude Code 作为智能体框架,以此为标准平台,横向对比评测各模型的核心能力。
每道测评题目均需模型经历 50–110轮 的多轮对话交互,完整运行时长约为 半小时至一个半小时,在此过程中逐步完成编程任务的分析、修改与验证。
本次测评新增 DeepSeek-V4-Pro-0813,与其他参测模型进行横向比较。
相关文章链接:
智能体终端任务测评基准方案发布!SuperCLUE-Terminal
智能体终端编程中文测评发布!Kimi K3获61分、DeepSeek V4 Flash得46分 | SuperCLUE-Terminal

DeepSeek-V4-Pro-0813(max) 以 51.52 分位居全场第二,在 1.42 元/题的成本下进入“超值领航者”象限,展现出较强的能力—成本平衡。
总分位居全场第二
DeepSeek-V4-Pro-0813(max) 在测评中获得 51.52 分,仅次于 Kimi-K3(max) 的 60.61 分;同时高于 GLM-5.2(max) 的 48.48 分和 DeepSeek-V4-Flash-0731(max) 的 46.46 分, 低价高分,成本显著低于高分模型
DeepSeek-V4-Pro-0813(max) 的单题价格为 1.42 元,约为 Kimi-K3(max) 19.63 元的十四分之一、GLM-5.2(max) 23.30 元的十六分之一;在得分高出 GLM 3.04 分的同时,API 成本明显更低。不过,DeepSeek-V4-Flash-0731(max) 和 DeepSeek-V4-Pro-Preview(max) 的价格更低,分别为 0.64 元和 0.68 元,DeepSeek-V4-Pro-0813(max) 的优势主要体现在更高的任务完成率。
同系列模型形成清晰梯度
DeepSeek系列均处于低价高分区域,其中DeepSeek-V4-Pro-0813(max) 以更高价格换取了 51.52 分的同系列最高成绩,适合更重视复杂终端任务完成率、同时希望控制使用成本的场景。
