DeepSeek 涨价前后性价比象限图|智能体终端编程,新增 Qwen3.8-Max
本次测评结果用于学术研究,仅供参考
SuperCLUE-Terminal 是面向 AI Agent 终端操作能力的中文化实战测评基准。参考 Terminal-Bench-2.0 的任务组织方式,由代码专家结合本土开发实践设计真实终端任务,重点考察大模型在驱动智能体框架时对中文需求的理解、任务规划、工具调用、文件修改、错误排查与最终交付能力。测评固定使用 Claude Code 作为智能体框架,以此为标准平台,横向对比评测各模型的核心能力。
每道测评题目均需模型经历 50—110 轮的多轮对话交互,完整运行时长约为半小时至一个半小时。在此过程中,模型需要逐步完成编程任务的分析、修改与验证,最终由隐藏测试对交付结果进行自动判定。
本次测评加入 DeepSeek-V4-Pro-0813 与 DeepSeek-V4-Flash-0731 价格调整前后的对比分析,其中新价格按照官方高峰时段定价统计。新增 Qwen3.8-Max 模型。
相关文章链接:
智能体终端任务测评基准方案发布!SuperCLUE-Terminal
智能体终端编程中文测评发布!Kimi K3获61分、DeepSeek V4 Flash得46分 | SuperCLUE-Terminal

本次分析采用 12 元/题和 41 分作为象限分界线;在这一分界下,DeepSeek-V4-Pro-0813 和 DeepSeek-V4-Flash-0731 当前及涨价前的价格点均位于低价高分区域,Qwen3.8-Max(xhigh) 排名第三,位于高价高分区域。
DeepSeek-V4-Pro-0813(max):涨价后仍保持低价高分定位
DeepSeek-V4-Pro-0813(max) 以 51.52 分位居全场第二。其涨价前价格为 1.42 元/题,以官方高峰时段计价为 7.01 元/题,价格升至原来的 4.94 倍,但仍处于低价高分的“超值领航者”区域。
DeepSeek-V4-Flash-0731(max):涨价后仍处于超值区域
DeepSeek-V4-Flash-0731(max) 以 46.46 分排名第五,涨价前价格为 0.64 元/题,以官方高峰时段计价为 2.85 元/题,价格升至原来的 4.45 倍,位于“超值领航者”区域。
Qwen3.8-Max(xhigh):进入前三,展现高端任务能力
Qwen3.8-Max(xhigh) 以 49.49 分排名第三,平均每任务价格为 16.17 元,位于高价高分区域,展现出较强的复杂终端任务完成能力和稳定的高质量交付表现。对于需要持续进行多轮交互、工具调用、跨文件修改、错误排查与结果验证的工程场景,Qwen3.8-Max(xhigh) 体现出较好的综合适配能力,适合对任务成功率、工程复杂度和能力表现有较高要求的应用场景。
DeepSeek涨幅原因分析
本次成本对比沿用上次测评记录中的平均每任务 Token 用量,Token 消耗本身保持不变,仅将原有计价方式调整为官方高峰时段计价。按照相同的 Token 用量分别套用涨价前价格和官方高峰时段新价格后,两款模型的每任务成本构成如下:

从新价格下的成本结构看,DeepSeek-V4-Pro-0813(max) 的输出 Token 成本占 59.5%,是单任务成本中占比最大的部分;DeepSeek-V4-Flash-0731(max)的输出 Token 和缓存命中输入成本分别占 45.6% 和 44.8%,基本各占一半。因此缓存命中输入价格调整后,对单题成本的影响尤为明显。
