智能体终端编程中文测评更新|GLM-5.3位列第二,两款Flash模型并列第五
本次测评结果用于学术研究,仅供参考
SuperCLUE-Terminal 是面向 AI Agent 终端操作能力的中文化实战测评基准。参考 Terminal-Bench-2.0 的任务组织方式,由代码专家结合本土开发实践设计真实终端任务,重点考察大模型在驱动智能体框架时对中文需求的理解、任务规划、工具调用、文件修改、错误排查与最终交付能力。测评固定使用 Claude Code 作为智能体框架,以此为标准平台,横向对比各模型的核心能力。
模型需要在真实终端环境中逐步完成任务分析、代码修改与结果验证,最终由隐藏测试对交付结果进行自动判定。按模型的平均每题数据计算,交互轮数介于 57.87—116.44 轮,运行时间约为 22.54—73.29 分钟。
本次更新重点关注 GLM-5.3(max)、Qwen3.8-Flash(xhigh) 与 GLM-5.3-Flash(max) 的表现,并结合平均每题价格、运行时间、交互轮数和总 Token 消耗,对不同模型的能力与资源投入进行对比。
相关文章链接:
智能体终端任务测评基准方案发布!SuperCLUE-Terminal
智能体终端编程中文测评发布!Kimi K3获61分、DeepSeek V4 Flash得46分 | SuperCLUE-Terminal
# 测评总榜

# 测评象限图
← 左右滑动查看四张图 →
本次测评中,GLM-5.3(max) 以 56.57 分位列第二,较 GLM-5.2(max) 提高 8.09 分,在平均每题成本接近的情况下,运行时间缩短约10.45%,但交互轮数有所增加。Qwen3.8-Flash(xhigh) 与 GLM-5.3-Flash(max) 均以 48.48 分并列第五,平均每题价格分别为 0.90 元和2.05 元。其中,Qwen3.8-Flash 较 Qwen3.8-Max 仅低 1.01 分,成本降低约 94.43%,运行时间也明显缩短;GLM-5.3-Flash 则以较 GLM-5.2 低约 91.20% 的成本取得相同得分,但其运行时间、交互轮数与总 Token 消耗均高于 Qwen3.8-Flash,体现出同等得分下不同模型的资源投入差异。
# 四个维度,观察能力与资源投入
性价比:两款 Flash 模型呈现低价高分优势
GLM-5.3(max) 以 56.57 分和 23.86 元/题位于“高端质优者”区域,得分领先于两款 Flash 模型。Qwen3.8-Flash(xhigh) 与 GLM-5.3-Flash(max) 均获得 48.48 分,平均每题价格分别为 0.90 元和 2.05 元,均位于“超值领航者”区域。其中,Qwen3.8-Flash 在相同得分下,每题成本较 GLM-5.3-Flash 低约56.10%,性价比表现更为突出。
推理效能:Qwen3.8-Flash耗时更短,GLM-5.3得分更高
Qwen3.8-Flash(xhigh) 的平均每题运行时间为 2011.10 秒,是三款模型中耗时最短的。GLM-5.3(max) 以 3575.15 秒取得 56.57 分,体现出更高的任务完成能力;GLM-5.3-Flash(max) 则耗时 4171.07 秒,得分与 Qwen3.8-Flash 相同。在本次完整任务流程中,Qwen3.8-Flash的时间效率更突出,GLM-5.3 则在得分上保持优势。
交互轮数:Qwen3.8-Flash以更少轮次取得同等得分
Qwen3.8-Flash(xhigh) 的平均每题交互轮数为 61.59 轮,低于 GLM-5.3(max) 的 103.05 轮和 GLM-5.3-Flash(max) 的 116.44 轮。其中,两款 Flash 模型得分相同,但 Qwen3.8-Flash 所需交互轮数明显更少。
Token消耗:Qwen3.8-Flash用量最低,GLM-5.3-Flash费用仍较低
按输入、输出与输入缓存命中 Token 三项相加的口径,Qwen3.8-Flash(xhigh)、GLM-5.3(max) 与 GLM-5.3-Flash(max) 的平均每题总Token 消耗分别约为 4.75 百万、8.79 百万和 10.98 百万。Qwen3.8-Flash 以最低用量取得与 GLM-5.3-Flash 相同的得分;GLM-5.3-Flash 的用量虽高于 GLM-5.3,每题费用明显更低,具有更高的性价比。
# 联系我们





