智能体终端编程中文测评发布!Kimi K3获61分、DeepSeek V4 Flash得46分 | SuperCLUE-Terminal

# 测评背景
SuperCLUE-Terminal 是面向 AI Agent 终端编程操作能力的中文化实战测评。以 Terminal-Bench-2.0 的任务组织方式为参考框架,由多位国内资深代码专家结合本土开发实践设计新题。考察模型在智能体驱动下的中文理解、长程执行与端到端交付能力,精准量化复杂工程场景中的规划、执行与排障表现,为产业选型提供决策依据。
每道测评题目均需模型经历 50–110轮 的多轮对话交互,完整运行时长约为 半小时至一个半小时,在此过程中逐步完成编程任务的分析、修改与验证。
此前基准方案文章详见:智能体终端任务测评基准方案发布!SuperCLUE-Terminal





Token详细花费数据明细(单位:元/任务)

测评摘要
2. GLM-5.2(max) 与 DeepSeek-V4-Flash-0731(max) 分别获得 48.48 分和 46.46 分,构成紧随其后的高分组;两者相差 2.02 分。
3. 能力、成本、端到端耗时和 Token 用量并不呈简单正相关。DeepSeek-V4-Flash-0731(max) 以 0.64 元/题取得 46.46 分,展现出突出的成本效率;Kimi-K3(max) 得分最高,但平均运行时间为 4,397.18 秒/题。
4. 真实终端任务仍有明显难度。本次 9 个模型的平均得分为 40.18 分,中位数为 36.36 分;说明长程执行、环境适配与最终交付仍是智能体能力的关键分水岭。
# 基准特点
SuperCLUE-Terminal 相比传统问答、代码补全或单轮脚本生成评测,更强调 Agent 在真实终端环境中的完整任务完成能力,具有以下特点:
真实终端交互:模型需要在 Linux 沙箱中自主执行命令、查看文件、修改代码、运行测试并处理报错,评测对象是完整执行过程后的最终状态。
端到端可验证:每道题都通过 pytest 或等价脚本验证输出文件、程序行为、服务状态或计算结果,避免只评价回答文本是否合理。
可复现与可审计:任务结构、运行环境、测试脚本和参考答案标准化,支持结果复核和错误案例追踪。
基准创新点为:
真实业务语境建模:任务围绕软件研发、数据处理、运维排障、合规审计、业务报表等真实工作流设计,要求模型理解需求背景、输入约束和交付标准,而不是只完成孤立命令或片段化代码。
工程任务高区分度:题目覆盖调试、依赖处理、数据清洗、系统配置、项目重构、性能优化等多维度复杂场景,其中部分任务采用1–2小时与4–5小时双梯度时长设计,能够有效检验并拉开不同Agent在长程规划、执行稳定性及问题排查能力上的表现差距。
中文本地化鲁棒性:构建分层对抗性评测,表层覆盖编码(含GBK/GB2312)、格式转换、排序及表头识别;深层考察中文报错日志理解、技术文档/注释语义解析、以及分词、情感分析等NLP任务的输出稳定性。
多维结果拆解:除总通过率外,还按任务类型、能力标签、业务场景、失败原因、推理耗时和超时率、token 消耗、平均步骤数、成本等指标分析模型表现,便于定位具体短板。
基准介绍
(一)评测基准场景划分
本次SuperCLUE-Terminal为99 道任务,按任务目标和能力侧重点分为三类:

1. 综合场景任务
覆盖软件工程、系统管理、安全合规、数据处理、科学计算、机器学习、文件格式转换等综合终端工作流,强调模型在多类工具和工程语境中的综合执行能力。
2. 中文适配类任务
聚焦中文用户环境中的真实材料和本地化问题,包括中文路径、中文文件名、中文表头、中文业务文本、中英混合文档、本地化日期、货币、编码和标点等。考察模型的中文语义理解、编码兼容、字段识别、本地化格式处理等。
3. 长程类任务
模拟需要持续推进的项目级工作流,如跨文件重构、依赖迁移、CI 修复、服务稳定性修复、性能优化和回归测试补齐。考察模型的长程规划、持续调试、错误恢复、上下文保持、交付闭环的能力。
(二)评测方式
流程如上图所示,评测按以下流程执行:
读取任务配置:解析
task.yaml,获取中文任务指令、任务分类、标签、超时时间、测试解析器和运行参数。创建评测试验记录:为当前模型、任务和采样轮次创建独立评测试验记录,绑定任务 ID、模型 ID、运行参数、随机种子、日志路径和产物目录。
构建隔离环境:根据
Dockerfile和docker-compose.yaml构建并启动任务容器,将任务初始文件放入/app等工作目录,确保不同任务和不同模型运行之间互不污染。安装并启动智能体:通过模型适配器将智能体安装或配置到任务容器中,例如 Claude Code、Codex CLI 或其他 Agent 运行时。智能体在同一任务容器内通过受控终端会话接收中文任务说明并执行操作。
注入任务指令:Agent 只接收任务说明和可访问的初始环境,不会接触参考答案、隐藏测试或评测标签中的答案信息。
Agent 自主执行:Agent 框架在任务容器内形成观察-动作循环,通过终端会话查看文件、执行命令、编辑代码、安装必要依赖、启动服务、处理报错并反复验证。系统记录命令、终端输出、耗时和退出状态,便于后续审计。
冻结提交状态:Agent 结束或达到最大执行时间后,评测系统固定当前文件系统和服务状态,进入测试阶段。
挂载或注入测试:将
tests/、run-tests.sh等评测文件挂载或复制到测试环境,避免 Agent 在执行阶段提前读取测试实现。执行自动化验证:运行
run-tests.sh,由 pytest 或等价脚本检查输出文件、程序接口、服务状态、数据统计结果、边界条件和格式约束。判定任务结果:所有测试通过则记为通过;测试失败、运行异常、输出不符合约束或超时均记为未通过,并保留日志用于失败类型分析。
(三)总分计算方式
每题只有通过或未通过两种状态。pytest 全部通过才为通过记为1分;pytest出现有部分测试失败为未通过记为0分。
总分的计算
总分=通过任务数 / 总任务数*100%
1. 综合成绩:模型能力呈现梯度差异

Kimi-K3(max) 通过 60 道任务,以 60.61 分登顶,较 GLM-5.2(max) 领先 12.13 分。GLM-5.2(max) 与 DeepSeek-V4-Flash-0731(max) 分别为48.48和 46.46分,形成第二、第三名的紧凑高分组。
从第 4 名到第 8 名,分数集中在 33.33—39.39 分之间,最大差距为 6.06 分;这一区间的模型均能在相当数量的真实任务中完成交付,但在跨文件修改、长程执行、环境问题恢复等环节仍存在较大提升空间。
2. 性价比:能力与单题成本呈现差异化分布
本图以平均每题价格和总分为坐标,象限分界值分别为 12 元和 41 分。Kimi-K3(max) 与 GLM-5.2(max) 位于高价高分区域:前者以 19.63 元/题取得 60.61 分,后者以 23.30 元/题取得 48.48 分,代表了追求任务完成率时的旗舰投入。
DeepSeek-V4-Flash-0731(max) 以 0.64 元/题获得 46.46 分,在本次成绩中呈现出最突出的成本—能力平衡;DeepSeek-V4-Pro-Preview(max) 以 0.68 元/题取得 39.39 分,也进入低价高分区域。Doubao-Seed-2.1-Pro(high) 与 LongCat-2.0 的单题价格也均低于 12 元,但总分尚未达到 41 分分界值,均处于低价低分区域,后续任务完成能力仍有提升空间。
Token详细花费数据明细(成本:元/任务)如下所示:
3. 推理效能:高分不等于更快
推理效能图以平均每题运行时间和总分为坐标,象限分界值设置为总分 41 分、平均每题运行时间 2,860 秒。Kimi-K3(max) 与 GLM-5.2(max) 均位于长时高分区域:前者平均运行 4,397.18 秒(约 73.29 分钟)/题,后者为 3,992.15 秒(约 66.54 分钟)/题。
DeepSeek-V4-Flash-0731(max) 用时 1,741.87 秒/题,取得 46.46 分,是本次唯一进入短时高分区域的模型。DeepSeek-V4-Pro-Preview(max) 虽仅用时 1,352.62 秒/题,但总分为 39.39 分,尚未达到 41 分分界值。这表明端到端运行时间更短并不必然带来更高任务完成率,仍需结合最终交付结果判断。
注意这里的运行时间包含模型响应、工具调用、命令执行和验证等待等完整过程,不应将其简单等同于模型本身的“思考速度”。
4. 交互轮数:执行策略差异显著
交互轮数图以平均每题交互轮数和总分为坐标,象限分界值设置为总分 41 分、平均每题 81 轮。Kimi-K3(max) 与 GLM-5.2(max) 均位于低轮高分区域:前者平均使用 57.87 轮/题,是本次轮数最少的模型;后者平均使用 69.95 轮/题,二者均超过 41 分分界值。
DeepSeek-V4-Flash-0731(max) 平均使用 91.60 轮/题,取得 46.46 分,位于高轮高分区域;MiniMax-M3 的平均交互轮数为 106.94 轮/题,为本次最高,但总分为 36.36 分,尚未达到高分分界值。交互轮数更多并不直接等价于能力更强或更弱,而是呈现了模型在观察、试错、修复与验证上的不同执行路径。
5.总 Token 消耗:高分对应不同资源路径
总 Token 消耗由平均每题输入 Token、输出 Token 与输入缓存命中 Token 相加得到。本图的象限分界值设置为 830 万 Token 和 41 分。
在高分模型中,Kimi-K3(max) 平均每题总 Token 消耗约 481.81 万,低于 830 万分界值,同时取得 60.61 分,位于低 Token 高分区域;GLM-5.2(max) 以约 867.55 万 Token 取得 48.48 分,DeepSeek-V4-Flash-0731(max) 以约 1,299.54 万 Token 取得 46.46 分,二者均位于高 Token 高分区域。这表明较高任务完成率可通过不同资源路径实现。DeepSeek-V4-Pro-Preview(max) 约消耗 459.44 万 Token、取得 39.39 分,也说明较低 Token 用量本身并不直接决定最终得分。



在细分指标中,Hy3(high) 的平均输入 Token 为 102.98 万,为本次最高;DeepSeek-V4-Flash-0731(max) 的平均缓存命中 Token 为 1,275.97 万,为本次最高,GLM-5.2(max)。由于不同厂商的缓存计量与计费机制并不完全一致,总 Token 更适合作为运行画像指标,而不应被直接视作跨厂商的账单金额。
# 对比示例展示
某跨境企业的旧防火墙策略同时使用中文地址组、IANA 服务名、IPv4/IPv6 CIDR 和端口区间。策略存在排除项、同 ID 冲突、完全遮蔽、特殊用途地址误放行及格式异常;安全团队还提供了一批待回放流量,用于确认首条命中结果。 输入文件为冻结服务登记表、特殊用途地址登记表、登记元数据、中文策略 CSV 和流量 NDJSON。`/app/policy_compiler.py` 是未完成的 starter;请修复或重写它,形成只依赖 Python 标准库的非交互式编译工具: python /app/policy_compiler.py compile \ --services /app/documents/iana-services.csv \ --special /app/documents/iana-special-addresses.csv \ --registry-meta /app/documents/registry-meta.json \ --policies /app/documents/访问策略.csv \ --packets /app/documents/流量样本.ndjson \ --out /app/output 完整输入 schema、地址与服务集合文法、IANA 最长前缀属性、规则去重、特殊地址安全门、完全遮蔽、首条命中、异常优先级、规范 JSON、摘要及事务提交规则见 `/app/documents/SPEC.md`,均属于公开契约。允许联网,但编译结果必须只依据命令行指定的冻结输入文件;在线数据不得替代或补充这些输入。 编译器应对所有 CSV(包括中文策略 CSV)的合法表头重排保持一致语义。 成功时创建以下输出文件: - `/app/output/rules.ndjson` - `/app/output/decisions.ndjson` - `/app/output/exceptions.ndjson` - `/app/output/manifest.json`
注:输入文件冻结服务登记表、特殊用途地址登记表、登记元数据、中文策略 CSV 和流量 NDJSON等文件由于太长这里不做展示。
【Kimi-K3(max) 最终的回复内容为】:
完成。/app/policy_compiler.py 已重写为仅依赖标准库的非交互式编译工具, 冻结样例运行成功,/app/output/ 下生成四个输出文件。实现要点输入与 schema(文件级错误 → 64)CSV 用 utf-8-sig 解码(接受 BOM),JSON/NDJSON 用严格 utf-8(BOM 即语法错误);csv.reader(strict=True) + reader.line_num 取得逻辑记录结束的物理行号作为 policy: 定位符所有 CSV(含中文策略表)表头仅做集合相等校验,列序任意;记录列数不一致即文件级错误JSON 用 object_pairs_hook 拒绝重复成员名;registry-meta 校验精确字段集、真实公历日期、type(v) is int 的 schema_version: 1登记表严格校验:RFC 6335 服务名、无前导零端口、True/False 大小写精确布尔、规范无主机位 CIDR(str(net)==原文,顺带拒绝 netmask 写法、/08、非小写 IPv6)集合文法与语义地址/服务表达式:逗号分隔、单项 ! 排除、先并后减、结果非空;@name 按大小写精确展开全部 prefix;服务名 ASCII 小写化查表、/tcp//udp 后缀大小写精确、数值项必须带协议特殊地址属性按登记前缀边界把整族空间切成单元段做最长前缀匹配(同长取 name 码点最小),ALLOW 安全门在精确划分后的单元上判定——嵌套项(如 /24 内的 /29、/32 小岛)正确处理,排除项移除的空间不参与完全遮蔽:按 (规则, 地址族, 协议) 用全部相关区间端点划分单元格,以位掩码检查规则包空间是否被此前保留规则包空间的并集覆盖(非单条超集);冲突/无效/被遮蔽规则不贡献覆盖输出与事务规则去重(载荷 = priority/action/scope/规范集合)、DUPLICATE_CONFLICT、首条命中回放、(code,id,locators) 码点排序异常、零字节空 NDJSON、ensure_ascii=False, sort_keys=True, separators=(",",":") 逐行 LFmanifest 含三件摘要、五输入原始字节串联 SHA-256、两个登记快照日期提交:同级 .<out>.tmp-* 写入并逐文件 fsync → 旧目录改名 .<out>.bak-* → 新目录改名就位(失败恢复旧目录)→ 清理 bak、fsync 父目录;启动时清理三类残留;任何 64 失败都不触碰旧输出验证冻结样例输出与手工逐条推演一致(5 规则 / 6 决定 / 7 异常,input_sha256 与文件摘要经 sha256sum 核对)114 项合成行为测试全绿:表头重排、BOM、跨行引号定位符、并集遮蔽、端口维度遮蔽、嵌套登记项安全门、NFKC 全角字段、大小写规则、行级错误优先级、同 ID 一坏一好不毒化、CRLF、端口 0、中文 rule_id 原样输出、事务保留/残留清理、退出码等规模压力:128 策略 + 1000 流量 ≈1.8s;200 登记项 + 30 项表达式的重遮蔽场景 ≈2.2s,均在规范坐标积上界内一处需说明的判断:规范未给"列数与表头不符的策略行"分配行级错误码,我按 §1 将其归为文件级 schema 错误(64),与登记表处理一致。
【对Kimi-K3(max)的评测结果为】:
"parser_results": { "test_sample_end_to_end_counts": "passed", # 端到端计数测试 "test_real_iana_name_expansion": "passed", # IANA 名称展开 "test_address_exclusion_is_minimal_cidr_cover": "passed", # 地址排除生成最小 CIDR 覆盖 "test_service_interval_subtraction_and_same_file_dedup": "passed", # 服务区间差集计算 + 同文件去重 "test_sample_first_match_and_default_decisions": "passed", # 首条命中与默认决策 "test_sample_conflict_shadow_and_safety_errors": "passed", # 冲突检测、遮蔽分析、特殊地址安全门 "test_more_specific_iana_prefix_overrides_parent": "passed", # IANA 更具体前缀覆盖父前缀 "test_exact_special_address_is_more_specific_again": "passed", # 精确特殊地址优先于网段 "test_safety_gate_partitions_mixed_prefix_and_honors_exclusion": "passed", # 安全门对混合前缀分片 + 排除项生效 "test_allow_safety_gate_error_priority": "passed", # ALLOW 安全门错误优先级 "test_deny_rules_bypass_allow_safety_gate": "passed", # DENY 规则绕过安全门 "test_row_error_priority_matrix": "passed", # 行级错误优先级矩阵 "test_shadowing_requires_union_of_earlier_rules": "passed", # 遮蔽必须基于前面规则的并集判断 "test_partial_shadow_is_retained": "passed", # 部分遮蔽保留 "test_first_match_uses_priority_then_rule_id": "passed", # 首条匹配按 priority 排序,相同则按 rule_id "test_ipv6_matching_and_special_annotation": "passed", # IPv6 匹配与特殊地址标注 "test_packet_error_priority_and_family_mismatch": "passed", # 包错误优先级与地址族不匹配 "test_non_ascii_decimal_digits_are_rejected_after_nfkc": "passed", # NFKC 规范化后非 ASCII 数字被拒绝 "test_duplicate_packet_ids_are_not_merged": "passed", # 重复 packet_id 不合并 "test_all_published_sequences_use_declared_lexicographic_order": "passed", # 所有输出序列按声明字典序排列 "test_service_reverse_lookup_returns_all_aliases": "passed", # 服务反向查找返回全部别名 "test_dynamic_registries_drive_policy_expansion_and_annotation": "passed", # 动态登记表驱动策略展开与标注 "test_service_name_casefold_does_not_casefold_protocol_suffix": "passed", # 服务名小写化时不处理协议后缀 "test_equal_length_special_tie_uses_unicode_name": "passed", # 同长度特殊地址平局时用 unicode name 排序 "test_nfkc_bom_and_reordered_chinese_headers": "passed", # NFKC 规范化、BOM 头、中文表头重排 "test_exact_output_schemas": "passed", # 输出 schema 精确匹配 "test_all_json_is_canonical": "passed", # 所有 JSON 规范输出 "test_manifest_binds_inputs_outputs_and_snapshot": "passed", # manifest 绑定输入/输出/快照 "test_deterministic_rebuild_and_no_debris": "passed", # 确定性重建与无残留文件 "test_file_level_failures_preserve_old_output": "passed", # 文件级失败保留旧输出 "test_packet_required_values_must_be_strings[src-value0]": "passed", # 包 src 字段必须是字符串 "test_packet_required_values_must_be_strings[dst_port-443]": "passed", # 包 dst_port 字段必须是字符串 "test_packet_required_values_must_be_strings[protocol-None]": "passed", # 包 protocol 字段必须是字符串 "test_packet_required_values_must_be_strings[packet_id-True]": "passed", # 包 packet_id 字段必须是字符串 "test_csv_data_width_is_file_schema": "passed", # CSV 列宽不一致是文件级 schema 错误 "test_duplicate_json_members_and_ipv6_zone_ids_are_rejected": "passed", # JSON 重复成员与 IPv6 zone_id 拒绝 "test_invalid_registry_rows_are_file_level": "passed", # 无效登记表行按文件级错误处理 "test_empty_rules_and_empty_packets_have_zero_byte_ndjson": "passed", # 空规则/空包输出零字节 NDJSON "test_unknown_cli_argument_returns_64_after_baseline": "passed" # 未知 CLI 参数返回 64}
评测说明:该模型成功完成了 IANA 双栈策略编译器的实现,能够正确处理地址与服务展开、排除与去重、优先级冲突、规则遮蔽、安全校验、IPv4/IPv6 匹配及异常输入等场景。评测中全部测试通过,输出格式、规范化 JSON、清单绑定、确定性重建和失败保护机制均符合要求,整体结果正确且实现完整。
【MiMo-V2.5-Pro 最终的回复内容为】:
"编译器已完成,所有输出已验证通过。以下是实现内容摘要:**`/app/policy_compiler.py`** —— 一个完整的非交互式策略编译器,仅使用 Python 标准库:### 已实现的核心功能:1. **CSV 解析** —— 处理 UTF-8 BOM、NFKC 规范化、引号字段、`\r\n`/`\n` 行结束符2. **地址集合解析** —— 支持 `*`、CIDR(严格模式,不允许主机位)、来自登记表的 `@name` 引用、`!` 排除项;按地址族合并包含项后减去排除项;输出按 IPv4→IPv6 排序3. **服务集合解析** —— 支持 `*`、IANA 服务名(不区分大小写查找)、`端口/协议`、`起始-结束/协议`、`!` 排除项;不允许前导零4. **最长前缀匹配** —— 用于在登记前缀边界上匹配特殊地址属性5. **ALLOW 安全门** —— 源地址(source=False)、目的地址(destination=False 或 forwardable=False)、全局(INTERNET 范围 + global=False)6. **行级错误优先级** —— 每条规则/包按照规范定义的优先级顺序只报告一个错误7. **去重与冲突** —— 相同载荷合并(source_count、locators);相同 ID 不同载荷 → DUPLICATE_CONFLICT8. **遮蔽分析** —— 基于单元格分解,按协议(tcp/udp)逐单元格检查规则 B 的空间是否被所有先前保留规则的并集覆盖9. **首条命中流量回放** —— 规则按(priority、rule_id)排序,匹配源/目的/协议/端口10. **规范 JSON 输出** —— `ensure_ascii=false`、`sort_keys=true`、`separators=(",",":")`、每对象一个 LF11. **原子性输出** —— 临时目录 + fsync + 重命名;无临时文件残留"
【对MiMo-V2.5-Pro的评测结果为】:
"parser_results": { "test_sample_end_to_end_counts": "passed", # 端到端计数测试 "test_real_iana_name_expansion": "passed", # IANA 名称展开 "test_address_exclusion_is_minimal_cidr_cover": "passed", # 地址排除生成最小 CIDR 覆盖 "test_service_interval_subtraction_and_same_file_dedup": "passed", # 服务区间差集计算 + 同文件去重 "test_sample_first_match_and_default_decisions": "passed", # 首条命中与默认决策 "test_sample_conflict_shadow_and_safety_errors": "passed", # 冲突检测、遮蔽分析、特殊地址安全门 "test_more_specific_iana_prefix_overrides_parent": "passed", # IANA 更具体前缀覆盖父前缀 "test_exact_special_address_is_more_specific_again": "passed", # 精确特殊地址优先于网段 "test_safety_gate_partitions_mixed_prefix_and_honors_exclusion": "passed", # 安全门对混合前缀分片 + 排除项生效 "test_allow_safety_gate_error_priority": "passed", # ALLOW 安全门错误优先级 "test_deny_rules_bypass_allow_safety_gate": "passed", # DENY 规则绕过安全门 "test_shadowing_requires_union_of_earlier_rules": "passed", # 遮蔽必须基于前面规则的并集判断 "test_partial_shadow_is_retained": "passed", # 部分遮蔽保留 "test_first_match_uses_priority_then_rule_id": "passed", # 首条匹配按 priority 排序,相同则按 rule_id "test_ipv6_matching_and_special_annotation": "passed", # IPv6 匹配与特殊地址标注 "test_non_ascii_decimal_digits_are_rejected_after_nfkc": "passed", # NFKC 规范化后非 ASCII 数字被拒绝 "test_duplicate_packet_ids_are_not_merged": "passed", # 重复 packet_id 不合并 "test_all_published_sequences_use_declared_lexicographic_order": "passed", # 所有输出序列按声明字典序排列 "test_service_reverse_lookup_returns_all_aliases": "passed", # 服务反向查找返回全部别名 "test_dynamic_registries_drive_policy_expansion_and_annotation": "passed", # 动态登记表驱动策略展开与标注 "test_service_name_casefold_does_not_casefold_protocol_suffix": "passed", # 服务名小写化时不处理协议后缀 "test_equal_length_special_tie_uses_unicode_name": "passed", # 同长度特殊地址平局时用 unicode name 排序 "test_nfkc_bom_and_reordered_chinese_headers": "passed", # NFKC 规范化、BOM 头、中文表头重排 "test_exact_output_schemas": "passed", # 输出 schema 精确匹配 "test_all_json_is_canonical": "passed", # 所有 JSON 规范输出 "test_manifest_binds_inputs_outputs_and_snapshot": "passed", # manifest 绑定输入/输出/快照 "test_deterministic_rebuild_and_no_debris": "passed", # 确定性重建与无残留文件 "test_file_level_failures_preserve_old_output": "passed", # 文件级失败保留旧输出 "test_empty_rules_and_empty_packets_have_zero_byte_ndjson": "passed", # 空规则/空包输出零字节 NDJSON "test_row_error_priority_matrix": "failed", # 行级错误优先级矩阵 "test_packet_error_priority_and_family_mismatch": "failed", # 包错误优先级与地址族不匹配 "test_packet_required_values_must_be_strings[src-value0]": "failed", # 包 src 字段必须是字符串 "test_packet_required_values_must_be_strings[dst_port-443]": "failed", # 包 dst_port 字段必须是字符串 "test_packet_required_values_must_be_strings[protocol-None]": "failed", # 包 protocol 字段必须是字符串 "test_packet_required_values_must_be_strings[packet_id-True]": "failed", # 包 packet_id 字段必须是字符串 "test_csv_data_width_is_file_schema": "failed", # CSV 列宽不一致是文件级 schema 错误 "test_duplicate_json_members_and_ipv6_zone_ids_are_rejected": "failed", # JSON 重复成员与 IPv6 zone_id 拒绝 "test_invalid_registry_rows_are_file_level": "failed", # 无效登记表行按文件级错误处理 "test_unknown_cli_argument_returns_64_after_baseline": "failed" # 未知 CLI 参数返回 64}
评测说明:该模型基本完成了双栈策略编译器的核心功能,规则展开、地址排除、服务区间处理、首条命中、IPv4/IPv6 匹配及输出规范等测试均通过。但评测中仍有 10 项异常处理相关测试失败,主要涉及错误优先级、字段类型校验、CSV 列宽、重复 JSON 成员、IPv6 zoneID、无效登记项及未知 CLI 参数处理。因此整体实现部分正确,但尚未完全满足规范,最终未通过评测。
# 参与测评
参测流程
1.邮件申请
2.意向沟通
3.参测确认与协议流程
4.提供API接口或大模型
5.获得测评报告
邮件标题:智能体终端任务测评SuperCLUE-Terminal申请,发送到contact@superclue.ai请使用单位邮箱,邮件内容包括:单位信息、大模型简介、联系人和所属部门、联系方式
联系我们


