国产龙虾Claw产品第二期测评:文心助手领跑,10款产品全部突破91分

从“能否完成任务”到“能否稳定完成任务”,国产 Claw 产品正在进入更细颗粒度的能力比拼阶段。第二期 SuperCLUE-XClaw 测评继续以真实办公场景为核心,覆盖数据处理、内容创作、记忆能力、代码开发和研究分析五大能力维度,对 10 款产品开展三次独立重复测试。
与首测相比,本期产品整体得分明显集中:10 款产品的三次平均分全部超过 91 分,头部差距进一步收窄。在高分常态化的背景下,单项能力优势和多次测试的稳定性,成为更值得关注的差异化指标。
后续,我们将进一步升级题目复杂度和任务难度,推动测评向更高阶的实用能力边界延伸。
往期文章参考:国产龙虾Claw产品首测:10款产品真实测评
# SuperCLUE-XClaw榜单概览
SuperCLUE-XClaw榜单地址:https://superclueai.com/xclaw
1. 总分对比

2. 五大维度对比

SuperCLUE-XClaw测评摘要
摘要1:十款产品均超91分,头部四强竞争极为胶着。摘要2:内容创作与记忆已趋成熟,代码开发仍最具区分度
五个维度里,内容创作(98.34)与记忆能力(98.32)均接近满分,办公文本生成、上下文保持和任务连续性已高度成熟,数据处理(93.99)、研究分析(92.87)也处于较高水准。唯有代码开发以86.99分的行业均值垫底,头尾分差高达17.59分,远高于其他维度,MiMoClaw以97.22分领跑,StepClaw仅79.63分,一旦涉及可运行代码、工程文件组织或多步调试,不同产品的实际体验仍会拉开明显差距。摘要3:产品的稳定性差异较大,部分产品稳定性更优
三次测评的极差越小,产品在相同任务下的表现越稳定可预测。本期中,WorkBuddy与MaxClaw以1.31分的极差并列最稳,DuMate(1.74)、KimiClaw(2.14)、百度-文心助手(2.38)也保持低波动。
# 基准介绍
一、SuperCLUE-XClaw介绍
SuperCLUE-XClaw是针对各厂商的龙虾产品设计的测评基准,具体介绍如下:
(一)任务设计特点
1. 真实性
测评任务模拟真实办公场景。例如,Excel数据清洗任务要求删除重复记录、处理空值、过滤异常值、统一日期格式,这正是数据分析师日常工作的真实写照。
2. 多文件操作
任务涉及多种文件格式(Excel、PDF、CSV、JSON、Word、Markdown 等),考察智能体对不同文件类型的处理能力。
3. 复合能力考察
部分任务需要多种能力配合。例如,多文件数据合并任务既考察文件读取能力,又考察数据统计和JSON格式输出能力。
4. 细粒度评分标准
每个任务都设有详细的评分标准。以Excel数据清洗为例,包含7个检查点:是否存在重复记录、是否存在空值、是否存在负数记录、日期格式是否统一、单价为0的记录是否删除、销售额列是否写入、计算是否正确。
(二)任务类型
SuperCLUE-XClaw龙虾产品测评共有5大核心测评场景,具体介绍如下:

1. 数据处理
考察智能体对结构化数据的操作能力,包括 Excel 数据清洗、PDF 信息提取、日程事件创建、多文件数据合并、数据透视表生成。这是智能体最基础也是最高频的应用场景。
2. 内容创作
评估智能体的文本生成能力,涵盖商务邮件撰写、博客文章生成、内容风格改写、文档格式规范化。重点考察内容的准确性、专业性和格式规范性。
3. 记忆能力
测试智能体的上下文理解和任务规划能力,包括智能任务调度、每日工作摘要、个性化回复调整。这是区分"工具"与"助手"的关键维度。
4. 代码开发
考察智能体的编程能力,从Python脚本开发、项目创建到文件批量处理、日志分析项目。验证智能体能否真正成为开发者的得力助手。
5. 研究分析
评估智能体的信息检索和分析能力,包括网络信息检索、竞品分析报告、行业报告摘要、技术文档调研。
(三)测评流程及评估方法
SuperCLUE-XClaw龙虾产品测评采用人工获取答案+自动化评估的方式,确保评估结果真实反映各产品的实际能力。
1. 自主设计测评任务
我们根据5大维度(数据处理、内容创作、记忆能力、代码开发、研究分析)的任务场景,自主设计详细的测评题目和明确的输出要求。
每道题目都附带:
完整的任务描述
明确的输入文件
具体的输出格式要求
详细的评分标准
2. 获取产品答案
将同一套题目提交给各参测产品,记录其实际输出作为"产品答案"。
为了避免单次测试的偶然性误差,确保测评结果的稳定性和可信度,我们对每个参测产品的每一项任务都进行了三次独立重复测评,全程严格控制变量:
所有测评环境保持完全一致;
每一次测评都重新向产品提交完整任务指令,全程独立记录产品的执行过程和输出结果,不同轮次测试互不干扰;
三次测评全部完成后,收集该产品对应任务的三组输出结果,统一进入后续评分环节。
3. 评分方法
本次SuperCLUE-XClaw测评采用三层评分架构,包括自动化脚本评估、大模型评估以及两者的混合评估。以下对各层机制进行详细说明:
(1)自动化脚本评估
该机制适用于客观题的评分。当任务结果能够通过明确且无歧义的标准进行验证时,采用预设的Python脚本自动检查模型输出。
评分标准:采用0/1二分制。
- 1分:脚本验证全部通过,所有检查点均符合预期,任务判定为成功。
- 0分:脚本验证失败,任一检查点未通过(如文件缺失、日期错误、格式不符等),任务判定为失败。
(2)大模型评估
该机制适用于主观题的评分。对于涉及内容质量、逻辑深度、创造性等难以量化的任务,引入能力强大的大语言模型(Gemini-3.1-Pro-Preview)作为评审员。裁判模型将依据以下材料进行打分:
- 原始任务指令(如“撰写一篇关于可再生能源未来发展的博客文章,要求论点清晰、论据充分”);
- 待评测模型生成的结果;
- 详细的评分细则(如“论点清晰度(1-5分)”“论据充分性与相关性(1-5分)”“文章结构逻辑性(1-5分)”“见解独特性(1-5分)”等)。
评分标准:采用1-5分制。裁判模型严格按照细则对多个维度分别打分,最终得分为各维度分数的平均值。此机制能够更精细地反映模型在复杂任务上的表现差异。
(3)混合评估
该机制适用于复杂综合题的评分,此类任务通常同时包含可客观验证的步骤和需要主观评判的内容。混合评估综合运用前两种机制,对任务的客观部分和主观部分分别评分,并按预设权重计算最终得分。 工作机制:
第一步:自动化检查客观部分。例如,任务要求“搜索过去一周关于 AI 芯片的5条重要新闻,并整理成简报”,脚本首先自动验证:是否输出5条新闻?每条新闻的发布时间是否均在近一周内?客观部分根据验证结果给予0或1分。
第二步:大模型评审主观部分。无论客观检查是否通过,均进行主观评审。由 AI 裁判评估新闻的重要性、摘要的准确性与清晰度、简报排版与可读性等维度,并给出 1-5 分的评分。 评分标准:最终得分为客观部分得分与主观部分得分的加权组合。权重根据任务性质预设,并在评分规则中明确说明。若客观检查失败(得0分),则即使主观得分较高,最终加权得分也会受到相应影响。此种机制体现了在实际应用中,“做对”与“做好”均对整体表现有贡献,但两者的重要性可能因任务而异。
总结而言,通过上述三种分数设定,构建了一个涵盖硬性指标(非对即错)、软性指标(好坏优劣)以及综合指标(客观与主观相结合)的全方位评价体系。由此得出的成功率、响应速度与成本等指标,能够更真实地反映各个Claw产品在实际工作场景中的执行能力。
4. 最终统分
针对每个产品每个任务的3次独立测评结果,我们采用如下规则计算最终得分,兼顾能力准确性和执行稳定性:
首先对3次测评结果分别按照对应评分机制(自动化脚本评估/大模型评估/混合评估)独立打分,得到3个单次得分;
最终任务得分为3次单次得分的算术平均值(结果保留2位小数);
若某产品在某一任务中3次全部执行失败,该任务最终得分为0分;若仅1-2次执行失败,仍按实际得分取平均,客观反映产品的稳定性表现。
通过三次测试取平均的方式,既能够过滤单次执行的偶发错误、网络波动等非产品能力因素的干扰,也能够真实反映产品的任务执行稳定性,让最终得分更贴近产品在实际使用中的真实表现水平。
# 参评产品
本次SuperCLUE-XClaw龙虾产品测评共有10款主流Claw产品参测,具体测评产品详情如下图所示:

# 测评总榜
一、三次测评平均分榜单

二、第一次测评榜单

三、第二次测评榜单

四、第三次测评榜单
# 测评分析及结论
一、整体竞争格局:高分产品密集,排名差距收窄

本期综合榜呈现“整体高分、差距收窄”的特点:10款产品的三次平均分均超过 91 分,整体平均分为 94.53 分。第一名百度-文心助手(97.62 分)与第十名 StepClaw(91.31 分)相差 6.31 分;头部四款产品均超过 96 分,第一名与第四名仅差 1.61 分,MiMoClaw 与 WorkBuddy 之间更仅差 0.13 分。整体来看,本期产品的综合表现更为集中,头部竞争也更趋紧凑。
二、行业能力结构:通用办公成熟,工程执行仍是差异化核心

内容创作和记忆能力分数高度集中,体现出产品在文稿生成、上下文延续和任务衔接上的通用能力已具备较好可用性。相反,代码开发的最大差距达到 17.59 分,说明“理解任务”到“交付可运行工程”的最后一公里仍然是产品差异化的重要来源。
三. 稳定性分析:低极差代表可预测性,稳定性同样关键

三次重复测试显示,稳定性与综合得分并不完全同步。极差排行中,WorkBuddy 与 MaxClaw 均为 1.31 分,并列最稳定;DuMate(1.74 分)、KimiClaw(2.14 分)和百度-文心助手(2.38 分)随后。相较之下,综合排名第七的 AutoClaw 极差达到 6.93 分,为本期最大;StepClaw(4.31 分)、ArkClaw(3.96 分)和 MiMoClaw(3.61 分)也处于高波动区。综合排名第一的百度-文心助手 极差为 2.38 分,而综合排名第三的 WorkBuddy 则以最低极差体现出更高的一致性。
# 对比示例展示
【任务类型】:数据处理
【题目】:
根据 D2_sales_data.xlsx 文件中的销售数据生成分维度汇总的3个数据透视表并分别保存到 D2_product.xlsx 文件、D2_area.xlsx 文件和 D2_month_product.xlsx 文件。透视表要求如下:
透视表1:按产品汇总
- 行:产品名称
- 值:销售额(求和)、订单数量(计数)
透视表2:按地区汇总
- 行:地区
- 值:销售额(求和)、平均单价(平均值)
透视表3:按月份+产品汇总
- 行:月份
- 列:产品
- 值:销售额(求和)
输入文件 D2_sales_data.xlsx 部分内容为:

{ "product_file_exists": , # 是否生成了D2_product.xlsx文件 "product_name_col_present": , # 按产品汇总表中是否存在"产品名称"这一列 "product_sales_col_present": , # 按产品汇总表中是否存在"销售额"这一列 "product_order_count_col_present": , # 按产品汇总表中是否存在"订单数量"这一列 "product_row_coverage_correct": , # 按产品汇总表的行是否完整覆盖全部5个产品(平板、手机、笔记本电脑、耳机、键盘) "product_values_correct": , # 按产品汇总表中每个产品的销售额(求和)和订单数量(计数)是否全部与标准答案一致(数值容差0.01) "area_file_exists": , # 是否生成了D2_area.xlsx文件 "area_name_col_present": , # 按地区汇总表中是否存在"地区"这一列 "area_sales_col_present": , # 按地区汇总表中是否存在"销售额"这一列 "area_avg_price_col_present": , # 按地区汇总表中是否存在"平均单价"这一列 "area_row_coverage_correct": , # 按地区汇总表的行是否完整覆盖全部5个地区(华东、华北、华南、西北、西南) "area_values_correct": , # 按地区汇总表中每个地区的销售额(求和)和平均单价(平均值)是否全部与标准答案一致(数值容差0.01) "month_product_file_exists": , # 是否生成了D2_month_product.xlsx文件 "month_index_col_present": , # 月份+产品交叉表中是否存在"月份"这一列 "month_rows_coverage_correct": , # 月份+产品交叉表的行是否完整覆盖全部月份(1月至6月,"2024-01"等格式可自动识别归一) "month_product_columns_correct": , # 月份+产品交叉表的列是否完整覆盖全部5个产品 "month_product_values_correct": , # 月份+产品交叉表中所有月份×产品的销售额数值是否全部与标准答案一致(数值容差0.01) "score_percentage": # 最终总分占比。前面这些数值项会汇总后归一化成一个0到1之间的分数}

D2_area.xlsx文件内容:

D2_month_product.xlsx文件内容:

"详细评分": { "product_file_exists": 1.0, "product_name_col_present": 1.0, "product_sales_col_present": 1.0, "product_order_count_col_present": 1.0, "product_row_coverage_correct": 1.0, "product_values_correct": 1.0, "area_file_exists": 1.0, "area_name_col_present": 1.0, "area_sales_col_present": 1.0, "area_avg_price_col_present": 1.0, "area_row_coverage_correct": 1.0, "area_values_correct": 1.0, "month_product_file_exists": 1.0, "month_index_col_present": 1.0, "month_rows_coverage_correct": 1.0, "month_product_columns_correct": 1.0, "month_product_values_correct": 1.0, "score_percentage": 1.0, }

D2_area.xlsx文件内容:

D2_month_product.xlsx文件内容:

"详细评分": { "product_file_exists": 1.0, "product_name_col_present": 1.0, "product_sales_col_present": 1.0, "product_order_count_col_present": 1.0, "product_row_coverage_correct": 1.0, "product_values_correct": 0.0, "area_file_exists": 1.0, "area_name_col_present": 1.0, "area_sales_col_present": 1.0, "area_avg_price_col_present": 1.0, "area_row_coverage_correct": 1.0, "area_values_correct": 0.0, "month_product_file_exists": 1.0, "month_index_col_present": 0.0, "month_rows_coverage_correct": 0.0, "month_product_columns_correct": 0.0, "month_product_values_correct": 0.0, "score_percentage": 0.6470588235294118, }
附各龙虾产品链接:
1.百度-文心助手
https://wenxin.baidu.com/
2.ArkClaw:
https://console.volcengine.com/arkclaw/
3.KimiClaw:
https://www.kimi.com/bot
4.MaxClaw:
https://maxclaw.ai/
5.WorkBuddy:
https://www.codebuddy.cn/work/
6.AutoClaw:
https://autoglm.zhipuai.cn/autoclaw/
7.QwenPaw:
https://qwenpaw.agentscope.io/
8.DuMate:
https://www.dumate.cn/
9.StepClaw:
https://www.stepfun.com/chats/openclaw
10.MimoClaw
https://aistudio.xiaomimimo.com/
# 参测流程
1.邮件申请
2.意向沟通
3.参测确认与协议流程
4.提供API接口或大模型
5.获得测评报告
# 邮件申请
# 联系我们


