办公智能体测评基准方案发布 | SuperCLUE-Office

# 测评背景
随着大模型技术的快速发展,办公智能体正加速落地日常办公场景,在文档处理、数据分析等环节展现出应用潜力。与此同时,企业对办公效率与生产力的追求持续提升,员工借助智能工具高效完成重复性、专业性办公任务的需求日益迫切,市场对更强大、更可靠的办公智能体产品寄予更高期待。
在此背景下,为客观评估端到端办公智能体的综合能力,重点考察Word、PPT、Excel、图表、网页等办公交付物的完成度,为用户提供权威客观的产品参考,SuperCLUE正式发布《SuperCLUE-Office 办公智能体测评基准方案》。
# 基准特点
SuperCLUE-Office办公智能体测评基准是面向办公智能体综合能力的测评体系。围绕文档处理、内容创作、数据分析、代码开发、深度研究、多轮协作六大维度,对标真实场景,以主流办公智能体产品为实测对象,为办公智能体的产品选型与能力迭代提供权威参照。基准具备以下亮点:1. 全面覆盖,聚焦真实办公场景
围绕文档处理、内容创作、数据分析、代码开发、深度研究、多轮协作六大核心维度设计测评任务,任务设定对标真实职场场景,覆盖项目提案、周报月报、会议纪要、营销方案、财务分析等高频办公需求,全方位衡量办公智能体的综合能力。
2. 产品实测,横向对标主流办公智能体
以真实产品为测评对象,将主流办公智能体置于同一任务集、同一评分体系下同场竞技,直观呈现不同产品在文档、数据、代码等真实场景中的表现差距,为产品选型与能力迭代提供直接参照。
3. 多轮协作,还原真实工作方式
设置项目全流程制作、个性化报告生成、实时项目跟进等多轮协作任务,考核办公智能体在持续对话中的理解记忆、迭代优化与跨任务协作能力,还原真实办公中从初稿到终稿的长流程工作方式。
4. 科学评分,客观可复现
结合脚本自动评价与裁判模型评价双重校验,采用 Rubrics 细则逐条判定;同一任务设置三轮独立评分交叉验证,综合考察办公智能体表现的一致性与稳定性。结果客观量化、过程可复现,为行业提供可信的参照依据。
# 基准介绍
SuperCLUE-Office办公智能体测评基准共设计了6大维度21个二级任务,具体如下:

注:具体测评体系以正式发布的测评报告为准。
测评能力
文件与环境操作:正确读取输入、编辑并保存目标格式;文件可打开和继续编辑。
多步/多文件规划与执行:跨文件取数、关联、计算、生成并核对结果。
约束遵循:满足模板、字段、公式、页数、格式和禁止项。
内容质量与专业性:内容准确、信息忠实、表达专业,符合目标受众与场景的呈现要求。
多轮状态管理:保留历史确认、应用新变更、处理冲突并维护版本。
安全与权限边界:只在授权范围操作;按要求去标识。
维度 x 能力 矩阵
每道测评题目涉及一个维度,可关联多项能力。六大维度与六项能力的覆盖关系如下:

# 测评内容介绍
一. 六大维度介绍
1. 文档处理
项目提案:根据需求文档和参考资料,撰写完整项目提案,含背景分析、方案设计、预算估算和时间计划。
项目进度汇报:根据项目数据和会议记录,生成周度进度汇报,含完成情况、风险问题和资源需求。
周报 / 月报撰写:根据工作内容和数据,撰写周度 / 月度工作总结,含完成事项、数据成果和下步计划。
会议纪要整理:根据会议转录和相关文档,生成结构化纪要,提取决议事项、行动项和责任人。
合同条款修订:根据审核意见和业务需求,修订合同条款,标注修改内容并说明修订理由。
工程文档整合:根据多份工程文档,整合生成统一的技术文档,确保内容一致、版本统一。
2. 内容创作
技术文档编写:根据功能说明,编写 API 文档、用户手册或帮助中心文章,含使用示例和参数说明。
培训材料制作:根据知识内容,制作内部培训文档或操作手册,含章节结构、图文步骤和考核要点。
营销方案撰写:根据产品信息和目标受众,撰写产品介绍或推广方案,含卖点提炼和行动号召。
公众号内容运营:根据历史公众号风格、主题和素材,撰写公众号文章或社交媒体帖子,含标题优化和正文结构。
3. 数据分析
财务报表分析:根据历史财务报表数据,生成财务分析报告,含比率分析、趋势对比和风险提示。
销售业绩复盘:根据历史销售数据和目标,分析业绩完成情况,含达成率、同比环比和 TOP 客户分析。
产品数据可视化:根据产品业务数据,生成可视化看板,含核心指标卡、趋势图和明细数据等。
4. 代码开发
办公自动化:把重复的办公工作自动化,如批量数据清洗、自动报表生成、查询工具等。
产品 Demo 展示:快速搭建可交互的产品原型或演示页面,用于向客户或内部展示产品功能。
5. 深度研究
行业调研:根据行业关键词,收集整理行业信息,含市场规模、竞争格局和政策环境。
竞品调研:根据竞品名单,对比分析竞品情况,含功能对比、定价对比和优劣势分析。
用户洞察:根据用户反馈和评论数据,分析用户需求,含高频问题、满意度分析和需求优先级。
6. 多轮协作
项目全流程制作:基于多轮对话和文档,持续推进一个项目的完整流程,从初稿到终稿不断迭代完善。
个性化报告生成:记住历史轮次中用户的风格和偏好,生成符合用户习惯的个性化报告输出。
实时项目跟进:根据项目进展的新信息,实时更新和调整历史轮次中的工作成果。
二. 评分细则

三. 评分方法
针对端到端的办公智能体测评,模型回复中包含Word、PPT、Excel、图表、网页等办公交付物,本基准采用“脚本格式审查 + 裁判模型内容评分”的评价机制,具体介绍如下:
脚本评价:针对Word、PPT、Excel、图表、网页等交付物,通过脚本自动审查其格式规范,包括文档结构完整性、排版样式、表格数据格式、图表元素等,确保交付物格式统一、符合标准要求。
裁判模型评价:针对交付物的内容质量,系统性地设计并审定各类题目及其评分细则(Rubrics),由裁判模型依据Rubrics细则对输出的准确性、完整性、逻辑性、专业性等维度逐项评分,确保主观评价的公正性与稳定性。
测评流程
1.邮件申请
2.意向沟通
3.参测确认与协议流程
4.提供API接口或大模型
5.获得测评报告

