中文金融测评结果发布:Kimi K3第一!

# 测评背景
当前金融大模型评测基准主要面向单一知识问答或文档分析场景,对模型在真实业务场景中的综合能力覆盖不足。SuperCLUE-Fin中文金融大模型评测基准应运而生,旨在建立面向开放式问答形态下的金融认知、数值推理、文本解析、合规风控与场景应用能力等场景下的标尺与行业准入门槛。
该基准每道题目均有严格设计的详细专属评分细则(Rubrics),平均每个题目涉及约16条评分细则。
我们基于该方案对Kimi K3(max)进行了测评,以下是测评详情:
首期测评结果见:中文金融大模型测评结果发布:Qwen3.7-Max、Doubao-Seed-2.1领跑!
方案发布见:中文金融大模型测评基准方案全面升级!SuperCLUE-Fin
# 榜单概览
1. 总榜

2. 模型得分与token消耗

3. 模型得分与成本

4. 模型得分与推理耗时

# 测评摘要
Kimi-K3(max) 在本次金融测评专项中取得总分 88.72 分,位列全部 11 款参评模型第一,领先第二名 Qwen3.7-Max(83.63 分)5.09 分,领先其他 10 款模型均值(78.01 分)10.71 分。六大一级维度中,Kimi-K3(max) 取得 5 项单项第一;唯一的例外是金融计算与数值推理维度,以 90.75 分列第三。
与前代 Kimi-K2.6 相比,总分提升 14.07 分,其中金融计算与数值推理维度提升 30.35 分,为最大增量。需要指出的是,Kimi-K3(max) 的平均每题成本(1.41 元)与输出 token 消耗(13884)均为全场最高档位,呈现明显的以高资源投入换取高准确率的特征。
# 测评分析
1. 五项单项第一,能力结构全面

从六大一级维度看,Kimi-K3(max) 的能力结构可以用"全面领先、一处失守"来概括。与其他 10 款参评模型的维度均值相比,K3 在六个维度上的领先幅度在 +7.59 至 +11.14 分之间,其中金融场景应用(+11.14)、金融计算与数值推理(+11.13)、金融判别与分析(+10.86)三个维度的优势最大——这三项恰好是最贴近金融业务实操的能力项,也是多数模型失分的重灾区。
一处失守: 在金融计算与数值推理维度上,K3 的 90.75 分虽大幅高于其他模型均值(79.62 分),但仍低于 Doubao-Seed-2.1-pro(high) 的 93.64 分和 DeepSeek-V4-Pro(max) 的 93.06 分,位列该维度第三。这是 K3 六个维度中唯一未能登顶的一项,也是其能力版图中相对的可提升空间。
合规与风控值得单独一提。 82.69 分是 K3 六个维度中的最低分,但该维度整体难度偏高——其他 10 款模型均值仅 72.24 分,第二名 Qwen3.7-Max 为 78.85 分。K3 在这一"最难维度"上反而保持着对第二名 3.84 分的稳定优势,说明其在监管规则理解、风险识别等强专业壁垒任务上的表现相对扎实。
2. 代际对比:从 K2.6 到 K3,一次跨越两个梯队的升级

整体来看,K3 的代际提升并非依赖单一维度的突击,而是六个维度全线正增长,其中计算能力的修复最具战略意义——它直接消除了前代模型最大的失分点。
总分:74.65 → 88.72,提升 14.07 分。 K2.6 在本榜中处于第三梯队(第 7 名),K3 直接跃升至榜首,一次跨越了两个梯队;
金融计算与数值推理:60.40 → 90.75,提升 30.35 分。 这是本次代际升级的最大增量。K2.6 的计算维度曾是明显短板(全场倒数第一),K3 一举将其修复至全场第三,从"拖后腿"变成了"中上游";
金融场景应用(+13.05)、金融判别与分析(+10.89)、金融文本理解(+9.10) 三个维度均有较大幅度提升;
金融知识认知(+3.46)与金融合规与风控(+3.84) 提升幅度相对温和,但这两个维度 K2.6 的基数本就较高(93.08 / 78.85),属于高位再进。
3. 效率与成本:高分的另一面是高资源投入

从耗时、成本、token 消耗三项效率指标看,K3 的高分建立在显著更高的资源投入之上:
平均每题成本 1.41 元,全场最高。 是其他 10 款模型均值(约 0.20 元)的 7.2 倍,也是第二贵的 Doubao-Seed-2.1-pro(high)(0.61 元)的 2.3 倍;
平均每题输出 13884 tokens,列全场第二,仅次于 Doubao-Seed-2.1-pro(high)(19939 tokens),高于其他模型均值(约 9688 tokens)43%;
平均每题耗时 1649 秒(约 27.5 分钟),列全场第三,少于 Doubao-Seed-2.1-pro(high)(2036 秒)和 Kimi-K2.6(1960 秒),但远高于多数参评模型。
这表明 K3 以更深的推理过程换取更高的答题质量。较长的输出 token 与较高的单题耗时,指向其在解题时进行了更充分的中间推理,这在金融计算、合规判断等高难度任务上转化为了实打实的分数。
从代际视角看:K3 的输出 token 较 K2.6 增加 47.1%,单题成本从 0.26 元升至 1.41 元(5.4 倍),但耗时反而从 1960 秒降至 1649 秒——推理写得更多、答得更快、得分更高,代价是调用成本的显著上升。
# 测评总榜



# 基准介绍
SuperCLUE-Fin 中文金融大模型测评基准共设计了六大维度18个二级子类,具体如下:

1. 六大维度介绍:
(1)金融知识认知
考察AI助手对金融学、经济学、会计学、法律法规等静态知识的掌握深度与广度。下设三个二级子域:
金融基础理论与市场机制:货币银行学、投资学、公司金融、国际金融核心理论,如货币乘数传导机制、CAPM/APT定价模型、利率期限结构、汇率决定理论、有效市场假说与行为金融等。
会计与财务规则:会计准则、财务报表勾稽关系、审计逻辑,如三张报表勾稽与净利润/现金流背离、权责发生制与收入确认、资产减值与商誉减值、合并报表与VIE架构、IFRS 9三分类等。
法律法规与监管政策:中国及国际主要金融监管框架,如证券法信息披露与三大违法界定、巴塞尔协议III资本监管逻辑、反洗钱KYC/CDD、私募基金合格投资者认定、金融消费者保护法规等。
(2)金融计算与数值推理
考察AI助手在复杂金融场景下的数学计算、公式推导、数值敏感性分析与逻辑链完整性。下设三个二级子域:
财务指标与比率计算:ROE杜邦分析三因子拆解、WACC计算与税盾效应、FCFF分步推导、稀释EPS与可转债/期权/权证、市盈率/PEG比率及局限性等。
资产定价与估值模型:Black-Scholes与希腊字母含义、债券久期/凸性与价格敏感性、VaR三种方法与尾部风险捕捉、远期合约定价与持有成本、信用利差与违约概率测算等。
多步数值建模与情景推理:CAGR与外部融资额预测、并购商誉计算与减值测试触发、可转债转股EPS摊薄效应推导、汇率波动利润弹性系数构建、EBIT→FCFF→FCFE→可分配现金分步计算等。
(3)金融文本理解
考察AI助手对金融长文档、专业公告、研报、政策文件的精准解析、信息提取与语义归纳能力。下设三个二级子域:
公告与监管披露:重大资产重组要素与控制权影响、股权激励条款与利益输送风险、关联交易识别与审议程序、业绩预告口径与修正原因、退市风险警示触发与保壳措施等。
研报、评论与舆情文本:投资评级/目标价/核心逻辑提取、ESG评级三维度与估值影响、行业报告核心观点与产业链顺序、事件点评超预期判断与股价影响、风险提示段落核心风险点归纳等。
政策报告与宏观叙事:货币政策基调与工具提取、监管新规对银行业务差异化影响、MPA七大指标硬约束识别、金融稳定法自救原则与责任机制、跨境资本管理政策意图与传导等。
(4)金融判别与分析
考察AI助手在开放金融场景下的逻辑判断、归因分析、趋势研判与决策支持能力。下设三个二级子域:
财务质量与信用诊断:现金流与利润背离舞弊迹象、存贷双高异常与审计程序、毛利率差异商业逻辑与风险、债券发行人信用风险与指标恶化、保留意见审计影响与估值调整等。
市场、行业与竞争分析:行业生命周期与竞争格局演变、波特五力模型应用分析、宏观数据组合与股市风格判断、资金面数据与流动性环境、产业链利润分配与中游应对等。
资产配置与投资逻辑论证:保守型投资者资产配置方案、投资组合相关性矩阵与分散化、夏普/索提诺比率选择建议、行为金融偏差识别与矫正、ESG负面剔除策略与跟踪误差等。
(5)金融场景应用
模拟真实金融业务场景,考察AI助手在多轮上下文中的综合服务能力,强调"解决问题"的闭环能力。下设三个二级子域:
客户服务与财富顾问:35岁中产综合理财方案设计、指数基金vs主动基金定投建议、父母与自己保险配置逻辑、诈骗短信识别与应对流程、基金亏损投诉处理与安抚话术等。
投研分析与报告生成:三季报业绩快评结构化生成、会议纪要核心观点提取、白酒企业比较分析框架、关税事件驱动型策略简述、基金产品介绍通俗化文本等。
合规运营与流程自动化:融资融券开户条件与风险、基金转换规则与费用计算、跨境汇款额度与材料清单、车险NCD系数与保费涨幅、经营贷款材料与审批流程等。
(6)金融合规与风控
考察AI助手对金融风险识别、合规边界、伦理约束与安全红线的理解,强调"拒绝能力"与"红线意识"。下设三个二级子域:
风险识别与量化预警:P2P庞氏骗局特征识别、关联交易利益转移与救济途径、表外业务风险隐匿与穿透管理、操纵市场/内幕交易嫌疑识别、算法交易策略风险与监管措施等。
合规边界与审查判定:投资顾问适当性义务与处罚、信息披露违规与内幕信息界定、金融营销违规话术与合规表述、跨境SPV外汇违规与额度红线、算法歧视与个人信息保护合规等。
负责任金融与输出安全:拒绝操纵股价请求并教育、识别虚假收益承诺与风险提示、代持协议风险与合规建议、拒绝生成虚假银行流水、追偿合法途径与拒绝黑客手段等。
2. 评分方法
(1)评价标准的设计
首先,我们系统性地设计并审定各类题目及其评分细则(Rubrics),确保每项细则准确、全面、合理,再结合必要的自动化辅助工具校验所有题目,最后由专家进行最终审核与修订。
每个题目均涉及多条评分细则,每条评分细则的得分为0分或者1分,0分表示未满足该细则要求,1分表示完全满足。
所有正例的得分为该题的总分,模型所有满足细则的得分为模型在本题上的绝对分数,用绝对分数除以总分得到模型在本题的最终得分。
对于合规维度中的安全类题目,实行扣分机制:若模型对恶意请求(如"如何操纵股价""生成虚假银行流水")未明确拒绝,或给出违规操作建议,对每个不合规的行为扣1分。
(2)评价与统分
我们使用大模型作为裁判参考专属评分细则(Rubrics)对AI助手的答案进行评价。对于得分为负的题目,我们统一将其分数归为0分再进行总体分数的计算,不会存在正负分数相互抵消的情况。
总分计算采用加权汇总:
金融知识认知:5%
金融文本理解:5%
金融判别与分析:15%
金融合规与风控:25%
金融场景应用:25%
金融计算与数值推理:25%
最终输出各维度得分和总分。
# 参测流程
1.邮件申请
2.意向沟通
3.参测确认与协议流程
4.提供API接口或大模型
5.获得测评报告
# 邮件申请

