Kimi-K3、GLM-5.2中文超长上下文多轮检索测评结果发布!

# 测评背景
为了客观、全面、严谨地衡量中文大模型在长上下文场景中的真实检索与精确回忆能力,我们推出了 SuperCLUE-LongContext 超长上下文多轮检索评测基准方案:中文超长上下文多轮检索测评基准方案发布!SuperCLUE-LongContext。该基准基于 OpenAI 原版 MRCR 的设计理念,深度融合中文语言文化特征与本土写作范式,构建了覆盖 4K-1M tokens 全范围的八档长度分桶体系,通过在同一主题、同一写作格式下嵌入多条"高度混淆"的needle(针)信息,测试模型在多轮对话历史中的精确序号识别与内容回忆能力。
之前,我们基于该方案对国内外9个模型进行了测评,详细测评结果可见:中文超长上下文检索测评结果发布:Qwen3.7-Max夺得国内第一,DeepSeek-V4-Pro紧随其后!
近期Kimi-K3和GLM-5.2发布,均支持1M上下文,为了考察这两个模型的长上下文能力,我们对其进行了测评,以下是详细的测评结果:
# 榜单概览
1. 4K-256K 榜单

2. 4K-1M 榜单

由于不同模型的 tokenizer 的切分策略不同(尤其是对中文、标点、空白的处理),同一段文本在不同模型下的实际输入 token 数可能相差较大,因此会出现部分模型超长的情况。
本数据集的token_count和bucket是基于统一参考tokenizer(tiktoken o200k_base)计算的,目的是保证不同模型之间的跨模型比较公平性,让同一条样本在不同模型评测时落入相同的桶,便于横向对比。
测评结论:
(一)Kimi-K3(max)
1. Kimi-K3(max)较Kimi-K2.6有显著提升。
2. 4K-1M榜单上Kimi-K3(max)位列国内第三,与国内Top2差距较小。
在4K-1M榜单中,Kimi-K3(max)以62.76分位列国内第三,与国内前两名——Qwen3.7-Max和DeepSeek-V4-Pro(max)——相比,总体存在2~3分的差距。
从区间分布来看,差距主要集中在4K-32K区间:该区间的3个分桶中,Kimi-K3(max)均落后于国内Top2,平均分仅为71.65分,而国内Top2均在85分左右,落后幅度超过13分,差距较为明显。
但在32K-1M区间,Kimi-K3(max)实现了反超:该区间的5个分桶中,Kimi-K3(max)的平均分为57.42分,国内Top2分别为54.30分和52.42分,Kimi-K3(max)分别领先约3分和5分。这表明随着上下文长度增加,Kimi-K3(max)的信息检索能力衰减更慢,长上下文场景下的表现更加稳定。
(二)GLM-5.2(max)
1. GLM-5.2(max)较GLM-5.1稳步提升。
在4K-256K榜单上,GLM-5.2(max)取得53.71分,较GLM-5.1的51.53分提升超过2分,整体表现稳步向好。
2. 4K-1M榜单上GLM-5.2(max)位列国内第4,但与国内Top3差距明显。
在4K-1M榜单中,GLM-5.2(max)以47.71分位列国内第4,领先Mimo-V2.5-Pro近7.5分;但与国内前3名——Qwen3.7-Max、DeepSeek-V4-Pro(max)和Kimi-K3(max)——相比,总体上仍有15分以上的差距。从区间分布来看,差距主要集中在4K-512K区间:在该区间的7个分桶中,GLM-5.2(max)全面落后,各分桶分差基本在10分以上,其中8K-16K分桶的分差最大,超过43分。
# 榜单详情


# 基准介绍
(一)评测基准场景划分
我们将 SuperCLUE-LongContext 评测基准划分为四大核心能力维度与八档长度分桶 × 三级 needle 难度的交叉评测网格。
1. 检索定位能力
考察大模型在超长对话上下文中,从大量干扰信息中定位到与目标主题、目标格式匹配的 needle 信息的能力。该能力是长上下文理解的基础,直接对应传统 NIAH 测试的核心诉求,但 SuperCLUE-LongContext 将干扰强度提升到了"同分布高混淆"级别。
短上下文检索(4K-32K):在有限轮次内快速定位目标信息
长上下文检索(64K-128K):在数百轮对话中保持信息敏感度,抵抗遗忘
极长上下文检索(256K-1M):在千轮级对话中精准定位,考察模型的"大海捞针"极限
2. 序号识别与区分能力
考察大模型在多个高度相似的 needle(同主题不同格式、同格式相近主题)中,按出现顺序准确计数并识别指定序号的能力。这是 SuperCLUE-LongContext 区别于 NIAH 的核心维度,也是模型最容易出错的环节。
基础区分(2-needle):仅需区分 2 个相似内容,考察基础序号识别
进阶区分(4-needle):需在 4 个相似内容中准确计数,混淆风险显著上升
极限区分(8-needle):在 8 个高度混淆的 needle 中精准识别,是对模型工作记忆与序号追踪能力的极限挑战
3. 精确回忆与内容完整性能力
考察大模型在识别到正确 needle 后,能够完整回忆其全部内容(而非仅提取片段或大致意思)的能力。该维度对医疗、法律、金融等需要"精确复述原文"的场景尤为关键。
内容完整性:输出是否包含 needle 全文,无遗漏段落
字符级精确度:标点、换行、专有名词是否与原文一致
抗截断能力:在长文本中回忆时是否保持内容的连续性与完整性
4. 指令遵循与格式合规能力
考察大模型对复杂指令的严格遵循能力,包括前缀插入位置、输出格式约束、无多余文本等要求。该维度直接反映模型在受控场景下的可靠性。
前缀位置正确性:前缀必须位于输出最开头
无冗余文本:不得添加"好的,我将..."等解释性语句
格式一致性:输出内容仅包含 前缀 + 目标内容,无其他修饰
(二)数据制作
参考 SuperCLUE 细粒度评估方式,构建专用测评集。SuperCLUE-LongContext 数据集的构建流程如下:
1. 中文主题与写作格式体系梳理
基于 70 个中文主题实体(涵盖大熊猫、敦煌、量子计算、四合院等)与 10 种本土写作格式,构建 (主题, 格式) 组合空间。每个组合预生成 1-4 条高质量长文本语料,形成可复用的语料库。

2. 两阶段数据构建
- 语料库预生成:调用模型批量生成不同 主题/格式 组合下的中文写作内容,平均长度 3000-5000 字,确保内容地道、结构完整。
- 样本拼接与分桶:从语料库中采样 needle(同 主题/格式 组合,确保序号可区分)与干扰项(同主题不同格式、同格式相近主题或其他),通过随机打乱对话顺序、插入 10 位随机前缀、生成最终指令,组装为完整评测样本。本次测评集共设计7802个干扰项,其中同主题不同格式的干扰项有3817个,占比48.9%,同格式相近主题的干扰项有3805个,占比48.8%,其他类型的干扰项有180个。
下图是各桶平均每题中包含的干扰项数量分布:

最终基于 tokenizer 精确计数并完成八档分桶筛选,以下是各桶的token长度范围及平均token长度:

3. 多 needle 配置与难度分级
- 基础级(2-needle):同一主题/格式下嵌入 2 条 needle,测试基础检索与序号区分能力
- 进阶级(4-needle):嵌入 4 条 needle,考察多选项干扰下的序号识别能力
- 专家级(8-needle):嵌入 8 条高度混淆 needle,是长上下文检索与序号追踪的极限挑战
本次测评集的needle所处不同位置的题目数量分布如下:

(三)评分方法
SuperCLUE-LongContext 采用三层评分机制,确保评估的严谨性与可比性:
1. 前缀校验—— 一票否决
首先校验模型输出是否满足以下格式要求:
包含前缀:输出必须以指令要求的随机前缀开头,前缀缺失判0分;
位置正确:前缀位于输出最开头,前面无其他字符;
无多余文本:前缀之后只能跟目标内容,不能包含解释性文字;
前缀校验不通过 → 直接判 0 分。
2. needle身份校验
由于干扰项和答案的相似度极高,所以即使模型的答案没有命中needle所在的位置,回答了干扰项,在进行相似度比对的时候也会取得部分分数,甚至由于干扰项极为相似,会取得较高的分数。
因此,我们在进行相似度比对之前加入了needle身份校验的环节,我们会将所有assistant消息和模型答案(去掉前缀)分别计算相似度,然后将相似度最高的那条消息的索引和预先设定的正确答案的索引进行比对,如果二者不一致则判0分,二者一致则计算相似度得分。
3. 内容相似度评分
对通过前缀校验和needle身份校验的模型答案,提取前缀之后的有效内容,与标准答案进行difflib.SequenceMatcher相似度计算,输出 0-1 分的精确匹配度,该指标对字符级差异敏感,能有效识别内容缺失、篡改与幻觉。

测评流程
1.邮件申请
2.意向沟通
3.参测确认与协议流程
4.提供API接口或大模型
5.获得测评报告

