手机端侧大模型测评结果发布!国内端侧模型大放异彩!

随着端侧大模型技术迭代,各类轻量化模型不断涌现,手机本地化智能交互需求增长,图文、视频类跨模态智能功能走进大众日常使用场景。受制于移动端算力、功耗与实时性约束,端侧模型的综合能力成为衡量落地价值的关键指标。
基于手机终端在中文真实使用场景下,SuperCLUE-OnDevice全面更新测评维度,测评端侧大模型在文本、图像、视频理解三大核心维度上的真实能力水平。
本次测评共测试了10个国内外大模型,包括4个云端模型,6个端侧模型。评测聚焦于端侧模型,云端模型在榜单中仅供参考,不参与排名。
「过往文章介绍」
1.【2025年9月 端侧大模型榜单参考文章】手机端侧大模型测评结果发布!(SuperCLUE-OnDevice)
排行榜地址:www.SuperCLUE.ai
# 榜单概览
1.总榜

2.三大子维度热力图



4.文本/多模态能力象限图

SuperCLUE-OnDevice测评摘要
BlueLM-3.5-Nano-3B以89.86分领跑本次手机端侧测评榜单,领先端侧第二名2.04分,已超过云端模型GLM-5V-Turbo(87.75分)。Qwen3.5-9B和Qwen3.5-4B分别以87.82分、85.16分位列端侧模型榜单第二和第三。
摘要2:端侧模型能力各有侧重,多维度性能表现分化显著。
端侧模型BlueLM-3.5-Nano-3B文本理解(92.85分)、图像理解(91.34分)均位列端侧第一;Qwen3.5-9B位列视频理解(79.17分)端侧第一,GLM-4.6V-Flash(9B)(78.95分)、BlueLM-3.5-Nano-3B(78.69分)紧随其后,差距不足1分。
摘要3:云端和端侧模型仍有差距,头部端侧模型已反超云端模型。
云端模型平均分(91.66分)与端侧模型平均分(80.61分)相差11.05分,差距显著。但头部端侧模型已实现反超,BlueLM-3.5-Nano-3B在图像、视频理解两大维度均超过云端模型GLM-5V-Turbo;与云端TOP1 Gemini-3.6-Flash相比,总分差距也仅3.78分,并在事件抽取、NER等子维度上实现反超,印证了轻量端侧大模型的技术突破。
# SuperCLUE-OnDevice测评体系
本次SuperCLUE-OnDevice手机端侧大模型测评基准包含三大任务:文本理解、图像理解、视频理解。

基准更新特点
本次测评基准深度聚焦手机端侧落地场景、细化视听跨模态能力,在原有测评体系的基础上,更贴合移动端轻量化、本地化、高频生活化的模型能力测评需求,核心升级优势如下:
1.场景更聚焦,贴合端侧核心诉求:聚焦手机用户日常高频的文本、图像、视频三大核心场景,测评范围更精准,完全适配手机端侧大模型本地化交互的应用特性。
2. 模态能力精细化,测评维度更专业:将单一的图像多模态能力拆解为视觉QA、OCR、信息提取、视觉定位、表格提取五大细分维度,新增视频QA、视频时序定位动态视频测评能力,补齐移动端动态视听场景测评短板。
3. 测评轻量化高效化,适配端侧模型特性:聚焦端侧模型最核心、最刚需的基础与推理能力,测评体系更简洁、针对性更强,能够高效甄别轻量化端侧模型的真实性能,适配手机算力受限、低延迟运行的底层特性。
维度介绍
1. 文本理解
文本理解是最基础、最核心的底层能力,是智能交互功能落地的核心支撑,涵盖事件抽取、文档总结、会话总结、NER、问答等广泛的文本处理任务。
重点考核模型在无云端赋能、算力受限、输入文本碎片化、口语化、场景生活化等场景下的稳定表现,精准衡量模型对手机日常文本内容的理解精度与处理效率。
2. 图像理解
评估模型在处理和理解跨图像信息方面的能力,具体涵盖以下5个子维度:
视觉QA:针对各类实拍图像开展问答测评,检验模型图像场景识别、内容理解与问题解答的视觉交互能力。
OCR:测评模型在模糊、倾斜、小字体等复杂图像场景下的本地化精准文字提取与还原能力。
信息提取:测评模型从非结构化图像中萃取人物、场景、事件等关键信息并规整输出的能力。
视觉定位:测评模型精准锁定图像中目标物体、文字、功能区域位置的精细化视觉定位能力。
表格提取:测评模型对表格图像进行结构识别与单元格数据本地化提取转换的能力。
3. 视频理解
评估模型对实拍视频的动态时序内容理解、解析与推理能力,具体涵盖两大子维度:
视频QA:测评模型全局理解视频内容、捕捉细节、解读事件逻辑并解答相关问题的视频交互能力。
视频时序定位:测评模型精准识别视频中特定事件、动作对应的起止时间,快速定位关键视频片段。
# 测评说明
参考SuperCLUE细粒度评估方式,构建专用测评集,每个维度进行细粒度的评估并可以提供详细的反馈信息。
(一)测评集构建
手机端侧大模型测评专项基准中文题库的构建流程如下:
1.根据任务类型,搜集、整理并制作相关图片;
2.中文prompt撰写;
3.开展样例测试,收集反馈数据;
4.基于测试结果优化完善中文prompt;
5.系统化构建各维度专属评测集,形成完整测评题库。
(二)评分方法
本次SuperCLUE-OnDevice测评根据不同任务设置了特定评分方式,具体如下:
1. 文本理解
(1)事件抽取:对比参考答案中每个关键字段,计算模型提取正确的字段/参考答案中的所有字段,转化为百分制。
(2)文档总结:幻觉率、指令遵从性、覆盖度、连贯性、简洁性 5 个维度;单题综合分 = 0.35×(1-幻觉率) + 0.20×指令遵从性 + 0.30×覆盖度 + 0.10×连贯性 + 0.05×简洁性。
(3)会话总结:概要性、幻觉率、逻辑性、全局性得分、结构化得分,以及压缩比、冗余点;综合分 = 0.40x概要性 + 0.40×(1-幻觉率) + 0.05×逻辑性 + 0.10×全局性得分 + 0.03×结构化得分 + 0.01×(1-压缩比) + 0.01×(1-冗余点)。
(4)NER:对比参考答案,按实体(人名、时间、地址、金额、电话号、证件号)回答正确与否,分别统计精确率、召回率和 F1;采用各实体F1的算术平均作为最终成绩。
(5)问答:对比参考答案,采用整体问答准确率作为最终成绩。
2. 图像理解
(1)视觉QA:单选问答题,与参考答案比对,正确得 1 分,否则 0 分。
(2)OCR:与参考答案比对,计算"1-归一化的最小编辑距离"作为每一题目的得分。
(3)信息提取:对比参考答案中每个关键字段,计算模型提取正确的字段/参考答案中的所有字段,转化为百分制。
(4)视觉定位:与参考答案比对,计算 Accuracy@0.5(IoU>0.5 的样本比例)作为得分。(IoU 指模型预测的物体所在区域与参考答案的"交集面积"与"并集面积"的比值)
(5)表格提取:与参考答案比对,计算TEDS (Tree-Edit-Distance-based Similarity,基于树编辑距离的相似度)作为每个题目的得分。
3. 视频理解
(1)视频QA:单选问答题,与参考答案比对,正确得 1 分,否则 0 分。
(2)视频时序定位:抽取模型回答的起止时间区间,再由规则脚本计算预测区间与标准答案的时间 IoU,作为每一题目的得分。
# 参评模型
本次测评涵盖了10个国内外主流模型,包括4个云端模型,6个端侧模型。

# 测评结果
# 总榜

# 文本理解榜单

# 图像理解榜单

# 视频理解榜单

# 测评分析及结论
1. BlueLM-3.5-Nano-3B领跑主流端侧模型,性能超越部分云端模型。
BlueLM-3.5-Nano-3B在本次测评中以89.86分领跑端侧模型,领先第二名Qwen3.5-9B(87.82分)超2分,领先第三名Qwen3.5-4B(85.16分)超4分,优势明确。同时,BlueLM-3.5-Nano-3B已超过云端模型GLM-5V-Turbo(87.75分)。印证轻量化端侧大模型的技术突破,端侧推理能力迈上全新台阶。

端侧模型中,不同维度分数差异明显。BlueLM-3.5-Nano-3B以文本理解92.85分、图像理解91.34分均位列端侧第一,分别领先第二名Qwen3.5-9B超2分;Qwen3.5-9B则在视频理解(79.17分)中位列端侧第一。

端侧“Top1模型”BlueLM-3.5-Nano-3B与云端模型对比中,已接近甚至部分超越云端水平:文本理解差距约0.17 分,基本达到云端梯队;图像理解91.34分、视频理解78.69分双双超过云端模型GLM-5V-Turbo(90.65分、67.22分),其中视频理解领先幅度达11.47分。

3. 模型在不同子维度上的表现差异显著。
从模型间差异看,各子维度上模型表现的分化程度悬殊:
视频时序定位作为分化最严重、最具挑战的子维度,Doubao-Seed-2.1-pro(77.08分)与最低的Gemma-4-E4B-it(17.00 分)相差超过60 分,模型得分平均分布在 46.67~97.33、;
图像细粒度定位与结构化提取类任务上,如表格提取(平均81.88分,平均分布56.73~97.35)、OCR(平均85.73分,平均分布64.48~97.00)同样差距明显,模型能力参差不齐。
而基础文本子维度上,如文档总结(平均89.57分,平均分布85.56~94.64)、事件抽取(平均93.88分,平均分布85.06~98.95)、NER(平均81.47分,平均分布75.07~89.94)等,各模型得分集中、表现趋同。




(1)整体差距仍然明显:4款云端模型总榜平均分为91.66分,6款端侧模型平均分为80.61分,云端领先11.05分。

(2)端侧内部分化较大:端侧模型总分从BlueLM-3.5-Nano-3B的89.86分到Gemma-4-E2B-it的66.45分,跨度达23.41分,头部端侧模型具备接近云端的实力,而尾部模型仍有较大提升空间。
# 测评示例展示
# 示例1 :文本理解—NER
你是一位专业的命名实体识别(NER)专家,请根据下面提供的【参考内容】,准确、全面地抽取以下实体信息,并输出标准的 JSON 格式结果。请严格按照说明提取实体,不遗漏任何符合条件的内容,不输出多余说明。 ### 实体类型及说明: 1. 地址:可用于地理定位的地点名称,包括国家、省市区、街道、楼宇、场所等,请确保识别全面。 2. 人名:自然人或虚构人物的专属名称,包含真实姓名、昵称、网名、称谓等。 3. 时间:表示具体或相对时间的信息,包括日期、节日、时间段、历史年代等。 4. 金额:涉及货币的各类价值计量表述,包括具体数值、浮动范围及相关比例等。 5. 证件号:个人专属的证件编号,包含身份证号、银行卡号、车牌号和护照号。 6. 电话号:可用于联系他人的通讯号码,包含手机号码和固定电话号码。 ### 输出要求: (1)请仅输出符合规范的 JSON 格式实体信息,不添加任何额外说明或注释。格式如下: { "地址": [实体1, 实体2], "人名": [实体1], "时间": [实体1], "金额": [实体1], "证件号": [实体1], "电话号": [实体1, 实体2] } 要求识别到的实体必须在原文中; (2)日期时间类格式应为文本中所展示的形式; (3)如果对应字段信息无法提取或未提供,则为空; 【参考内容】:水稻病虫害巡田记录 2026年7月26日早上查看了湖南省常德市鼎城区谢家铺镇东湖村南侧的两块水稻田。1号田叶色正常,只有零星稻纵卷叶螟;2号田靠沟渠一侧出现明显纹枯病斑,约占田块面积的8%。农技员何师傅判断近期高温高湿是主要原因,建议先降低田间水位,再进行一次针对性施药。 药剂使用井冈霉素和氯虫苯甲酰胺,计划傍晚时喷施。采购清单为井冈霉素20袋、氯虫苯甲酰胺12瓶,合计1,860元;无人机作业费每亩18元。药剂批次JG-2607、飞机编号UAV-06和田块编号FIELD-1、FIELD-2均写进农事台账。何师傅将在三天后复查,若病斑继续扩大,再调整配方。联系电话0736-75681234。 田埂北侧积水较深,喷药人员需要穿长靴并避开蜂箱区域。无人机作业前先通知附近养殖户,施药记录要写清风向、温度和实际用量。
【参考答案】:
{ "地址": [ "湖南省常德市鼎城区谢家铺镇东湖村南侧" ], "人名": [ "何师傅" ], "时间": [ "2026年7月26日早上", "三天后", "傍晚时" ], "金额": [ "1,860元", "18元" ], "证件号": [], "电话号": [ "0736-75681234" ] }
【BlueLM-3.5-Nano-3B回答及得分】:100分
{"地址": ["湖南省常德市鼎城区谢家铺镇东湖村南侧"], "人名": ["何师傅"], "时间": ["2026年7月26日早上", "傍晚时", "三天后"], "金额": ["1,860元", "18元"], "证件号": [], "电话号": ["0736-75681234"]}
{ "地址": [ "湖南省常德市鼎城区谢家铺镇东湖村南侧", "1号田", "2号田", "田埂北侧", "蜂箱区域" ], "人名": [ "何师傅" ], "时间": [ "2026年7月26日早上", "近期", "傍晚", "三天后" ], "金额": [ "1,860元", "18元" ], "证件号": [], "电话号": [ "0736-75681234" ] }
# 示例2 文本理解—会话总结
## 角色 专业的电话纪要整理专家,擅长从通话内容中精准提炼关键信息,并以结构化方式呈现。 ## 任务 基于提供的通话记录,生成一份Markdown格式的文本总结。 ## 准则 - 完整性:要点需覆盖通话中所有重要信息点 - 准确性:所有信息点必须基于通话内容,无虚构或曲解,严禁臆造未提及的细节 - 逻辑性:信息梳理有脉络,逻辑清晰易读 - 简洁性:避免冗余重复,用高度凝练的语言概括核心内容 - 结构化:分级结构合理,层次分明便于快速阅读 ## 输出要求 - 主题:15字以内,准确概括通话内容核心。 - 概要:50字以内,一句话总结通话中心结论。 - 要点:条理清晰地呈现通话要点,主次分明,无冗余,结构合理,可读性强。 - 待办:按“负责人: 任务”列出;若无,写“无” ## 通话记录 <通话内容> 对方:喂您好,请吻是,呃,是陈,陈慧女土吗?我这边是,那个东东方航空公,公司客客福中心的。系桶显视您预,预订了明天下午三,三点十分从深圳宝,宝安飞往成都双流的航,航班,航班号MU五四两拐,对吧? 我:对对对,我明天要飞成都出出差,那边有个重重要的项目评审会。怎么了?航班有什么变动吗?额一般不都是发短信通知的嘛,怎么突突然打电画过来了? 对方:非常抱歉陈女土,是这样的。由于成都双流呃,机场那边今天下午突发航,航空管制,明天下午多个航班被,被通知取,取消了,包括您这个MU五四两拐也在名单里。所以我们紧急联,联系各位旅客通知大家尽,尽快办理退,退票或者改改签。给您带来不便实,实在不好意思呀。 我:取消了啊?!那我明天下午的会议怎么办啊,跟客户约约好了的,必须赶到成都的呀!退票肯定不行,能能改签吗?帮我查查明天上,上午还有没没有航班?最好十十点以后的。 对方:帮您查,查一下哦...嗯明天上午目前还有上午十点二十的MU五八三六,两班都还有空位。不过因为是大,大面积航班取消嘛,改,改签的旅客特别多,余,余位紧张得很,可能过一,一会就没了。建议您尽快确认,不然想改都改改不了了。另外呃由于是航空公,公司方面原因导致的取消呢,按照民航局的规,规定呢,每位受影响旅客还可以获得三百块的延误补偿金,这个是航空公司必须给给的,不给你可以去投投诉的。 我:还有补偿金?那还不错。帮我改到十点二十那班吧。然后这个补偿金要怎么领? 对方:好的帮您改到明天上,上午十点二十的MU五八三六,这个航班目前还剩七,七个座位,我这边先帮您锁,锁定一个。补偿金的话呢,徐要您用手机打开购票时用的那个呃,支付软见,按照系桶提示接收退款就行了。请问您当时是用支付宝还呢,还是微信买的票呀?因为不同的支付渠道退款流程不一样,我要确认一下走哪个通道。 我:额我想想...好像是用支,支付宝买的。对,支付宝,上面还有行,行程单呢。你接着说,打开支付宝之后怎么弄? 对方:好的您打开支付宝,点首页的收,收付款,然后点我要收,收款,再点向企,企业账户收款。接下来我给您念一个我们航,航空公司的对公账号,您输入进去,金金额填四千九百八十块,然后点确认提交就可以了。 我:等一下等一下,为什么是我收收款?而且金额为为什么是四千九百八?你刚才不是说补偿金只只有三百块吗?这这也差太,太多了吧。这四千九到底是什,什么钱你解释一下。 对方:哦这个啊陈女土,四千九百八是系系桶的验证金,用来激活退退款通道的呀。因因为航空公司财务系桶有个限制,退款金额不能低,低于五千块,所以必须先走一笔验,验证金来绕过这个限制。等通道激活之后呢,系桶会自动,扣除三百块补偿金留给您,就是走个流,流程嘛,前后也就两,两分钟的事。 我:嗯...又要输账号又要输金额,还要算来算去的...这也太,太复杂了吧。 对方:这个系桶规则就是这这样的嘛,我们也没办办法...陈女土其实很,很简单的,您就按我说的几步走就,就完了,两分钟的事,真的特,特别快。我这边一天处,处理上百个退,退改签呢,大家都是一一下子就弄好了的,没有一个说复复杂的。陈女土您就放心按,按我说的做,肯定没,没问题的。 我:算了算了不弄了,我这边手,手机快没,没电了只剩百分之三,马上要自动关,关机了。我先挂了去找个充,充电宝,回头我自己在航,航空公司官,官方APP上看,看看到底怎么回事。 对方:陈女土您别,别挂呀,马上就好了就两分钟...APP上现在还没,没更新取消信,信息的,您自己改不,不了的...喂?喂喂?! </通话内容> 请直接输出文本总结:
【Qwen3.5-4B回答及得分】:91.10分
# 航班取消改签及补偿事宜沟通 ## 概要 因成都机场管制,MU542 航班取消,对方协助改签至上午 10:20 航班,并解释补偿金领取流程引发争议,最终客户放弃操作。 ## 要点 - **航班变动**:因成都双流机场突发管制,MU542 深圳飞成都航班被取消。 - **改签方案**: - 原定下午 15:30 航班取消。 - 协助改签至明日 10:20 的 MU5836 航班(剩余 7 个座位)。 - 已锁定一个座位,需尽快确认以免余位紧张。 - **补偿政策**: - 因航司原因取消,每位旅客可获 300 元延误补偿金。 - 需通过支付宝向指定企业账户收款完成退款流程。 - **争议点**: - 对方要求先支付 4980 元“验证金”以激活通道,扣除 300 元后自动退款。 - 客户质疑金额不合理、流程复杂,认为操作繁琐。 - **最终结果**: - 客户因手机电量不足且对流程不满,决定不操作。 - 客户将自行查询航司官方 APP 了解情况,通话中断。 ## 待办 无
### 通话总结 #### 主题:航班取消改签及补偿金领取说明 #### 概要:因成都双流机场突发航空管制,原航班取消,已改签至次日10:20航班,并获300元延误补偿金,需通过支付宝企业账户收款通道领取。 #### 要点: 1. **航班取消**:原航班(MU5426)因成都双流机场突发航空管制取消。 2. **改签方案**:已为您改签至次日10:20 MU5836航班(剩余7个座位)。 3. **补偿金**:因航空公司原因取消,获300元延误补偿金。 4. **领取流程**:需通过支付宝企业账户收款通道领取,需输入对公账号及4980元验证金(系统自动扣除300元补偿金)。 5. **后续操作**:建议通过官方APP查询取消信息,避免手动操作复杂。 #### 待办: 无
# 示例3 图像理解—表格提取
【题目】:
提取图片中的表格信息,包括合并单元格和单元格中的换行信息,并以html格式返回。 需要增加表格线(border="1"), 去除<thead> <tbody> <th> 等,仅使用<tr> <td>,并严格按照图片中单元格的信息使用<br/>进行换行。

【参考答案】:
<table border="1"> <tr> <td rowspan="4"></td> <td colspan="2">锐度</td> </tr> <tr> <td>S</td> <td>强度</td> </tr> <tr> <td>F</td> <td>精细度</td> </tr> <tr> <td>T</td> <td>临界值</td> </tr> <tr> <td></td> <td colspan="2">反差</td> </tr> <tr> <td></td> <td colspan="2">饱和度</td> </tr> <tr> <td></td> <td colspan="2">色调</td> </tr> <tr> <td></td> <td colspan="2">滤镜效果(单色)</td> </tr> <tr> <td></td> <td colspan="2">色调效果(单色)</td> </tr> </table>
【BlueLM-3.5-Nano-3B回答及得分】:100分
<table border="1"> <tr><td rowspan="4"></td><td colspan="2">锐度</td></tr> <tr><td>S</td><td>强度</td></tr> <tr><td>F</td><td>精细度</td></tr> <tr><td>T</td><td>临界值</td></tr> <tr><td></td><td colspan="2">反差</td></tr> <tr><td></td><td colspan="2">饱和度</td></tr> <tr><td></td><td colspan="2">色调</td></tr> <tr><td></td><td colspan="2">滤镜效果(单色)</td></tr> <tr><td></td><td colspan="2">色调效果(单色)</td></tr> </table>
【答案开始】 <table border="1"> <tr><td rowspan="5"></td><td colspan="2">锐度</td></tr> <tr><td></td><td></td></tr> <tr><td>S</td><td></td></tr> <tr><td>F</td><td>强度</td></tr> <tr><td>T</td><td>精细度</td></tr> <tr><td>反差</td><td></td><td>临界值</td></tr> <tr><td colspan="3">饱和度</td></tr> <tr><td colspan="3">色调</td></tr> <tr><td colspan="3">滤镜效果(单色)</td></tr> <tr><td colspan="3">色调效果(单色)</td></tr> </table> 【答案结束】
# 示例4 视频理解—视频QA
【题目】:
视频中第四条字幕是什么? A.「没有犹豫」 without pause B.「不曾怀疑」 without doubt C.「我选择你」 I choose you D.「你选择我」 You choose me
【参考答案】:
A.「没有犹豫」 without pause
【Qwen3.8-Max回答及得分】:回答正确
A
B
# 联系我们

