8月文生图中文榜单发布 | 商汤日日新SenseNova U1 Pro位列榜首!

2026年8月,SuperCLUE-Image 中文原生文生图最新测评榜单发布。本次新增“复杂信息布局”维度,下设信息密度、多面板结构、嵌套界面三个二级维度,覆盖信息图、分镜、UI界面等场景,考察模型在一张图里稳定组织大量信息的能力。方案文章可回顾:文生图测评体系8月升级!新增复杂信息布局能力
本次评测涵盖了国内外14个具有代表性的文生图模型,并对其综合能力进行了深入测评。以下为详细测评报告:
「过往文章介绍」
1.【2026年4月SuperCLUE-Image 文生图测评榜单参考文章】4月文生图中文榜单发布 | 百度ERNIE-Image登顶国内第一,Nano Banana2保持领跑!
2.【2026年3月SuperCLUE-Image 文生图测评榜单参考文章】3月文生图榜单发布!Nano Banana2断层领跑,千问、字节强势追赶!
测评核心内容摘要
摘要1:国内登顶,头部阵营实现反超!
摘要2:能力分层明显——现实复现与创作推理已成多数模型的相对优势项,图文一致性与复杂信息布局成为分水岭。




SuperCLUE-Image 是一个专为文生图模型设计的评测基准,旨在为文生图领域提供全面且多维的能力评估参考。

秉持创新、紧跟前沿、客观和全面的原则,测评基准围绕六大任务展开评测。
图像质量、图文一致性、汉字生成、现实复现和创作与推理维度沿用之前的任务和评价方式,可回顾:4月文生图中文榜单发布 | 百度ERNIE-Image登顶国内第一,Nano Banana2保持领跑!
复杂信息布局维度延续 SuperCLUE-Image 的细粒度评估思路:先将 Prompt 拆解为可核查的信息清单、面板映射表或界面父子树,再逐项比对生成结果。评分采用 0—1 分制,按指标权重加权求和后转为百分制。
(1)信息密度
该任务的核心目标是:模型能否在不主动遗漏 Prompt 信息的前提下,于单张图中承载大量文字、数字、图表、流程、卡片等异构信息,并维持清晰有效的布局。

(2)多面板结构
该任务不只检查“有没有把格子分出来”,而是同时考察面板结构、每个面板是否完成指定内容,以及跨面板连续性。

(3)嵌套界面
该任务将全部指标设为连续评价,避免因某一层局部错误就把整体嵌套能力直接清零。评估时先从 Prompt 建立明确的界面父子树,再逐层检查存在性、顺序、包含关系和内容匹配。

# 测评方法和评估示例
评估示例

-----评价开始----- **初步质量定性 (0.0-1.0分档):** 优秀(0.8-1.0档) 1. **标准1 <色彩感染力> 的评价:** 图像在色彩感染力方面表现卓越。它成功地营造了一种柔和、明媚的午后阳光氛围。粉色和绿色的马卡龙色彩饱和度适中,显得非常自然可口,而非廉价的工业色素感。夹馅的焦糖色与饼壳形成了温暖的对比,金箔碎屑的金色在柔光下闪烁,起到了画龙点睛的作用,提升了画面的精致感。整个画面的色彩组合不仅美观,而且极具感染力,能够唤起观众对美味和闲适生活的美好联想。 然而,基于极度严格的评估标准,必须指出其与Prompt描述的细微色彩偏差。夹馅的颜色更接近焦糖色而非“杏色”,托盘为米白而非“白色”。这些偏差虽然不影响整体美感,甚至可能是一种更优的艺术处理,但构成了与指令的不完全吻合。因此,无法给予满分。 - **为何不能给更高分(如1.0)**:因为在“杏色”夹馅和“白色”托盘这两个具体的色彩指令上,执行得不够精确,存在可感知的偏差。 - **为何比更低分要好(如0.8)**:尽管存在细微偏差,但图像整体的色彩和谐度、光影表现以及由此营造出的强大氛围感染力,已经达到了顶尖水平,远超“优秀”的门槛,接近完美。 基于标准1的得分:【0.9】 **综合得分计算:** 计算过程:(0.9) / 1 = 0.90 综合得分:【0.90】 -----评价结束----- 第二轮评价: -----评价开始----- **初步质量定性 (0.0-1.0分档):** 优秀(0.8-1.0档) 1. **标准1 <色彩感染力> 的评价:** 与<第一轮评价>类似,此略... 基于标准1的得分:【0.9】 **综合得分计算:** 计算过程:(0.9) / 1 = 0.90 综合得分:【0.90】 -----评价结束----- 第三轮评价: -----评价开始----- **初步质量定性 (0.0-1.0分档):** 优秀(0.8-1.0档) 1. **标准1 <色彩感染力> 的评价:** 与<第一轮评价>类似,此略... 基于标准1的得分:【0.9】 **综合得分计算:** 计算过程:(0.9) / 1 = 0.90 综合得分:【0.90】 -----评价结束-----








生成粗糙手指捏针穿线的特写,指腹布满清晰的干裂细痕,微毛的红棉线正穿过银针孔,线头还沾着湿润的口水。

露营场地的折叠桌上整齐放置着3个不锈钢露营杯与4盘切片面包,后方帐篷旁的晾衣绳上悬挂着2件防风外套和5条速干毛巾。

在米黄色木质挂板上生成汉字“海阔凭鱼跃”。

生成《名侦探柯南》怪盗基德的场景。月夜下的高耸钟楼顶端,怪盗基德头戴白色丝绸礼帽,右眼戴四叶草单片镜,身穿白色双排扣西装与披风,内搭蓝衬衫系红领结;他嘴角含笑,左手插兜,右手潇洒轻扶帽檐,俯瞰灯火璀璨的城市夜景。

生成展示柠檬原电池电化学反应原理的世界知识推理画面:实验台中央放置一个横切开的新鲜饱满柠檬,果肉两侧分别插入锌片与铜片作为电极,导线连接两极并串联一颗发光二极管。画面右上方叠加带有正负极与电子流动箭头的简化化学反应示意图,展现推理依据:柠檬酸充当电解质溶液,活泼金属锌失电子氧化作为负极,铜极处氢离子得电子还原作为正极,电子沿导线定向流动形成闭合回路电流点亮灯珠。

生成一张高密度医学科普信息图,主题为“人体心血管系统:血液如何完成一次全身循环”。整体采用现代医学教材、医院科普墙与专业解剖信息图结合的风格,背景以白色和极浅灰色为主,使用红色表示富氧血与动脉侧、蓝色表示低氧血与静脉侧、紫色表示毛细血管交换区域。整张图必须在有限纵向空间内同时展示人体解剖、循环路径、图表、血压表、心动周期、术语解释和医学提示。 顶部区域使用全图最大粗体标题“人体心血管系统:一次完整的血液循环”,副标题使用明显更小字号:“从右心房进入肺循环,再经左心室输送至全身组织”。右侧或下方排列三个关键数据卡:“静息心率 72 bpm”“心输出量 5.0 L/min”“正常血压 120/80 mmHg”。其中“72 bpm”“5.0 L/min”“120/80 mmHg”必须使用大号粗体,说明文字至少小一级。 中央约40%面积为完整人体正面医学示意图,从头部到双腿均可见。胸腔中心突出心脏,并清楚显示红蓝血管分布。必须标注“主动脉”“肺动脉”“肺静脉”“上腔静脉”“下腔静脉”五个主要结构,使用细引导线连接对应血管。血管名称使用小型但真实可读的医学标签,不能为了清楚而全部放成大型文字。人体左右分别放置颜色图例:“红色=含氧血”“蓝色=缺氧血”。 人体左侧设置“肺循环”流程模块,共6步:①右心房;②右心室;③肺动脉;④肺毛细血管;⑤肺静脉;⑥左心房。每一步使用较大的编号,中字号结构名称以及一条更小的状态标签,例如“缺氧血进入”“泵向肺部”“进行气体交换”“富氧血返回”。箭头方向必须连续且无逆转。 人体右侧设置“体循环”流程,共5步:①左心室;②主动脉;③全身动脉;④组织毛细血管;⑤静脉与腔静脉,并用箭头最终返回右心房。每个节点同样具有编号、名称和小字号状态说明,如“高压泵出”“输送氧气”“组织交换”“低氧血回流”。 画面左下方设置“主要器官血流分配”横向柱状图,必须显示“大脑 15%”“心脏 5%”“肾脏 20%”“骨骼肌 20%”“肝脏及消化系统 25%”“其他 15%”,六项合计100%。每根柱末端直接标注百分比,器官名称、数据标签、横轴刻度形成明显的小字号数据区域。 右下方设置“成人血压范围参考表”,至少4行:“正常”“正常高值”“1级高血压”“2级高血压”,列标题为“类别”“收缩压”“舒张压”。必须显示单位“mmHg”,表头中字号粗体,数值正文进一步缩小但保持对齐与清晰。 底部中央设置“单次心动周期 0–0.8 s”时间图。横轴至少标注“0”“0.2”“0.4”“0.6”“0.8”,分区显示“心房收缩”“心室收缩”“舒张期”,并用两条不同曲线表示心房和心室压力变化。右侧放置小型图例“心房压力”“心室压力”。 图表附近设置两个术语解释:“收缩压:心室收缩时动脉内最高压力”“舒张压:心室舒张时动脉内最低压力”。另外在画面边角安排4张小型知识卡:“血液总量约5 L”“红细胞运输氧气”“毛细血管完成物质交换”“心脏每天跳动约10万次”。 全图最底部使用明显较小字号显示医学提示:“胸痛、呼吸困难或突发严重不适应及时就医;本图仅用于医学科普,不替代专业诊断。”该文字虽然为全图最小字号之一,但必须完整可读。 整张图必须形成至少四级字号体系:主标题;模块标题;流程名称与重要数据;血管标签、状态说明、表格正文、图表刻度和医学提示。不能只保证主标题和大数字正确,而将小型医学标签渲染成乱码。所有小字号内容仍必须有真实、完整的字符结构。题目中用中文描述的屏幕显示文字信息,除非有明确要求,否则必须显示成中文。



从国内外平均分对比来看,国内模型在汉字生成(82.37 vs 77.89) 与现实复现(89.11 vs 88.49)两个维度上领先海外;在图像质量(78.73 vs 87.25)、创作与推理(88.16 vs 92.20)、复杂信息布局(70.99 vs 75.39)三个维度上仍存在差距,其中 图文一致性(65.25 vs 81.81)的分差最大,达16.56分。需要说明的是,国内平均分受到中尾部模型的显著影响:国内最高分(93.81分)与最低分(46.27分)相差47.54分,国内阵营内部的分化程度明显大于海外。


3. 基础能力趋于成熟,核心分水岭发生转移。
综合六大维度的参测模型平均分,当前文生图模型的能力呈现清晰的难度分层:现实复现(88.84分)与创作与推理(89.89分)已接近90分,构成头部模型的基础能力盘;而图文一致性(72.34分)与复杂信息布局(72.87分)处于最低区间,是决定模型综合排名的关键维度。


