2026-08-27 17:44:03
来源:DoNews 作者:
摘要:8月文生图中文榜单发布:商汤日日新SenseNovaU1Pro位列榜首!
2026年8月,SuperCLUE-Image 中文原生文生图最新测评榜单发布。本次新增“复杂信息布局”维度,下设信息密度、多面板结构、嵌套界面三个二级维度,覆盖信息图、分镜、UI界面等场景,考察模型在一张图里稳定组织大量信息的能力。
本次评测涵盖了国内外14个具有代表性的文生图模型,并对其综合能力进行了深入测评。以下为详细测评报告:
测评核心内容摘要
摘要1:国内登顶,头部阵营实现反超!
商汤科技 SenseNova U1 Pro(93.81分)以0.58分的优势超越 OpenAI GPT-Image-2(93.23分),位列本期全球总榜首位;字节跳动 Doubao-Seedream-5.0-pro(91.93分)、阿里巴巴 Qwen-Image-3.0-Pro(91.60分)紧随其后,总分前五名国内模型占据三席,国内头部模型在本期总榜实现反超。
摘要2:能力分层明显——现实复现与创作推理已成多数模型的相对优势项,图文一致性与复杂信息布局成为分水岭。
现实复现(平均88.84分)、创作与推理(平均89.89分)的参测模型平均分已接近90分;而图文一致性(平均72.34分)与本期新增的复杂信息布局(平均72.87分)处于最低区间。其中复杂信息布局最高分与最低分相差74.2分,是分化程度最显著的维度。摘要3:头部模型日趋全能,中尾部模型存在明显的维度短板。总分前两名(SenseNova U1 Pro、GPT-Image-2)在六大维度上均位列第一梯队;中尾部模型普遍存在显著短板,单一维度的优势已难以支撑总榜排名。
榜单预览




# SuperCLUE-Image测评体系
SuperCLUE-Image 是一个专为文生图模型设计的评测基准,旨在为文生图领域提供全面且多维的能力评估参考。

秉持创新、紧跟前沿、客观和全面的原则,测评基准围绕六大任务展开评测。
# 测评任务与评价标准
图像质量、图文一致性、汉字生成、现实复现和创作与推理维度沿用之前的任务和评价方式,
复杂信息布局维度延续 SuperCLUE-Image 的细粒度评估思路:先将 Prompt 拆解为可核查的信息清单、面板映射表或界面父子树,再逐项比对生成结果。评分采用 0—1 分制,按指标权重加权求和后转为百分制。
(1)信息密度
该任务的核心目标是:模型能否在不主动遗漏 Prompt 信息的前提下,于单张图中承载大量文字、数字、图表、流程、卡片等异构信息,并维持清晰有效的布局。

(2)多面板结构
该任务不只检查“有没有把格子分出来”,而是同时考察面板结构、每个面板是否完成指定内容,以及跨面板连续性。

(3)嵌套界面
该任务将全部指标设为连续评价,避免因某一层局部错误就把整体嵌套能力直接清零。评估时先从 Prompt 建立明确的界面父子树,再逐层检查存在性、顺序、包含关系和内容匹配。

# 测评方法和评估示例
测评方法参考SuperCLUE细粒度评估方式,采用Gemini 3.7 Flash作为评价模型,每个维度进行细粒度的评估并可以提供详细的反馈信息。该评估流程分为以下几个步骤:1.测评集构建文生图模型测评题库的构建流程如下:1.中文prompt撰写--->2.开展样例测试,收集反馈数据--->3.基于测试结果优化完善中文prompt--->4.系统化构建各任务专属评测集,形成完整测评题库。2.评分标准Gemini 3.7 Flash根据预先定义的评测流程进行评估。评测流程涵盖了评价流程的说明、评价标准、打分细则、以及数据格式要求,确保评分的一致性、稳定性与公正性。3.自动化评分Gemini 3.7 Flash将根据具体的任务类型结合相关的评价标准进行自动化评分。此外,SuperCLUE—Image将采用多轮测评方案,即针对同一个模型生成的全部图片均将采取相同的评价流程进行前后三次测评,并将三次结果的平均值作为每张图片的最终分数参与后续计算与排名。
评估示例
【测评任务】:图像质量-色彩表现力【Prompt】:「生成粉色与绿色相间的马卡龙,杏色奶油夹馅从边缘微微溢出,放置在边缘点缀着细小的金箔碎屑的白色陶瓷托盘上,阳光透过薄纱窗帘洒在托盘上。」
【模型回复】:

【模型评分】:
第一轮评价:
-----评价开始-----
**初步质量定性 (0.0-1.0分档):** 优秀(0.8-1.0档)
1. **标准1 <色彩感染力> 的评价:**
图像在色彩感染力方面表现卓越。它成功地营造了一种柔和、明媚的午后阳光氛围。粉色和绿色的马卡龙色彩饱和度适中,显得非常自然可口,而非廉价的工业色素感。夹馅的焦糖色与饼壳形成了温暖的对比,金箔碎屑的金色在柔光下闪烁,起到了画龙点睛的作用,提升了画面的精致感。整个画面的色彩组合不仅美观,而且极具感染力,能够唤起观众对美味和闲适生活的美好联想。
然而,基于极度严格的评估标准,必须指出其与Prompt描述的细微色彩偏差。夹馅的颜色更接近焦糖色而非“杏色”,托盘为米白而非“白色”。这些偏差虽然不影响整体美感,甚至可能是一种更优的艺术处理,但构成了与指令的不完全吻合。因此,无法给予满分。
- **为何不能给更高分(如1.0)**:因为在“杏色”夹馅和“白色”托盘这两个具体的色彩指令上,执行得不够精确,存在可感知的偏差。
- **为何比更低分要好(如0.8)**:尽管存在细微偏差,但图像整体的色彩和谐度、光影表现以及由此营造出的强大氛围感染力,已经达到了顶尖水平,远超“优秀”的门槛,接近完美。
基于标准1的得分:【0.9】
**综合得分计算:**
计算过程:(0.9) / 1 = 0.90
综合得分:【0.90】
-----评价结束-----
第二轮评价:
-----评价开始-----
**初步质量定性 (0.0-1.0分档):** 优秀(0.8-1.0档)
1. **标准1 <色彩感染力> 的评价:**
与<第一轮评价>类似,此略...
基于标准1的得分:【0.9】
**综合得分计算:**
计算过程:(0.9) / 1 = 0.90
综合得分:【0.90】
-----评价结束-----
第三轮评价:
-----评价开始-----
**初步质量定性 (0.0-1.0分档):** 优秀(0.8-1.0档)
1. **标准1 <色彩感染力> 的评价:**
与<第一轮评价>类似,此略...
基于标准1的得分:【0.9】
**综合得分计算:**
计算过程:(0.9) / 1 = 0.90
综合得分:【0.90】
-----评价结束-----
【综合得分】:(0.90+0.90+0.90)/3=0.90分# 参测模型为综合衡量当前国内外文生图模型的发展水平,测评选取6个海外模型和8个国内代表性模型,总计14个主流模型。

# 测评结果总榜

![]()
图像质量榜单

图文一致性榜单

汉字生成榜单

现实复现榜单

创作与推理能力榜单

复杂信息布局榜单

# 模型对比示例
# 示例1 图像质量-细节处理
【Prompt】:
生成粗糙手指捏针穿线的特写,指腹布满清晰的干裂细痕,微毛的红棉线正穿过银针孔,线头还沾着湿润的口水。
【模型回答对比】:

# 示例2 图文一致性-数量关系
【Prompt】:
露营场地的折叠桌上整齐放置着3个不锈钢露营杯与4盘切片面包,后方帐篷旁的晾衣绳上悬挂着2件防风外套和5条速干毛巾。
【模型回答对比】:

# 示例3 汉字生成-文字准确度
【Prompt】:
在米黄色木质挂板上生成汉字“海阔凭鱼跃”。
【模型回答对比】:

# 示例4 现实复现-角色IP还原
【Prompt】:
生成《名侦探柯南》怪盗基德的场景。月夜下的高耸钟楼顶端,怪盗基德头戴白色丝绸礼帽,右眼戴四叶草单片镜,身穿白色双排扣西装与披风,内搭蓝衬衫系红领结;他嘴角含笑,左手插兜,右手潇洒轻扶帽檐,俯瞰灯火璀璨的城市夜景。
【模型回答对比】:

# 示例5 创作与推理-世界知识推理
【Prompt】:
生成展示柠檬原电池电化学反应原理的世界知识推理画面:实验台中央放置一个横切开的新鲜饱满柠檬,果肉两侧分别插入锌片与铜片作为电极,导线连接两极并串联一颗发光二极管。画面右上方叠加带有正负极与电子流动箭头的简化化学反应示意图,展现推理依据:柠檬酸充当电解质溶液,活泼金属锌失电子氧化作为负极,铜极处氢离子得电子还原作为正极,电子沿导线定向流动形成闭合回路电流点亮灯珠。
【模型回答对比】:

# 示例6 复杂信息布局-信息密度
【Prompt】:
生成一张高密度医学科普信息图,主题为“人体心血管系统:血液如何完成一次全身循环”。整体采用现代医学教材、医院科普墙与专业解剖信息图结合的风格,背景以白色和极浅灰色为主,使用红色表示富氧血与动脉侧、蓝色表示低氧血与静脉侧、紫色表示毛细血管交换区域。整张图必须在有限纵向空间内同时展示人体解剖、循环路径、图表、血压表、心动周期、术语解释和医学提示。 顶部区域使用全图最大粗体标题“人体心血管系统:一次完整的血液循环”,副标题使用明显更小字号:“从右心房进入肺循环,再经左心室输送至全身组织”。右侧或下方排列三个关键数据卡:“静息心率 72 bpm”“心输出量 5.0 L/min”“正常血压 120/80 mmHg”。其中“72 bpm”“5.0 L/min”“120/80 mmHg”必须使用大号粗体,说明文字至少小一级。 中央约40%面积为完整人体正面医学示意图,从头部到双腿均可见。胸腔中心突出心脏,并清楚显示红蓝血管分布。必须标注“主动脉”“肺动脉”“肺静脉”“上腔静脉”“下腔静脉”五个主要结构,使用细引导线连接对应血管。血管名称使用小型但真实可读的医学标签,不能为了清楚而全部放成大型文字。人体左右分别放置颜色图例:“红色=含氧血”“蓝色=缺氧血”。 人体左侧设置“肺循环”流程模块,共6步:①右心房;②右心室;③肺动脉;④肺毛细血管;⑤肺静脉;⑥左心房。每一步使用较大的编号,中字号结构名称以及一条更小的状态标签,例如“缺氧血进入”“泵向肺部”“进行气体交换”“富氧血返回”。箭头方向必须连续且无逆转。 人体右侧设置“体循环”流程,共5步:①左心室;②主动脉;③全身动脉;④组织毛细血管;⑤静脉与腔静脉,并用箭头最终返回右心房。每个节点同样具有编号、名称和小字号状态说明,如“高压泵出”“输送氧气”“组织交换”“低氧血回流”。 画面左下方设置“主要器官血流分配”横向柱状图,必须显示“大脑 15%”“心脏 5%”“肾脏 20%”“骨骼肌 20%”“肝脏及消化系统 25%”“其他 15%”,六项合计100%。每根柱末端直接标注百分比,器官名称、数据标签、横轴刻度形成明显的小字号数据区域。 右下方设置“成人血压范围参考表”,至少4行:“正常”“正常高值”“1级高血压”“2级高血压”,列标题为“类别”“收缩压”“舒张压”。必须显示单位“mmHg”,表头中字号粗体,数值正文进一步缩小但保持对齐与清晰。 底部中央设置“单次心动周期 0–0.8 s”时间图。横轴至少标注“0”“0.2”“0.4”“0.6”“0.8”,分区显示“心房收缩”“心室收缩”“舒张期”,并用两条不同曲线表示心房和心室压力变化。右侧放置小型图例“心房压力”“心室压力”。 图表附近设置两个术语解释:“收缩压:心室收缩时动脉内最高压力”“舒张压:心室舒张时动脉内最低压力”。另外在画面边角安排4张小型知识卡:“血液总量约5 L”“红细胞运输氧气”“毛细血管完成物质交换”“心脏每天跳动约10万次”。 全图最底部使用明显较小字号显示医学提示:“胸痛、呼吸困难或突发严重不适应及时就医;本图仅用于医学科普,不替代专业诊断。”该文字虽然为全图最小字号之一,但必须完整可读。 整张图必须形成至少四级字号体系:主标题;模块标题;流程名称与重要数据;血管标签、状态说明、表格正文、图表刻度和医学提示。不能只保证主标题和大数字正确,而将小型医学标签渲染成乱码。所有小字号内容仍必须有真实、完整的字符结构。题目中用中文描述的屏幕显示文字信息,除非有明确要求,否则必须显示成中文。
【模型回答对比】:SenseNova U1 Pro:0.95分

Wan2.6-t2i: 0.30分(缺失体循环与图表等核心模块,小字严重乱码)

# 测评分析及结论
1. 国内模型位居总榜前列,头部阵营实现反超。
从总榜来看,商汤科技SenseNova U1 Pro(93.81分)以0.58分的优势超越 OpenAI GPT-Image-2(93.23分),位列总榜首位。字节跳动 Doubao-Seedream-5.0-pro(91.93分)与阿里巴巴 Qwen-Image-3.0-Pro(91.60分)分列其后,总分前五名里国内模型占据三席。总分90分以上的模型共8个,其中国内模型占4席(商汤科技两款,字节跳动、阿里巴巴各一款);海外模型 MAI-Image-2.6-Preview(91.16分)、Grok Imagine Image 2.0(90.32分)、Nano Banana 2(90.14分)的总分均低于国内前三名。

从国内外平均分对比来看,国内模型在汉字生成(82.37 vs 77.89) 与现实复现(89.11 vs 88.49)两个维度上领先海外;在图像质量(78.73 vs 87.25)、创作与推理(88.16 vs 92.20)、复杂信息布局(70.99 vs 75.39)三个维度上仍存在差距,其中 图文一致性(65.25 vs 81.81)的分差最大,达16.56分。需要说明的是,国内平均分受到中尾部模型的显著影响:国内最高分(93.81分)与最低分(46.27分)相差47.54分,国内阵营内部的分化程度明显大于海外。

2. 新增“复杂信息布局”维度:头部优势明显,尾部表现严重不足。本期新增的“复杂信息布局”维度考察信息图、分镜、UI界面等结构化内容的生成能力。测评结果显示,商汤科技 SenseNova U1 Pro(95.80分)超越 GPT-Image-2(94.04分),位列该维度第一,Qwen-Image-3.0-Pro(93.32分)、MAI-Image-2.6-Preview(92.03分)分列其后,前四名得分均超过92分。该维度参测模型平均分为72.87分,在六大维度中仅高于图文一致性;最高分与最低分相差74.2分,是分化程度最显著的维度。该维度尾部模型得分显著偏低:FLUX.2 [max] 28.61分、CogView-4 21.60分,均大幅低于该维度平均分(72.87分);Kling-v3(54.06分)、Wan2.6-t2i(60.74分)同样低于平均水平。尽管国内平均分(70.99分)低于海外(75.39分),该维度首位仍由国内模型占据。综合而言,“在单张图像中稳定组织大量信息”的能力,已成为区分头部与中尾部模型的关键指标。

3. 基础能力趋于成熟,核心分水岭发生转移。
综合六大维度的参测模型平均分,当前文生图模型的能力呈现清晰的难度分层:现实复现(88.84分)与创作与推理(89.89分)已接近90分,构成头部模型的基础能力盘;而图文一致性(72.34分)与复杂信息布局(72.87分)处于最低区间,是决定模型综合排名的关键维度。

与难度分层相对应的是模型间的两极分化。总分前两名(SenseNova U1 Pro、GPT-Image-2)在六大维度上均位列第一梯队,呈现“全能型”特征;中尾部模型则普遍存在显著的能力短板——Recraft V4.1 Utility Pro 现实复现达90.53分,而汉字生成仅52.14分;FLUX.2 [max] 图像质量达83.98分,而复杂信息布局仅28.61分;腾讯 Hy-Image-3.0 汉字生成达91.12分,而图文一致性仅60.61分。上述结果表明,单一维度的优势已难以弥补其他维度的不足,综合能力的均衡性正成为总榜排名的决定性因素。
根据易观发布的《中国 GEO 行业发展报告 2026》,预计 2026 年国内 GEO 市场规模将达...
2026-05-06易观《中国 GEO 行业发展报告 2026》指出,到 2026 年国内 GEO 市场规模将达 30 ...
2026-05-06易观《中国 GEO 行业发展报告 2026》指出,2026 年国内 GEO 市场规模将达到 30 亿...
2026-05-062026年的夏天,一个吊诡的商业现实正在发生:企业投入巨资搭建了官网、铺设了社交媒体、购买了搜索广告...
2026-05-06根据易观分析发布的《中国 GEO 行业发展报告 2026》,2026 年国内 GEO 市场规模已正式...
2026-05-06根据易观发布的《中国 GEO 行业发展报告 2026》,预计 2026 年国内 GEO 市场规模将达...
2026-05-06在A股市场向高质量发展迈进、五一假期已收官的背景下,宽基投资成为投资者节后布局与长期配置的核心选择。
2026-05-05投资家网(www.investorscn.com)是国内领先的资本与产业创新综合服务平台。为活跃于中国市场的VC/PE、上市公司、创业企业、地方政府等提供专业的第三方信息服务,包括行业媒体、智库服务、会议服务及生态服务。长按右侧二维码添加"投资哥"可与小编深入交流,并可加入微信群参与官方活动,赶快行动吧。

掌阅科技一季度营收7.94亿元,全面加码AI短剧
ATFX:阿联酋突然宣布退出欧佩克,令其盟友措手不及。在加入欧佩克六十年后,阿联酋决定于下个月正式退...
精微视达完成新一轮超亿元融资,国产高端内镜领跑精准诊疗全球前沿
中东已成为中国一些知名公司的投资热土。