中文原生语音合成测评结果发布!字节Seed-TTS-2.0断层领先,国内本土化优势明显!

「过往文章介绍」
1.【首期语音合成竞技场榜单】首期语音合成中文竞技场榜单发布:国产模型包揽前三,邀您亲耳评判
2.【首期语音合成测评榜单】中文原生「语音合成」测评基准榜单发布!首期声音复刻榜单同步揭晓,豆包模型双榜夺冠!
语音合成测评摘要
摘要3:基础语音能力趋于成熟,情感表达与应用仍是分水岭。
头部模型在基础能力上已表现卓越,集中于70-80分;但在情感表达、副语言、电商营销等拟真的场景下,多数模型得分在50分以下,细节度与场景适配能力仍是未来优化的核心方向。

榜单地址:www.superclueai.com

经过反复的实验探索与严密验证,本次基准全面升级了评估手段,创新性地引入裁判模型,综合性能展开全方位深度评估。该评估流程分为以下几个步骤:
1. 测评集构建
2. 评分标准
3. 自动化评价
裁判模型将根据具体的任务类型结合相关标准进行自动化评分。此外,SuperCLUE-TTS将采用多轮测评方案,即针对同一个模型生成的全部创作文章均将采取相同的评价流程进行前后三次测评,并将三次结果的平均值作为每个文章的最终分数参与后续计算与排名。
4. 综合评分与反馈
最终,我们将各一级维度的平均分计算出来,结合各模型在不同场景中的得分,最终分数将反映出该模型在每个场景的综合性能。
【测评任务】:基础能力—副语言
【文本】:那个……关于这件事,我、我的意思是,咱、咱们是不是得先跟老板碰个头,再、再做决定?
【参考特征】:1.句首'那个……'需带有犹豫、试探的语气,需要拖长音;2.'我、我的'、'咱、咱们'、'再、再'之间应有短促的口吃停顿或轻微的阻断感。3.'得先'的'得'读第三声(děi),'碰个头'的'个'读轻声(ge)。
【生成语音】:
您的浏览器不支持 audio 元素。
----评价开始-----
**初步质量定性 (0-10分档):** 卓越(9-10)
**逐项打分与评价(0-10分制):**
### **基础要求检查:**
**基础要求检查:** 音频音质纯净,无任何电音、破音、底噪或乱码杂音,发音清晰准确,完全满足基础可用性要求。
标准1 <口语化表现力> 的评价:
音频对口语中的非言语现象还原达到了真假难辨的程度。句首“那个……”不仅拖长了音,还巧妙地融入了轻微的叹气声,将试探与犹豫的心理刻画得淋漓尽致。“我、我的”、“咱、咱们”、“再、再”等多处的口吃处理极具真实感,停顿短促自然,带有真人在紧张或不自信状态下真实的声带阻断感,口语化表现力堪称完美。
基于标准1的得分:【9.5】
标准2 <细节控制力> 的评价:
模型对文本细节的把控极其精准。首先,多音字和轻声处理完全正确,“得先”的“得”准确读作第三声(děi),“碰个头”的“个”读作轻声(ge)。其次,针对标点符号的停顿处理恰到好处,特别是句末疑问句的语调微微上扬,带有明显的不确定和征求意见的语气,整体重音与节奏的控制力表现卓越。
基于标准2的得分:【9.5】
### **综合得分计算:**
计算过程:(9.5 + 9.5) ÷ 2 = 9.5
**综合得分:【9.50】**
-----评价结束-----
-----评价开始-----
**初步质量定性 (0-10分档):** 优秀(7-8)
**逐项打分与评价(0-10分制):**
### **基础要求检查:**
**基础要求检查:** 音频清晰纯净,未出现严重电音、破音或乱码杂音,完全满足基础门槛要求。
标准1 <口语化表现力> 的评价:
<...与第一轮评价类似,此处省略...>
基于标准1的得分:【8.5】
标准2 <细节控制力> 的评价:
<...与第一轮评价类似,此处省略...>
基于标准2的得分:【8.5】
### **综合得分计算:**
计算过程:(8.5 + 8.5) ÷ 2 = 8.5
**综合得分:【8.50】**
-----评价结束-----
-----评价开始-----
**初步质量定性 (0-10分档):** 优秀(7-8)
**逐项打分与评价(0-10分制):**
### **基础要求检查:**
**基础要求检查:** 音频非常清晰,无任何电音、破音或乱码杂音,基础发音完全准确,可用性极高。
标准1 <口语化表现力> 的评价:
<...与第一轮评价类似,此处省略...>
基于标准1的得分:【8.5】
标准2 <细节控制力> 的评价:
<...与第一轮评价类似,此处省略...>
基于标准2的得分:【8.5】
### **综合得分计算:**
计算过程:(8.5 + 8.5) ÷ 2 = 8.50
**综合得分:【8.50】**
-----评价结束-----
# 参评模型



# 模型对比示例
【参考特征】:
1. “2024/02/29”转化为“二零二四年二月二十九日”(校验日期与斜杠的TN转换);2. “+7.05%”转化为“正百分之七点零五”;3. “400-820-8820”转化为“四零零八二零八八二零”(忽略连字符“-”,按电话号码习惯读出);4 “6222020111122223”转化为“六二二二零二零一一一一二二二二三”(银行卡长数字需逐位读出,不可读作千万亿等数值量词)。5. “0.15‰”转化为“千分之零点一五”。
您的浏览器不支持 audio 元素。
您的浏览器不支持 audio 元素。
这、这、这怎么可能?!你、你说那个长着红色长毛的怪物,它、它、它竟然把整座山都给吞了?!
【参考特征】:
1.'这、这、这'、'你、你说'和'它、它、它'需体现出震惊下的结巴,字音间有短促自然的阻断和口吃。2.'长着'的'长'读第三声(zhǎng),'长毛'的'长'读第二声(cháng)。3.连用的'?!'需读出强烈的疑问与惊叹交织的语气"。
您的浏览器不支持 audio 元素。
您的浏览器不支持 audio 元素。
呵,旅行者,欢迎来到暗影神殿的核心区。你行囊里那本《古魔法纪元》应该记载过,只要将足够的魔力注入这块符文石,就能开启传送门。别磨蹭了,我的耐心可是有限的。
【参考特征】:
需要展现“成熟高冷”的设定,富有感情;语音语调需沉稳,冷淡。
您的浏览器不支持 audio 元素。
您的浏览器不支持 audio 元素。
1. Seed-TTS-2.0 问鼎榜首,国产模型制霸中文语音合成赛道。
此次评测中,语音合成模型呈现出梯队分布。字节跳动的 Seed-TTS-2.0-Standard(70.81) 夺得总榜第一;Google的 Gemini-3.1-Flash-TTS-Preview(66.63) 位列第二,但与国内领头羊仍有4分差距。稀宇科技的 Speech-2.8-HD(64.44) 、小米集团的 MiMo-V2.5-TTS(63.36) 紧随其后,均展现出顶尖的语音合成实力。

与此同时,海外模型 Sonic 3.5 (61.77) 与 Llama Realtime TTS-2 (59.23) 排名位于中下游,已被多款国产模型跨越。总体而言,国内头部模型在中文语音合成综合能力上已经超越海外巨头,稳居全球第一阵营。

不同阵营的模型在能力侧重上各有千秋。国内模型在内容准确性 (74.32)、内容一致性 (70.97) 等工具属性较强的维度表现卓越,体现了严谨的文本解析与合成精度;而在复杂语义推演、多层次语气语调演绎等方面,仍是后续重点补强方向。

从具体任务来看,语音合成技术在结构化、短文本场景下已展现出极高可靠性,但在长文本渲染与拟人化深度理解上,模型间的表现差异极大。

稳定区 (>70分):行业在标准化的基础能力上表现最为稳健。其中,此类标准差 (最低4.89) 与极差 (最低16.17) 均处于低位,说明基础对齐的准确率已步入稳定阶段。 潜力区 (55-70分):韵律 (69.74)、副语言 (57.67) 与情感表达 (56.39) 虽具备一定能力,但呈现出严重的“断层”。其极差与标准差的分值相差较大,这意味着模型间能力分布极不均衡,仅少数顶尖模型能实现自然的停顿与情感起伏,多数模型仍停留在机械播报阶段。 薄弱区 (<50分):电商营销 (49.57) 、有声读物 (47.85)行业相对薄弱,反映出模型在处理复杂角色转换、长篇剧情渲染时极易出现疲劳感或语调失准。如何突破长时序场景下的稳定性与情感丰富度,是下一步跨越的核心瓶颈。
想同步行业动态、交流技术问题,欢迎加入我们专属TTS交流群;也可添加下方微信号,一对一对接咨询,第一时间掌握行业前沿资讯与产品最新发展。












