智东西(公众号:zhidxcom)




作者 |  杨京丽




编辑 |  李水青



智东西7月20日报道,今天,千问大模型发布语音合成大模型Qwen-Audio-3.0-TTS,包含面向实时交互的


Flash版本(首包延时300ms级别)和面向高质量生成的


Plus版本





模型在


细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性


等方面实现系统性提升。目前,Qwen-Audio-3.0-TTS-Plus在第三方评测机构Artificial Analysis的Speech Arena语音合成榜单中


居于第一


,Elo得分为1237。



阿里甩出“配音”神器:能调整情绪,还会说方言



▲Qwen-Audio-3.0-TTS-Plus在语音合成榜单中排名第一(图源:Artificial Analysis)



阿里还将陆续上线指令风格音色、20种方言音色、细粒度控制音色及14种以上小语种音色,供开发者直接调用。在输出规格方面,Qwen-Audio-3.0-TTS将音频采样率从24kHz提高至48kHz,单次语音合成最长可达3分钟。



目前,Qwen-Audio-3.0-TTS-Plus和Flash版本均已在阿里云百炼开放。



阿里甩出“配音”神器:能调整情绪,还会说方言




Qwen-Audio-3.0-TTS-Plus:








Qwen-Audio-3.0-TTS-Flash:








一、文本里插入标签,模型可调节语气、情绪、呼吸等





细粒度标签控制


是Qwen-Audio-3.0-TTS此次升级的重点之一。用户可以在文本中直接插入结构化标签,嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等这类标记,可以调节


语气、情绪和呼吸


等细节。



官方也给出了相关的案例,在一段飞船事故相关台词前加入[angry]标签后,模型会以愤怒语气合成后续内容。



合成文本:[angry]你们竟然私自切断了主控系统的能源!知不知道防护罩一旦失效,整艘飞船的人都会化为灰烬?这就是你们所谓的‘为了大局’吗!简直是不可理喻!



参考音频:







合成音频:







根据文本提示,模型在生成的音频中加入了愤怒的语气,角色的质问感和紧迫感随台词逐步增强。



此外,用户也可以通过输入指令,要求模型在说话过程中笑出声。



指令:说到一半忍不住扑哧笑出声



合成文本:你说的这个事啊,我都听过好几遍了,扑哧——还是觉得好笑。



合成音频:








二、自由指令控制,可直接用自然语言描述



除结构化标签外,Qwen-Audio-3.0-TTS还支持


Free-style自然语言指令控制


。用户可以直接用自然语言描述角色、情绪、场景和语速,不需要单独调整专业音频参数。



官方给出了下面这几个案例:



指令:你是一位年轻女性小学老师,正在课堂上耐心地给一年级学生复述拼音规则。语速很慢,每一个发音都示范一遍,语调上扬带笑意。



合成文本:我们再来读一次,j、q、x这三个声母后面如果跟着u,那个u上的两点要去掉。你跟老师一起读,j——u——ju。



参考音频:







合成音频:







模型会按照这段指令合成对应的课堂讲解录音。类似方式也可以用于


旁白、角色配音、有声内容和语音助手


等场景。



指令:你是悬疑剧旁白,屏住呼吸把紧张感一层层叠上去。



合成文本:那天夜里下着大雨,林晚一个人坐在书房里。窗外的雷声一阵接一阵,灯光忽明忽暗。她忽然听见楼下传来了脚步声——缓慢、沉重,像是有人在故意压低声响。她屏住呼吸,手指紧紧抓住椅子的扶手。脚步声越来越近,最终停在了书房门口。门把手轻轻地,转动了一下。



合成音频:







从合成效果来看,旁白语速较为急促,营造出明显的紧张感,让人仿佛置身故事场景之中。如果有声小说采用这种能够随情节调整节奏和情绪的配音,听众的沉浸感和代入感也会更强。




三、覆盖16种语言,10种语言字词错误率最低



Qwen-Audio-3.0-TTS-Plus覆盖中文、英语、日语、韩语、德语等16种语言,新增了阿拉伯语、越南语、马来语和菲律宾语。



根据官方公布的CV3-Eval多语种测试结果,目前,Qwen-Audio-3.0-TTS在16种语言的词或字错误率评测中,Qwen-Audio-3.0-TTS系列在


10种语言


中排名第一,其中韩语和马来语的领先幅度较大。



在16种语言的说话人相似度评测中,Qwen-Audio-3.0-TTS-Plus取得


全部16项最优成绩


,Flash版本取得其中


15项第二


。马来语、西班牙语和阿拉伯语的提升较为明显。



阿里甩出“配音”神器:能调整情绪,还会说方言




四、支持20种中文方言,强化韵律和声调训练



中文方言方面,Qwen-Audio-3.0-TTS目前支持广东话、重庆话、东北话、陕西话、上海话、四川话和云南话等


20种方言


。千问称,新模型使用了更多方言数据,并增加了


方言强化训练


阶段,让模型在


韵律、声调与口语表达


上接近母语者,减少通用语音强化学习过程中可能出现的方言特征减弱问题。



用户可以通过自然语言指令指定输出方言。例如,输入“输出上海话”,模型即可根据后续文本合成上海话语音。



指令:



输出上海话:屋里向装修真个是烦人,天天敲墙壁,声音响得来!灰尘落得一塌糊涂,真想快点弄清爽。



合成音频:








五、噪声和混响环境下,仍具备较强声音复刻能力



声音复刻通常需要使用较为清晰的参考录音,但实际获得的音频中可能包含背景噪声或混响。



Qwen-Audio-3.0-TTS加入了真实声学环境仿真训练,将


语音增强能力


用于声音复刻流程。官方称,在参考音频存在较高噪声或混响的情况下,模型可以


过滤部分环境干扰


,并提取说话人的音色。



合成文本:听到这首歌的时候,突然想起很多年前的夏天。



参考音频:







合成音频:








结语:语音合成增强语气、情绪等控制能力



从此次升级来看,Qwen-Audio-3.0-TTS提高了对于语气、情绪、呼吸和角色风格的控制能力。结构化标签适合调节具体位置的表达效果,自然语言指令则能对角色、场景和语速进行整体描述,多语种、方言及复杂声学环境下的声音复刻能力也得到扩展。



随着Plus和Flash版本在阿里云百炼开放,这些能力将进入更多实际应用场景,为旁白、角色配音、有声内容和语音助手提供更多配音方案。