阿里甩出“配音”神器:能调整情绪,还会说方言

智东西(公众号:zhidxcom)
作者 | 杨京丽
编辑 | 李水青
智东西7月20日报道,今天,千问大模型发布语音合成大模型Qwen-Audio-3.0-TTS,包含面向实时交互的
Flash版本(首包延时300ms级别)和面向高质量生成的
Plus版本
。
模型在
细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性
等方面实现系统性提升。目前,Qwen-Audio-3.0-TTS-Plus在第三方评测机构Artificial Analysis的Speech Arena语音合成榜单中
居于第一
,Elo得分为1237。

▲Qwen-Audio-3.0-TTS-Plus在语音合成榜单中排名第一(图源:Artificial Analysis)
阿里还将陆续上线指令风格音色、20种方言音色、细粒度控制音色及14种以上小语种音色,供开发者直接调用。在输出规格方面,Qwen-Audio-3.0-TTS将音频采样率从24kHz提高至48kHz,单次语音合成最长可达3分钟。
目前,Qwen-Audio-3.0-TTS-Plus和Flash版本均已在阿里云百炼开放。

Qwen-Audio-3.0-TTS-Plus:
Qwen-Audio-3.0-TTS-Flash:
一、文本里插入标签,模型可调节语气、情绪、呼吸等
细粒度标签控制
是Qwen-Audio-3.0-TTS此次升级的重点之一。用户可以在文本中直接插入结构化标签,嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等这类标记,可以调节
语气、情绪和呼吸
等细节。
官方也给出了相关的案例,在一段飞船事故相关台词前加入[angry]标签后,模型会以愤怒语气合成后续内容。
合成文本:[angry]你们竟然私自切断了主控系统的能源!知不知道防护罩一旦失效,整艘飞船的人都会化为灰烬?这就是你们所谓的‘为了大局’吗!简直是不可理喻!
参考音频:
合成音频:
根据文本提示,模型在生成的音频中加入了愤怒的语气,角色的质问感和紧迫感随台词逐步增强。
此外,用户也可以通过输入指令,要求模型在说话过程中笑出声。
指令:说到一半忍不住扑哧笑出声
合成文本:你说的这个事啊,我都听过好几遍了,扑哧——还是觉得好笑。
合成音频:
二、自由指令控制,可直接用自然语言描述
除结构化标签外,Qwen-Audio-3.0-TTS还支持
Free-style自然语言指令控制
。用户可以直接用自然语言描述角色、情绪、场景和语速,不需要单独调整专业音频参数。
官方给出了下面这几个案例:
指令:你是一位年轻女性小学老师,正在课堂上耐心地给一年级学生复述拼音规则。语速很慢,每一个发音都示范一遍,语调上扬带笑意。
合成文本:我们再来读一次,j、q、x这三个声母后面如果跟着u,那个u上的两点要去掉。你跟老师一起读,j——u——ju。
参考音频:
合成音频:
模型会按照这段指令合成对应的课堂讲解录音。类似方式也可以用于
旁白、角色配音、有声内容和语音助手
等场景。
指令:你是悬疑剧旁白,屏住呼吸把紧张感一层层叠上去。
合成文本:那天夜里下着大雨,林晚一个人坐在书房里。窗外的雷声一阵接一阵,灯光忽明忽暗。她忽然听见楼下传来了脚步声——缓慢、沉重,像是有人在故意压低声响。她屏住呼吸,手指紧紧抓住椅子的扶手。脚步声越来越近,最终停在了书房门口。门把手轻轻地,转动了一下。
合成音频:
从合成效果来看,旁白语速较为急促,营造出明显的紧张感,让人仿佛置身故事场景之中。如果有声小说采用这种能够随情节调整节奏和情绪的配音,听众的沉浸感和代入感也会更强。
三、覆盖16种语言,10种语言字词错误率最低
Qwen-Audio-3.0-TTS-Plus覆盖中文、英语、日语、韩语、德语等16种语言,新增了阿拉伯语、越南语、马来语和菲律宾语。
根据官方公布的CV3-Eval多语种测试结果,目前,Qwen-Audio-3.0-TTS在16种语言的词或字错误率评测中,Qwen-Audio-3.0-TTS系列在
10种语言
中排名第一,其中韩语和马来语的领先幅度较大。
在16种语言的说话人相似度评测中,Qwen-Audio-3.0-TTS-Plus取得
全部16项最优成绩
,Flash版本取得其中
15项第二
。马来语、西班牙语和阿拉伯语的提升较为明显。

四、支持20种中文方言,强化韵律和声调训练
中文方言方面,Qwen-Audio-3.0-TTS目前支持广东话、重庆话、东北话、陕西话、上海话、四川话和云南话等
20种方言
。千问称,新模型使用了更多方言数据,并增加了
方言强化训练
阶段,让模型在
韵律、声调与口语表达
上接近母语者,减少通用语音强化学习过程中可能出现的方言特征减弱问题。
用户可以通过自然语言指令指定输出方言。例如,输入“输出上海话”,模型即可根据后续文本合成上海话语音。
指令:
输出上海话:屋里向装修真个是烦人,天天敲墙壁,声音响得来!灰尘落得一塌糊涂,真想快点弄清爽。
合成音频:
五、噪声和混响环境下,仍具备较强声音复刻能力
声音复刻通常需要使用较为清晰的参考录音,但实际获得的音频中可能包含背景噪声或混响。
Qwen-Audio-3.0-TTS加入了真实声学环境仿真训练,将
语音增强能力
用于声音复刻流程。官方称,在参考音频存在较高噪声或混响的情况下,模型可以
过滤部分环境干扰
,并提取说话人的音色。
合成文本:听到这首歌的时候,突然想起很多年前的夏天。
参考音频:
合成音频:
结语:语音合成增强语气、情绪等控制能力
从此次升级来看,Qwen-Audio-3.0-TTS提高了对于语气、情绪、呼吸和角色风格的控制能力。结构化标签适合调节具体位置的表达效果,自然语言指令则能对角色、场景和语速进行整体描述,多语种、方言及复杂声学环境下的声音复刻能力也得到扩展。
随着Plus和Flash版本在阿里云百炼开放,这些能力将进入更多实际应用场景,为旁白、角色配音、有声内容和语音助手提供更多配音方案。
