2026-07-21 09:02
首包延迟300ms、支持20种方言:通义千问Qwen-Audio-3.0-TTS正式开放
文本核心速览
- Plus版全球第一—阿里通义千问发布Qwen-Audio-3.0-TTS,其Plus版本在Artificial Analysis Speech Arena榜单上超越Gemini3.1TTS等对手,综合表现位列全球第一。
- Flash版低延迟300ms—Flash版专为实时交互优化,首包延迟约300ms,适合语音助手、直播等低延时场景;Plus版则更注重音色自然度和细腻度,适用于有声书、客服语音等。
- 多语种与方言覆盖—模型支持16种语言,Plus版平均说话人相似度达82.75;同时支持20种中文方言,解决方言表达弱化问题,更贴近母语者。
- 自然语言指令与标签控制—支持Free-style自然语言指令,如“温柔客服语气”;并提供[gasp]、[angry]等细粒度标签,精准调控呼吸、笑声等非语言细节。
阿里通义千问Qwen-Audio-3.0-TTS Plus版在Speech Arena全球第一,Flash版首包延迟300ms
阿里通义千问团队的新模型Qwen-Audio-3.0-TTS,让语音合成从“能说话”一下子蹦到“会表达”——有开发者发现,它的Plus版本在Artificial Analysis的Speech Arena榜单上把Gemini3.1TTS、ElevenLabs v3等主流模型全压了下去,拿了全球第一。
双版本分工
这次放出的有两个版本:Flash版主打实时交互,首包延迟大概300ms(就是速度快到基本感觉不到停顿),适合做智能助手那种低延时场景;Plus版则专攻高质量生成,自然度和音色还原度更好(群里有人试了说,听感确实更接近真人)。
四大狠活
群里在传这个模型有四个硬核能力:
- 多语种与方言覆盖升级——支持16种语言,Plus版在全部16种语言上的平均说话人相似度达到82.75(满分100,这个分数在行业里排第一);同时还能说20种中文方言,不像别的方言模型那样越来越像普通话,而是更贴近母语者。
- Free-style自然语言指令——你不需要懂专业标注,直接说“用温柔客服语气”或者“带货主播风格”,它就能给你生成对应的语音(有开发者试了说,连“阴阳怪气”都能模仿,很准)。
- 细粒度标签控制——比如你在文本里加
[gasp](喘气)或[angry](生气)这种标签,它能精确控制呼吸、笑声这些小细节,适合做游戏、有声书。 - 复杂声学鲁棒性强——就算你给的参考音频有很高的噪音和混响,它也能自动过滤掉杂音、保留住原始音色,合成质量照样稳定(开发者反馈说,录音环境差也不怕)。
音色库与开放时间
还配了一套精品音色库,覆盖指令、方言、小语种等多种音色,支持48K高清音频输出(预计7月24日才能用,现在还没开放),单次合成最多能处理3分钟的长文本。
现在模型已经在阿里云百炼平台开放了,开发者可以直接去试用。接下来可以盯着看,其他大厂会不会也跟进自然语言指令控制这种玩法——这会让那些收费的语音合成服务商(比如ElevenLabs)挺难受的,因为阿里这个不仅免费还更灵活。
来源: aibase阅读原文