产品发布
2026-07-21
首包延迟300ms、支持20种方言:通义千问Qwen-Audio-3.0-TTS正式开放

核心要点
- 1.阿里通义千问发布Qwen-Audio-3.0-TTS,实现情感化语音合成
- 2.Plus版在Speech Arena榜单超越Gemini3.1TTS获全球第一
- 3.提供Flash和Plus两版本,分别优化实时性与表现力
- 4.Flash版首包延迟约300ms,适合语音助手、直播等场景
关键数据
首包延迟: 约300ms(Flash版实时交互优化)榜单排名: 全球第一(Plus版在Artificial Analysis Speech Arena榜单上超过Gemini3.1TTS)
影响评估
正面
推动语音合成向情感化、场景化发展,提升AI交互自然度
该模型通过两套方案满足不同场景需求,降低了情感表达门槛,有望在客服、有声书、直播等领域带来体验升级
相关工具
Qwen-Audio-3.0-TTS— 阿里通义千问推出的语音合成模型Gemini3.1TTS— 在榜单中被超越的竞争对手
阿里通义千问推出的Qwen-Audio-3.0-TTS语音合成模型,不再只是机械发声,而是能真正“带感情”地表达。其Plus版本在Artificial Analysis Speech Arena榜单上力压Gemini3.1TTS等对手,拿下全球第一。该模型提供了两套方案:Flash版专为实时交互优化,首包延迟低至约300ms,适合语音助手、直播等场景;Plus版则在细腻度与自然度上更胜一筹,适合有声书、客服语音等需要高表现力的应用。挑选时,若追求响应速度选Flash,若在意语音品质选Plus。