订阅 AI123 精选资讯,每周获取最新动态

立即订阅
返回新闻列表
产品发布
2026-07-21

首包延迟300ms、支持20种方言:通义千问Qwen-Audio-3.0-TTS正式开放

首包延迟300ms、支持20种方言:通义千问Qwen-Audio-3.0-TTS正式开放

核心要点

  • 1.阿里通义千问发布Qwen-Audio-3.0-TTS,实现情感化语音合成
  • 2.Plus版在Speech Arena榜单超越Gemini3.1TTS获全球第一
  • 3.提供Flash和Plus两版本,分别优化实时性与表现力
  • 4.Flash版首包延迟约300ms,适合语音助手、直播等场景

关键数据

首包延迟: 约300ms(Flash版实时交互优化)榜单排名: 全球第一(Plus版在Artificial Analysis Speech Arena榜单上超过Gemini3.1TTS)

影响评估

正面

推动语音合成向情感化、场景化发展,提升AI交互自然度

该模型通过两套方案满足不同场景需求,降低了情感表达门槛,有望在客服、有声书、直播等领域带来体验升级

相关工具

Qwen-Audio-3.0-TTS阿里通义千问推出的语音合成模型Gemini3.1TTS在榜单中被超越的竞争对手
阿里通义千问推出的Qwen-Audio-3.0-TTS语音合成模型,不再只是机械发声,而是能真正“带感情”地表达。其Plus版本在Artificial Analysis Speech Arena榜单上力压Gemini3.1TTS等对手,拿下全球第一。该模型提供了两套方案:Flash版专为实时交互优化,首包延迟低至约300ms,适合语音助手、直播等场景;Plus版则在细腻度与自然度上更胜一筹,适合有声书、客服语音等需要高表现力的应用。挑选时,若追求响应速度选Flash,若在意语音品质选Plus。