返回新闻列表
2026-07-22 09:04

千问甩出语音合成大模型Qwen-Audio-3.0-TTS:自然语言直接指挥,实时版首包延迟压进 300 毫秒

文章提及的 AI 工具千问Udio
文本核心速览
  1. 自由风格自然语言控制Qwen-Audio-3.0-TTS 主打Free-style自然语言指令控制,用户仅需日常语言描述语气、节奏和风格,无需调整工程参数,极大简化语音合成操作门槛。
  2. Flash版:300毫秒首包延迟面向实时交互的Flash版本将首包延迟压缩至300毫秒级别,语音响应几乎无停顿,适合实时问答、语音助手等对延迟敏感的现场场景。
  3. Plus版:高质量细腻音质面向高质量生成的Plus版本专注音质与表现力,主攻有声书、配音、内容创作等需要细腻声音质感的任务,满足高品质需求。
  4. 双版本覆盖快与好一条产品线同时覆盖Flash(低延迟)和Plus(高质量)两个版本,平衡实时交互与精细表现力,满足原本相互拉扯的不同需求曲线。

千问Qwen-Audio-3.0-TTS:自然语言指令直接控制语音合成,首包延迟压到300毫秒

7月20日,千问上线语音合成大模型Qwen-Audio-3.0-TTS,用户用一句日常语言就能指定语气、节奏和风格,不再需要去后台调一堆工程参数。

自然语言指令控制

这款新模型最鲜明的标签是Free-style自然语言指令控制。过去要让AI念出某种语气、节奏或风格,往往得在后台调一堆工程参数;如今用户只需用日常语言描述想要的效果,模型就能照着指令把声音合成出来,门槛被大幅削平。

两个版本覆盖快与好

有开发者在群里试了说,千问为不同场景准备了两副面孔。面向实时交互的Flash版本,把首包延迟压到了300毫秒级别,这个量级意味着对话里的语音响应几乎感觉不到停顿,足够撑起实时问答、语音助手这类对延迟极度敏感的现场;面向高质量生成的Plus版本,则把火力集中在音质与表现力上,主攻有声书、配音、内容创作等需要细腻声音质感的任务。一条产品线,同时覆盖了快和好两条原本相互拉扯的需求曲线。

当自然语言成了控制语音的遥控器,千问这一步,把语音合成从工程活儿又往普通人的工具箱里推进了一格。

接下来盯着看:其他厂商会不会快速跟进自然语言控制语音合成,以及千问这个模型在真实对话场景中能否真正替代传统TTS——毕竟延迟300毫秒只是实验室数据,实际网络抖动下还能不能撑住。

来源: aibase阅读原文

其他新闻

查看全部