阿里巴巴云栖大会升级Qwen-Audio-3.1语音模型家族
9月22日,阿里巴巴在云栖大会上宣布语音模型家族Qwen-Audio-3.1全新升级,覆盖语音转写(ASR)、语音合成(TTS)和实时语音交互(Realtime)三大系列。
基于下一代架构的音频理解模型Qwen-Audio-3.1-ASR-Next全新发布,可理解人物情绪、音乐、环境声与机械声,支持声音描述、事件定位、音频问答与推理,能够理解和回答“这段录音中人的情绪怎样”这类问题。音频创作模型Qwen-Audio-3.1-TTS-Next同步亮相,采用全新架构,可根据一段脚本直接生成融合对白和环境声的完整音频,提升有声书、影视剧和播客等专业内容的制作效率。
Qwen-Audio-3.1-Realtime实时交互能力进一步升级,可实现边听、边想、边说,并增强多语言交互、角色扮演和共情能力。目前,该系列模型已应用于千问办公和Qoder,并接入QwenNote A2随身助理、QwenNote Eva桌面机器人和千问AI眼镜等硬件产品。
此外,同声传译模型Qwen3.8-LiveTranslate首次亮相。人类同传平均时延在4秒以上,该模型可将时延压缩至不到2.5秒,目前已接入千问AI眼镜、QwenNote A2、钉钉耳机等AI硬件。面向手机的AI全栈解决方案Qwen Intelligence也将在大会期间发布,为合作伙伴提供基于千问大模型的Agent技术平台。
- 2026-09-22 11:59 | 新浪财经:阿里云下代语音模型发布,Qwen落地多款智能终端阅读原文
专题:2026云栖大会 新浪科技讯 9月22日上午消息,阿里巴巴在云栖大会上宣布语音模型家族Qwen-Audio-3.1全新升级,包含语音转写(ASR)、语音合成(TTS)和实时语音交互(Realtime)三大系列。 基于下代架构的音频理解模型Qwen-Audio-3.1-ASR-Next全新发布,它能够理解人物情绪、音乐、环境声与机械声,完成声音描述、事件定位、音频问答与推理,让“这段录音中人的情绪怎样”这样的问题能够被...