阶跃发布StepAudio 3系列语音模型,多款产品登顶全球评测榜单
2026年9月15日,阶跃正式发布StepAudio 3系列语音模型,包括StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型,目前均已上线阶跃星辰开放平台。
据官方介绍,该系列分别覆盖真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作等场景。其中,多款模型在Artificial Analysis榜单中位列全球第一:StepAudio 3 Realtime以98.9%的综合得分排名Conversational Dynamics榜单全球第一,并以99.7%的语音推理准确率位列Speech Reasoning榜单全球第一;StepAudio 3 ASR在非流式语音识别准确性榜单中,词错误率仅1.7%,并列全球第一。
StepAudio 3 Realtime支持原生全双工实时对话,能边听边理解、判断对话节奏,并支持推理与语音生成并行,Tool Call和长任务可异步执行。StepAudio 3 ASR结合大语言模型的上下文理解能力,支持中文、英文、方言、中英混说及专业领域识别。StepAudio 3 TTS面向实时交互场景,可还原笑声、迟疑、改口等副语言表现。StepAudio 3 Gen基于自然语言描述统一生成人声、音效、环境音和背景音乐。StepAudio 3 Music支持从零生成及基于ABC记谱法的多轮交互创作。
- 2026-09-15 15:45 | IT之家:阶跃发布 StepAudio 3 系列语音大模型,拿下多个全球第一阅读原文
IT之家 9 月 15 日消息,今日阶跃正式发布 StepAudio3 系列模型,包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music,其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型,目前均已上线阶跃星辰开放平台。官方称,StepAudio 3 系列分别面向几类核心场景:真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。IT之家附模型官方详细介绍如下:StepAudio 3 Realtime:不仅“能打断”,更能理解、...