微软首款自研全双工 AI 语音模型曝光:听说并行,16 种语言自由切换
- 全双工交互突破—微软推出首款全双工AI语音模型MAI Realtime,支持听说并行、用户可随时插话,颠覆传统轮次交替模式。
- 16种语言与自动切换—模型覆盖中、英、日、韩、法、德、阿等16种语言,支持对话中自动检测并切换语言,无需手动指定。
- 两种自然语音风格—测试版提供Victoria和Grant两种语音,比Copilot当前语音更自然,接近真人韵律,但不支持唱歌或非语音音效。
- 合作伙伴测试已开放—微软已邀请部分合作伙伴在MAI Playground平台测试,但上线Microsoft Foundry或扩展至Copilot语音功能时间未定。
微软首款全双工 AI 语音模型 MAI Realtime 曝光
打破传统语音交互的“轮次交替”
在人工智能语音领域,我们早已习惯了“用户说完、模型再答”的交互方式。这种方式虽然稳定,却与真实人类对话的节奏相距甚远。如今,微软正在测试其首款原生实时语音模型 MAI Realtime,试图颠覆这一模式。
据科技媒体 TestingCatalog 报道,MAI Realtime 支持 16 种语言、2 种语音风格,可在对话中实现听说并行,并支持自动识别和中途切换语言。
换句话说,用户无需等待 AI 说完才能开口,而是可以像与真人交谈一样随时打断、补充或转换话题。这种交互体验将无限逼近真实对话。
全双工技术如何实现?
MAI Realtime 采用双向、全双工交互方式,打破了传统语音助手“用户说完、模型再答”的轮次交替模式。系统依靠端点检测技术识别说话的开始、停顿和结束,当用户中途插话时,模型能够即时调整输出,实现同步聆听与回应。
这一技术的关键在于“同时处理输入和输出”。在传统半双工模式中,模型要么在听,要么在说,无法同时进行。而全双工模式则要求模型在生成语音的同时持续分析用户的语音输入,这对语义理解、上下文跟踪和语音合成都提出了更高要求。
MAI Realtime 核心特性
- 全双工交互:支持听说并行,用户可随时插话。
- 16 种语言:覆盖中、英、日、韩、法、德、阿等。
- 自动语言切换:对话中自动检测并切换语言。
- 两种语音风格:Victoria 和 Grant,自然度更高。
- 调试面板:实时显示延迟、思考内容和处理步骤。
16 种语言与两种语音风格
在语言覆盖上,MAI Realtime 支持中文、英语、日语、韩语、法语、德语、阿拉伯语等 16 种语言。用户可主动指定对话语言,也可启用自动检测功能,模型能够在对话过程中自动识别并切换语言。
语音风格方面,测试版本提供了 Victoria 和 Grant 两种声音。据测试者反馈,这两种声音比 Copilot 当前的语音模式更加自然,更接近真人说话的韵律和语调。
不过,该模型的定位仍是对话系统,不支持唱歌或生成非语音音效。调试面板可实时显示延迟数据、模型思考内容和处理步骤,方便开发者优化体验。
从单向模型到双向交互的跨越
值得注意的是,MAI Realtime 并非微软 MAI 语音模型家族的第一款产品。此前,微软已发布过 MAI-Voice-2 和 MAI-Transcribe-1.5,但这两款模型分别只能完成语音合成或语音识别的单向任务。MAI Realtime 的出现,标志着微软语音模型从“单工”迈向“全双工”,这是关键性的一步。
测试计划与未来展望
目前,微软已邀请部分合作伙伴在 MAI Playground 平台进行测试。但何时上线 Microsoft Foundry、何时扩展至 Copilot 语音功能,尚无明确时间表。样本分享功能有望在测试范围扩大后向更多平台用户开放。
从单向到全双工,从轮次交替到同步对话,微软正在用 MAI Realtime 向业界宣告——AI 语音交互的“对讲机时代”或将成为过去式。未来,无论是智能助手、实时翻译,还是虚拟人互动,全双工语音模型都将成为基础设施。