2026-09-11 15:45
AI123
小米开源语音识别大模型,可在多人对话中精准提取目标说话人
9月11日,小米技术宣布正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1。该模型旨在解决语音识别领域的“鸡尾酒会问题”——当多人同时说话时,传统语音识别准确率会显著下降。
Xiaomi-CocktailASR-1 采用端到端大语言模型架构,以目标说话人的一段参考音频作为声纹提示,能够在多人同时说话的复杂环境中精准提取并仅转录目标用户的语音。官方数据显示,该模型在多个主流多说话人测试集上均达到 SOTA,明显优于现有方案。
除多人场景外,Xiaomi-CocktailASR-1 在单人识别场景下性能也可比肩标准语音识别模型,能够无缝兼顾日常使用。同时,模型具备拒识非目标说话人干扰语音的能力,当目标说话人不在场时输出空文本,有效避免误触发。此外,模型还支持思维链推理模式,可为识别结果提供可解释的推理过程。
目前,小米已将该模型开源,相关代码与模型权重已上架 GitHub 和 Hugging Face,供开发者下载使用。
来源
- 2026-09-11 14:51 | IT之家:小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1阅读原文
IT之家 9 月 11 日消息,小米技术今日发文宣布,小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1。官方表示,Xiaomi-CocktailASR-1 旨在解决“鸡尾酒会”难题(IT之家注:当前语音识别技术已经可以以较高精度识别一个人所讲的话,但是当说话的人数为两人或者多人时,语音识别率就会极大地降低,这一难题被称为鸡尾酒会问题)。该模型采用端到端 LLM 架构,以目标说话人的一段参考音频作为声纹提示,可在多人同时说话的复杂环境中,精准提取并仅转录目标用户的语音。在多个主流多说话人测试集上均达到 SOTA,大幅领先现有方案。同时,其单人识别性能比肩...