小米技术宣布正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,该模型采用端到端 LLM 架构,以参考音频作为声纹提示,可在多人同时说话环境中精准提取目标用户语音,在多个主流多说话人测试集上达到 SOTA,并支持思维链推理模式。