Meta发布流式语音转写AI模型Muse Voice Transcribe,支持20余名说话者分轨
9月1日,Meta推出其首个实时音频感知模型Muse Voice Transcribe。开发者可通过Meta Model API调用该模型,定价为每1000分钟音频3美元(约合20.2元人民币),相当于每小时0.18美元。
该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测。用户说话时,系统可同步输出文字,无需等待完整录音结束再单独处理。Muse Voice Transcribe可在包含20余名说话者的录音中区分不同发言者,并识别说话是否结束,自动确定输入边界。
模型训练覆盖70余种语言,其中25种语言在发布时完成验证。它支持长度超过1小时的音频,以及句内或句间的自然语言切换。开发者可通过语言、关键词和上下文偏置,提升特定语言、术语或场景下的识别效果。
技术层面,Meta引入自适应延迟机制,不为所有词语采用固定速度与准确度取舍,而是针对每个词判断需要额外接收多少音频后再输出结果。对于容易识别的语音,系统更快提交转写结果;对于发音不清、术语较多或语境复杂的词语,则调用更多前后文音频信息。Meta表示,截至2026年9月1日,Muse Voice Transcribe位列Artificial Analysis流式语音转文本排行榜第1名。
- 2026-09-02 11:07 | 新浪:新浪AI热点小时报丨2026年09月02日11时_今日实时AI热点速递阅读原文
1、对话灵境智源创始人孙博:做具身智能有三个难点 文|智客星球 陈思竹今年的世界机器人大会(WRC)上,除了各种机器人轮番展示落地场景外,“机器人大脑”这一概念也在会场中被反复提起。在主论坛上,“如何开发机器人大脑”成为各家厂商难以绕过的话题。对于“机器人大脑”行业内尚未形成统一定义。有人将其等同于大模型的端侧部署,有人理解为运动控制与感知算法的集成,也有人把它拆成“大脑决策 + 小脑控制”的分层架构。在这场关于“智脑”的定义中,灵境智源也打出了自己的牌。创始人孙博认为,具身智能有三个难点:智能化、操作和能源。“这些难点延伸到三个核心零部件的话,就是智脑、灵巧手和电池。 http://fi...
- 2026-09-02 08:23 | IT之家:Meta 发布首个实时音频感知 AI 模型,支持 20 余人分轨转写阅读原文
IT之家 9 月 2 日消息,科技媒体 9to5Mac 昨日(9 月 1 日)发布博文,报道称 Meta 公司推出 Muse Voice Transcribe,这是其首个实时音频感知模型。开发者可通过 Meta Model API 调用该能力,定价为每 1000 分钟音频 3 美元(现汇率约合 20.2 元人民币),等同每小时 0.18 美元(现汇率约合 1.2 元人民币)。该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。IT之家注:“流式”就是边说边转写,模型不必等整段音频说完才出结果,而是会一小段一小段持续输出...