返回新闻列表
2026-08-11 09:57

英伟达推首款开源全双工语音模型VoiceChat 11B

英伟达发布首款开源全双工语音模型 VoiceChat 11B

英伟达(NVIDIA)正式推出其首款开源端到端全双工语音对话模型——NemotronLabs VoiceChat 11B。该模型在语音生成与理解的底层架构上实现了重要突破,为实时人工智能语音交互赛道注入了全新活力。

突破传统:告别多模型串联

以往典型的语音对话系统通常采用分步架构,即串联语音识别(ASR)、大语言模型(LLM)和语音合成(TTS)。这种设计存在多模型编排复杂、交接延迟高等问题。

VoiceChat 11B 则采用统一的端到端网络,直接完成流式语音理解与生成,彻底消除了多模型之间的冗余交接,大幅压缩了响应延迟。根据英伟达公布的实测数据,该模型的平滑轮换延迟低至 448 毫秒,能够实现“边听边说”的自然全双工交互。

试想一下:当用户在对话中突然插话,智能体能够迅速让出话语权,展现出极高的交互流畅度。

首创:支持工具调用的全双工模型

一个显著的亮点是,VoiceChat 11B 是首个在对话持续进行时支持工具调用的开源全双工模型。为了实现这一点,它创新性地引入了独立的输出通道与预置的 “保持”话术机制

当系统需要处理复杂的外部 API 请求时,可以通过侧通道自动触发操作员定义的过渡台词,例如:

  • “请稍等,我为您查询一下。”
  • “正在处理您的请求,马上就好。”

这种机制有效避免了等待期间可能出现的长时间静默,让语音智能体的工程化落地变得更加顺畅。

部署门槛与未来展望

不过,从实际部署角度来看,该模型目前仍处于试点阶段,存在一些限制:

  1. 硬件要求高:需要单张至少配备 80GB 显存的高性能 GPU 才能高效运行。
  2. 使用许可:官方将其标注为 “仅限研究用途”,尚未提供成熟的托管 API。
  3. 极端场景局限:在长上下文及多轮对话的极端场景下仍存在一定局限性。

尽管有上述约束,VoiceChat 11B 开放的权重与容器设计,依然为以下领域的开发者提供了全新的探索方向:

  • 联络中心:构建高情商、低延迟的语音机器人。
  • 汽车座舱:实现自然的免提语音交互。
  • 零售点餐:在嘈杂环境中准确识别并响应顾客需求。
  • 智能无障碍辅助:为视障或以语音为优先的用户提供更流畅的服务。

总结

英伟达 VoiceChat 11B 的发布,标志着开源全双工语音模型迈入新的阶段。虽然目前它更偏向研究探索,但其端到端架构和工具调用能力,无疑为下一代语音交互系统奠定了重要基础。未来,随着硬件成本的下降和模型的持续迭代,类似技术有望加速走进真实世界的各类应用场景。

来源: aibase阅读原文

其他新闻

查看全部