返回新闻列表
2026-05-13 19:58

​OpenAI 发布三款实时语音模型,针对推理对话、实时翻译和实时转录

文本核心速览
  1. 三款实时语音模型发布OpenAI推出GPT‑Realtime‑2、GPT‑Realtime‑Translate和GPT‑Realtime‑Whisper三款模型,分别针对推理对话、实时翻译和实时转录场景,纳入Realtime API体系。
  2. GPT‑Realtime‑2具备GPT‑5级推理该模型支持处理复杂请求、自然对话,可调用工具、处理打断与更正,实现更具连贯性的实时语音交互,定价每100万音频输入Token 32美元、输出64美元。
  3. GPT‑Realtime‑Translate专注同声传译支持70多种输入语言和13种输出语言,旨在跟上说话者语速提供接近同声传译的体验,费用为每分钟0.034美元。
  4. GPT‑Realtime‑Whisper实现低延迟转录实时流式语音转写模型,专为直播字幕、会议记录等场景设计,延迟极低,价格每分钟0.017美元。

GPT‑Realtime‑2 成了首款自带 GPT‑5 级推理的语音模型

OpenAI 把三款实时语音模型塞进了 Realtime API:GPT‑Realtime‑2GPT‑Realtime‑TranslateGPT‑Realtime‑Whisper。有开发者试了说,GPT‑Realtime‑2 是第一个能在说话的同时做复杂推理的语音模型,用户提问时它直接边听边推理,保持对话连贯性,还能调用工具、处理打断和更正,根据情境给出更贴切的回应。

翻译模型比同传还快

GPT‑Realtime‑Translate 专门做实时翻译,支持 70 多种输入语言13 种输出语言。群里在传,它的设计目标就是尽量跟上说话者语速,实现近乎“同声传译”的效果。跨语言通话、会议或直播场景下,开发者可以用它来打通语言障碍。

转写模型跟嘴同步

GPT‑Realtime‑Whisper 是实时流式语音转写模型,主打低延迟。有开发者试了说,它能在说话者讲话的同时即时完成转录,比之前的老版本快不少。直播字幕实时生成、会议记录跟上讨论节奏,这些场景都能用上。

价格和接入方式

这些模型已纳入 OpenAI 的 Realtime API。具体定价:

  • GPT‑Realtime‑2:每 100 万音频输入 Token 32 美元,每 100 万音频输出 Token 64 美元(输出Token比输入贵一倍,适合短促问答场景)。
  • GPT‑Realtime‑Translate:每分钟 0.034 美元(约合每小时 2 美元,比专业人工同传便宜得多)。
  • GPT‑Realtime‑Whisper:每分钟 0.017 美元(一小时才 1 美元,直播字幕成本几乎可以忽略)。

开发者可以通过 Playground 直接测试,或把已有应用快速集成。

划重点:

  • 🔊 GPT‑Realtime‑2 具备高级推理能力,实现更自然的实时对话。
  • 🌐 GPT‑Realtime‑Translate 支持多种语言,提供接近同声传译的翻译体验。
  • 📝 GPT‑Realtime‑Whisper 实现低延迟转录,适用于直播和会议记录等场景。

接下来盯着看:实时翻译能不能在延迟上干掉人类同传,以及低延迟转写会不会让 Zoom 会议字幕的延迟再降一半——这会让传统语音服务商很难受,而做实时字幕的初创公司直接受益。

来源: aibase阅读原文

其他新闻

查看全部