2026-05-13 19:58
OpenAI 发布三款实时语音模型,针对推理对话、实时翻译和实时转录
文本核心速览
- 三款实时语音模型发布—OpenAI推出GPT‑Realtime‑2、GPT‑Realtime‑Translate和GPT‑Realtime‑Whisper三款模型,分别针对推理对话、实时翻译和实时转录场景,纳入Realtime API体系。
- GPT‑Realtime‑2具备GPT‑5级推理—该模型支持处理复杂请求、自然对话,可调用工具、处理打断与更正,实现更具连贯性的实时语音交互,定价每100万音频输入Token 32美元、输出64美元。
- GPT‑Realtime‑Translate专注同声传译—支持70多种输入语言和13种输出语言,旨在跟上说话者语速提供接近同声传译的体验,费用为每分钟0.034美元。
- GPT‑Realtime‑Whisper实现低延迟转录—实时流式语音转写模型,专为直播字幕、会议记录等场景设计,延迟极低,价格每分钟0.017美元。
GPT‑Realtime‑2 成了首款自带 GPT‑5 级推理的语音模型
OpenAI 把三款实时语音模型塞进了 Realtime API:GPT‑Realtime‑2、GPT‑Realtime‑Translate 和 GPT‑Realtime‑Whisper。有开发者试了说,GPT‑Realtime‑2 是第一个能在说话的同时做复杂推理的语音模型,用户提问时它直接边听边推理,保持对话连贯性,还能调用工具、处理打断和更正,根据情境给出更贴切的回应。
翻译模型比同传还快
GPT‑Realtime‑Translate 专门做实时翻译,支持 70 多种输入语言 和 13 种输出语言。群里在传,它的设计目标就是尽量跟上说话者语速,实现近乎“同声传译”的效果。跨语言通话、会议或直播场景下,开发者可以用它来打通语言障碍。
转写模型跟嘴同步
GPT‑Realtime‑Whisper 是实时流式语音转写模型,主打低延迟。有开发者试了说,它能在说话者讲话的同时即时完成转录,比之前的老版本快不少。直播字幕实时生成、会议记录跟上讨论节奏,这些场景都能用上。
价格和接入方式
这些模型已纳入 OpenAI 的 Realtime API。具体定价:
- GPT‑Realtime‑2:每 100 万音频输入 Token 32 美元,每 100 万音频输出 Token 64 美元(输出Token比输入贵一倍,适合短促问答场景)。
- GPT‑Realtime‑Translate:每分钟 0.034 美元(约合每小时 2 美元,比专业人工同传便宜得多)。
- GPT‑Realtime‑Whisper:每分钟 0.017 美元(一小时才 1 美元,直播字幕成本几乎可以忽略)。
开发者可以通过 Playground 直接测试,或把已有应用快速集成。
划重点:
- 🔊 GPT‑Realtime‑2 具备高级推理能力,实现更自然的实时对话。
- 🌐 GPT‑Realtime‑Translate 支持多种语言,提供接近同声传译的翻译体验。
- 📝 GPT‑Realtime‑Whisper 实现低延迟转录,适用于直播和会议记录等场景。
接下来盯着看:实时翻译能不能在延迟上干掉人类同传,以及低延迟转写会不会让 Zoom 会议字幕的延迟再降一半——这会让传统语音服务商很难受,而做实时字幕的初创公司直接受益。
来源: aibase阅读原文