2026-07-30 10:16
OpenAI 发布两款新转录模型,性能远超 Whisper
文本核心速览
- 两款转录模型发布—OpenAI于7月29日推出GPT-Live-Transcribe和GPT-Transcribe模型,通过API开放调用。实时模型定价每分钟0.017美元,批量模型定价每分钟0.0045美元。
- 语义理解能力增强—新模型在Context Aware ASR基准中,接入上下文后语义准确率从41.6%提升至45.2%,能够识别同音异义词和专业术语。
- 错误率较Whisper减半—在Common Voice 22种语言测试中,GPT-Transcribe错误率仅19.27%,而Whisper为40.37%。真实录音9种语言测试中,新模型错误率8.98%,Whisper为15.21%。
- 应用场景广泛—新模型适用于会议转录、实时翻译、语音助手等场景,显著提升在噪声环境、多口音和专业术语下的转录准确性。
OpenAI 发布两款新转录模型:性能碾压 Whisper,语音理解进入新阶段
模型概览
OpenAI 在 7 月 29 日发布了两款全新的转录模型:GPT-Live-Transcribe 和 GPT-Transcribe。它们不再只是简单的语音转文字工具,而是能够理解上下文、口音、术语甚至背景噪音的智能引擎。
- GPT-Live-Transcribe:专为低延迟实时场景设计,适合直播、会议等需要即时转录的场景。价格:每分钟 0.017 美元(约 0.12 元人民币)。
- GPT-Transcribe:面向异步批量处理,适用于处理完成后的音频文件。价格:每分钟 0.0045 美元(约 0.03 元人民币)。
性能提升:语义理解与上下文感知
新模型最核心的改进在于对语境的消化能力。在 Context Aware ASR 基准测试中,GPT-Transcribe 在无上下文时的语义准确率为 41.6%,接入上下文后提升至 45.2%。这意味着模型能够根据对话场景准确识别同音异义词和专业术语。
与 Whisper 的对比:差距悬殊
与 OpenAI 上一代模型 Whisper(whisper-1)相比,新模型取得了显著进步:
- 在 Common Voice 覆盖的 22 种语言中,GPT-Transcribe 的转录错误率仅为 19.27%,而 Whisper 为 40.37%,差距超过一倍。
- 在真实世界录音的 9 种语言基准上,GPT-Transcribe 将错误率压低至 8.98%,Whisper 则为 15.21%。
这些结果表明,新模型在带噪环境、专业术语、多口音场景下的表现远超前代。
行业意义与应用前景
语音交互一直以来受限于环境噪声和语义歧义。新模型的发布意味着机器能够更准确地理解人类语音,尤其在会议转录、实时翻译、语音助手等领域将带来质的提升。OpenAI 通过 API 提供这两款模型,开发者可以轻松集成到自己的应用中。
总结
OpenAI 通过 GPT-Live-Transcribe 和 GPT-Transcribe 展示了语音识别技术的新高度。更低的错误率、更强的上下文处理能力,以及灵活的定价方案,使得这两款模型有望成为行业新标杆。
来源: aibase阅读原文