OpenAI被曝正筹备发布新一代双向语音模型“GPT-Bidi-1”
- 双向音频模型GPT-Bidi-1—OpenAI被曝正筹备发布双向音频模型GPT-Bidi-1,采用双向架构实现同时聆听与表达,彻底改变传统单工对讲,显著提升实时语音对话的自然度。
- 打断交互体验升级—新模型支持用户插话打断,系统实时捕捉声音并动态调整语义,不再出现卡顿和等待,交互体验如真人聊天般顺畅。
- 产品形态与分级选项—GPT-Bidi-1将与高级语音模式并存,用户可自主切换;首次在语音端引入高、中、即时三种智力与速度分级,满足不同任务需求。
- 多模态战略关键补齐—此次迭代补齐了OpenAI在语音大模型上的推理能力差距,彰显其将语音视为下一代AI核心入口的战略野心,为语音优先硬件布局奠定基础。
OpenAI正偷偷给ChatGPT语音装上“双向脑”,用户能在对话中随时插嘴而不死机
有开发者从Web端和移动端的代码埋点里挖出证据:OpenAI正在筹备一款叫 GPT-Bidi-1 的下一代双向音频模型。这玩意儿不是简单的音质提升,而是让ChatGPT的语音模式从“单工对讲”变成“双工实时啃话”——系统能一边听你说话,一边判断你是否要打断它,然后动态调整自己的输出,不卡顿、不崩溃。群里有人试了早期体验说:“终于不用等它啰嗦完才能插嘴了。”
核心突破:双向架构
GPT-Bidi-1 采用的是 双向(Bidirectional) 架构。过去AI语音对话是“你一句我一句”的排队模式,一旦抢话就会死机或忽略。现在这个模型能同时执行 聆听与表达,实时捕捉用户插话和打断,并在语义层动态调整。一句话:你吼它“停!”,它马上闭嘴并准备接你的新指令。
产品形态变化
消息源透露,新功能上线后不会取代现有的 高级语音模式(Advanced Voice Mode),而是作为独立选项共存。用户可以在设置里手动切换到 “Bidi(最新)” 模式,体验完再切回去。另外,GPT-Bidi-1 在语音端首次引入了三种 智力与速度分级:高(High)、中(Medium)、即时(Instant)。高对应深度推理、回答慢但准;即时几乎无延迟、但可能答得浅。用户可以根据任务自己权衡——比如写代码用高,问天气用即时。
战略信号
OpenAI 的文本大模型已经迭代到了 GPT-5.5,推理能力强了一大截,但语音大模型之前一直落后,导致多模态体验断层。GPT-Bidi-1 的出现就是为了补上这块短板。内部人士听说是把语音视为下一代AI核心入口,为后续的 语音优先(Audio-first)硬件 和 企业级语音工具 铺路。说白了,这不止是一个功能更新,而是把语音对话当作未来交互的主战场。
接下来盯着看什么:苹果和谷歌的语音助手会不会紧急改架构?那些靠单工语音对话吃饭的创业公司,可能得先感受一下什么叫降维打击。