2026-06-24-星期三 · OpenAI

收录于 第 12 期(2026-06-24) · 本期共 11 条

❯ OpenAI 新语音模型 Bidi 1 实测流出,能实时翻译、还能唱歌拟声

电报开局OpenAI 正在开发的新一代语音模型 Bidi 1 多段实测样本流出,能实时翻译、还能唱歌和生成各种拟声。据科技媒体 TestingCatalog,相关代码与界面元素约在 6 月 16 日被发现于 ChatGPT 应用内,模型主打「边说边听、可被打断」的双向设计。

能力细节Bidi 1 的核心是双向(bidirectional)架构——能在用户说话时同时开口并保持倾听,可中途接收打断、即时改口,摆脱当前语音模式「暂停再重启」的生硬卡顿。翻译能力上与 OpenAI 已发布的 GPT-Realtime-Translate 一脉相承,后者可把 70 多种输入语言实时译成 13 种输出语言;创意能力则延续首代高级语音,唱歌、beatbox 都在,但版权处理更严,会直接拒绝翻唱热门歌曲、转而按指定风格原创。目前 Bidi 1 仍未正式发布,多账号互证但口径来自代码挖掘与样本流出,尚属上线前的泄露。

影响落点一旦 Bidi 1 落到 API,最先被打开的是实时翻译这类长期卡在延迟上的场景。对语音应用开发者,要重新评估的是哪些「同声传译」「实时对话」产品此前因延迟做不成、如今能不能补上;对做 AI 语音的对手,被抬高的是「自然打断 + 实时翻译」这套体验门槛。

signal: 把实时翻译从演示推向 API,被重新定义的是「同声传译」这类卡在延迟上的应用边界。