2026-07-09-星期四 · OpenAI

收录于 第 27 期(2026-07-09) · 本期共 12 条

❯ OpenAI 上线 GPT-Live 全双工语音模型,可一边听一边说话

电报开局OpenAI 发布新一代语音模型 GPT-Live,采用全双工架构——模型能同时听和说,可在用户讲话时插一句「嗯哼」,不必等对方说完再应答。产品分 GPT-Live-1(Go、Plus、Pro 用户默认)和面向免费用户的 GPT-Live-1 mini 两档,未来几天陆续全量,并提供 API。

旧模式的痛点全双工要解决的是老版语音模式最别扭的地方:过去的高级语音(Advanced Voice Mode)是「一问一答」的半双工,用户说完、模型才开口,中间总有一截延迟,也没法被打断,聊起来不像真人对话。OpenAI 称 GPT-Live 在博士级科学问答基准 GPQA 上大幅超过旧版高级语音,即语音模型的知识和推理不再是「能说话但答不准」的短板。这次升级由专门的语音研发团队在直播中演示发布,配了新的声音样本和随设置强调色变化的动效光球。

谁能接进去语音一旦能自然打断、边听边说,可用的场景就从「语音助手问天气」扩到了实时口译、陪练、客服和陪伴类应用。要重新评估的是做语音 Agent 的产品团队:延迟和打断这两个长期卡住体验的技术点被官方模型抹平后,此前靠拼接多个模型硬做全双工的方案,性价比一下就低了,接下来要看的是他们继续自研还是直接接入 API。

signal: 语音交互的体验瓶颈从「答得准不准」挪到了「像不像真人对话」,全双工把后一半补上了。