OpenAI 推 GPT-Live 全双工语音,聊天不再你一句我一句

语音交互终于能「同时说和听」

2026-07-22 09:57

OpenAI 最近放出 GPT-Live,一款重新定义人机语音交互的模型。过去我们用语音助手,模式很笨:你说完,停下来,等它回,再接着说。GPT-Live 打破了这个回合制,它支持 全双工通信——模型可以一边听一边说,你能自然插话,它也会用「嗯」「明白了」这类语气词表示在听,你思考时它还会耐心等着。

AI 日报每日速览
AI 日报每日速览

模型分两个版本。GPT-Live-1 面向 Go、Plus 和 Pro 订阅用户,GPT-Live-1 mini 面向免费用户,两者正在网页、iOS 和安卓上全球推送。OpenAI 透露,每周使用 ChatGPT 语音功能的用户已经超过 1.5 亿,这意味着这可能是本月份最受关注的消费级 AI 产品发布。

架构上的差别才是关键。GPT-Live 不是把一个语音界面硬套在文本模型上,而是从零开始设计的流式模型:它持续处理输入、持续生成输出,每秒能做好几次「该说、该听、该停、该打断,还是该调工具」的判断,底层跑着 GPT-5.5 来做复杂推理。这让实时翻译、通勤时的免提助手、对话式辅导都变得自然得多。

真正有意思的是它对「实时」的重新定义。传统语音助手像对讲机,按下说、松开听;GPT-Live 则像和人面对面聊天,双方的信息流是同时流动的。这种看似细微的改变,其实绕开了过去语音 AI 最大的尴尬:那种明显的机械感和延迟感。

OpenAI 的 Atty Eleti 说得很直白:未来人们会通过语音,去打理那些越来越复杂、耗时、且需要智能体自主完成的任务。OpenAI 押注的下一个主入口是语音,而不是文字。看得出来,这家公司正在把交互的重心,从键盘悄悄挪向嘴巴。

把这件事放进行业里看,语音正在从「附属功能」变成「主战场」。当模型能像人一样自然对话,很多原本需要打字和点击的场景,会被一句话接管。对普通用户来说,最实在的变化或许是:以后再也不用对着手机一顿戳,开口就能把事办了。从 Siri 到 GPT-Live,苹果和 OpenAI 在语音入口上的代差,正被实时全双工这一刀拉开。谁先把「开口办事」变成肌肉记忆,谁就握住了下一代人机交互的遥控器。