OpenAI推出GPT-Live全双工语音模型
语音进入全双工
7月9日,OpenAI 推出 GPT-Live,一个基于全双工架构的新一代语音模型。所谓全双工,就是它能一边听一边说,不用像老式对讲机那样等对方把话讲完才能开口。这是语音交互从「半双工轮替」跨到「自然对话」的关键一步。

OpenAI 会出两个版本:GPT-Live-1 和 GPT-Live-1 mini。mini 版通常意味着更低延迟、更便宜、能跑在轻量或端侧场景,主版本则负责对复杂语境和长对话兜底。把两个档位同时摆出来,是 OpenAI 一贯的打法——先证明能力上限,再补一个能规模化的便宜版。
为什么这事值得单列一条?OpenAI 在文本和图像上早已铺满产品线,唯独「实时语音」一直是短板。早年的语音模式靠 ASR 加 LLM 加 TTS 三段拼起来,延迟高,还会在「谁该说话」上卡顿。GPT-Live 把聆听和生成做成同一套流式管道,目标场景很明确:电话客服、语音助理、低延迟陪聊,这些地方半双工根本不够用。
同日 AI 圈不止这一桩。界面新闻的早报里还堆着几条:Meta 计划 9 月开始生产代号「Iris」的自研 AI 芯片,今年先部署 7 吉瓦算力、明年翻倍到 14 吉瓦,并已拉拢三星电子(内存)、闪迪(闪存)、住友电工(光纤)签长期供货;星巴克在用 AI 自研内部工具,打算替换掉微软的库存系统和 IBM 的维护系统;Meta 还宣布投 130 亿加元(约 100 亿美元)在加拿大艾伯塔省建首个数据中心,电力容量 1 吉瓦。算力军备和「去巨头依赖」是同一股劲儿。
往上捋,语音模型的竞争早就不只是「能不能对话」。Google 的 Gemini 实时音视频、各家厂的电话 agent 都在抢「像人一样不打断」的体验。OpenAI 这一步,是把自家最弱的一块补到能打的位置,也为后续把语音塞进更便宜的入口(比如 mini 版进 App、进硬件)铺路。
对做产品的来说,全双工语音意味着交互设计要重想一遍。过去那种「你说完—我转圈—我回答」的节奏可以扔了,新问题是:模型怎么在用户停顿、犹豫、插话时拿捏「该不该接话」。这既是体验红利,也是坑。