OpenAI推出GPT-Live全雙工語音模型

語音進入全雙工

2026-07-10 23:27

7月9日,OpenAI 推出 GPT-Live,一個基於全雙工架構的新一代語音模型。所謂全雙工,就是它能一邊聽一邊說,不用像老式對講機那樣等對方把話講完才能開口。這是語音互動從「半雙工輪替」跨到「自然對話」的關鍵一步。

OpenAI推出GPT-Live全雙工語音模型
OpenAI推出GPT-Live全雙工語音模型

OpenAI 會出兩個版本:GPT-Live-1 和 GPT-Live-1 mini。mini 版通常意味著更低延遲、更便宜、能跑在輕量或端側場景,主版本則負責對複雜語境和長對話兜底。把兩個檔位同時擺出來,是 OpenAI 一貫的打法——先證明能力上限,再補一個能規模化的便宜版。

為什麼這事值得單列一條?OpenAI 在文字和影象上早已鋪滿產品線,唯獨「實時語音」一直是短板。早年的語音模式靠 ASR 加 LLM 加 TTS 三段拼起來,延遲高,還會在「誰該說話」上卡頓。GPT-Live 把聆聽和生成做成同一套流式管道,目標場景很明確:電話客服、語音助理、低延遲陪聊,這些地方半雙工根本不夠用。

同日 AI 圈不止這一樁。介面新聞的早報裡還堆著幾條:Meta 計劃 9 月開始生產代號「Iris」的自研 AI 晶片,今年先部署 7 吉瓦算力、明年翻倍到 14 吉瓦,並已拉攏三星電子(記憶體)、閃迪(快閃記憶體)、住友電工(光纖)籤長期供貨;星巴克在用 AI 自研內部工具,打算替換掉微軟的庫存系統和 IBM 的維護系統;Meta 還宣佈投 130 億加元(約 100 億美元)在加拿大艾伯塔省建首個資料中心,電力容量 1 吉瓦。算力軍備和「去巨頭依賴」是同一股勁兒。

往上捋,語音模型的競爭早就不只是「能不能對話」。Google 的 Gemini 實時音影片、各家廠的電話 agent 都在搶「像人一樣不打斷」的體驗。OpenAI 這一步,是把自家最弱的一塊補到能打的位置,也為後續把語音塞進更便宜的入口(比如 mini 版進 App、進硬體)鋪路。

對做產品的來說,全雙工語音意味著互動設計要重想一遍。過去那種「你說完—我轉圈—我回答」的節奏可以扔了,新問題是:模型怎麼在使用者停頓、猶豫、插話時拿捏「該不該接話」。這既是體驗紅利,也是坑。