深度報告
-
GPT-Live 是 OpenAI 於 2026 年 7 月 8 日釋出的新一代語音模型,用於驅動 ChatGPT Voice 的全部語音對話體驗。它從底層改用「全雙工架構」,讓 AI 可以同時聽和說,對話不再是回合制。付費使用者預設使用完整版 GPT-Live-1,免費使用者使用輕量版 GPT-Live-1 mini。官方稱,每週有超過 1.5 億人透過語音或聽寫功能與 ChatGPT 交談,這次升級是這批使用者最直接的體驗躍遷。
-
OpenAI 的語音路線走過三代。最早的級聯語音系統(Standard Voice)把語音拆成「轉寫—推理—合成」三個模型串起來,資訊在環節間流失,響應慢而僵硬。2024 年的 Advanced Voice Mode(高階語音模式)改用單一端到端模型處理音訊流,延遲大幅下降,但它仍是回合制——靠檢測靜音來判斷使用者是否說完,一旦你停頓或背景有噪音,它就容易誤判並搶話。GPT-Live 要解決的就是這個「對講機」式互動。它並非一個獨立 App,而是 ChatGPT 所有能力的新語音入口;真正乾重活的推理仍交給後臺前沿模型,釋出時掛的是 GPT-5.5。
-
最核心的變化是「連續互動」。全雙工架構讓模型在生成語音的同時持續聆聽,每秒做多次決策:現在該說話、繼續聽、停頓、打斷還是呼叫工具。於是你插話時它能立刻停、你卡殼時它會安靜等待、它還會用「嗯嗯」「明白了」這類墊話讓你知道它跟上了。OpenAI 還重新混音了 ChatGPT 內建的九種聲音,讓每種音色更有辨識度。 第二項架構變化是「委派」。當你的問題需要搜網頁、深度推理或多步任務時,GPT-Live 把活兒甩給後臺的 GPT-5.5,前臺繼續陪你聊,結果算完再自然接回對話。你還能在語音介面右側滑塊裡選推理強度:Instant 極速、Medium 均衡、High 最優。 除此之外,GPT-Live 新增了實時語音翻譯(口述一句外語,AI 無延遲翻成另一種),並在談天氣、股票、賽事時彈出視覺化卡片;語音依舊支援搜尋、記憶、圖片與檔案上傳。需要影片或螢幕共享時,仍可切回舊版高階語音模式。
-
GPT-Live 本身不是一個單獨售賣的產品,而是 ChatGPT 既有訂閱體系內的能力升級。Go、Plus、Pro 使用者預設獲得滿血版 GPT-Live-1,免費使用者拿到 GPT-Live-1 mini。可用性隨地區與套餐分批灰度,釋出初期 Live 不向 Business、Enterprise、Edu 工作空間開放。換句話說,這是一次「存量使用者的體驗增值」,不創造新收費點,但透過把語音做成更強的入口,鞏固了 ChatGPT 作為日常助手的黏性。
-
正面反饋集中在「自然度」。不少重度語音使用者表示,打斷、輪番接話、自然停頓都明顯優於上一代,陪伴感強。在 OpenAI 自己做的 5 到 10 分鐘真人盲測裡,GPT-Live-1 整體偏好率 75.7%,mini 也達 69.2%,均大幅甩開 Advanced Voice Mode 的 50% 打平線;流暢度與愉悅度 7 分制評分中,GPT-Live-1(4.96/5.19)壓過上代(3.80/3.82)。 負面聲音同樣突出。最大的槽點是「過度熱情」:AI 頻繁用「嗯嗯」「對啊」墊話,本意是給心理安全感,實際卻顯得囉嗦甚至煩人。有使用者抱怨它總打斷人。另有早期缺陷被官方確認:語音模式下部分場景讀不到歷史對話上下文(記憶不穩定)、朗讀其他語種時帶英文口音、偶發卡頓。對本來就少用語音的人,感知變化有限。
-
媒體普遍認為這是語音互動從「能對話」到「像真人」的關鍵一步。技術派指出,真正的質變未必來自語音層本身,而來自後臺委派給 GPT-5.5——在硬核基準上差距巨大:專家級科學推理 GPQA 上,GPT-Live-1 高推理檔準確率達 84.2%,近乎 Advanced Voice Mode(45.3%)的兩倍;複雜智慧體網頁搜尋 BrowseComp 上,上代僅 0.7%(基本不可用),GPT-Live-1 衝到 75.2%。這意味著語音回答不再是文字回答的「降級版」。競品格局上,它直接對標 Google Gemini Live、位元組豆包等實時語音助手,把「語音即 AI 入口」的爭奪推到前臺。
-
安全是這次釋出的重點。GPT-Live 內建實時護欄:檢測到不安全內容時,可引導到更安全的回覆、彈出提示、提供文字求助資源,高風險情形直接結束對話。針對青少年,它把家長控制擴充套件到 ChatGPT Voice,高風險訊號下可通知關聯家長。模型還被訓練為「不模模擬人聲線」,防止聲音克隆。不過,伴隨「情感依賴」風險,OpenAI 也上線了針對情感依賴的長期監測。這些機制仍在隨真實使用迭代。
-
它適合把 ChatGPT 當陪練的人:練外語、通勤閒聊、講睡前故事、擴音互動。重度語音使用者提升最明顯。如果你需要影片或螢幕共享、或身處 Business/Enterprise/Edu 工作區,暫時得用舊版高階語音模式。嫌墊話太多的人,可以試著在設定裡給它「保持安靜、繼續聽」的指令,或降低推理檔位減少話密。對嚴肅長文寫作或程式碼,語音仍不如打字高效。想嚐鮮先確認 App 已更新、語音選項裡出現「Live」標識。
-
GPT-Live 把 ChatGPT 語音從「對講機」升級成「電話」,自然度和可用性都上了一個臺階,但「過度熱情」的墊話與早期記憶缺陷仍需打磨;它會是 OpenAI 押注語音入口的第一塊基石。
使用者評論
-
Phillip_Murphy033—從對講機升級成電話,這個比喻很準。它不再死盯著我有沒有沉默,停頓就是停頓,不再被背景噪音騙去搶話。 -
Christian.Gonzalez_77—整體比我預期順,卡頓很少,官方確認的幾個早期 Bug 我也碰到了記憶不穩,但無傷大雅,日常用已經回不去了。 -
RavenRocketRodriguez—給孩子講題的時候用 High 檔,它會多想一會兒再答,準確率比 Instant 高不少,代價是回話前多等幾秒。我對比過同一道幾何題,Instant 偶爾跳步給錯方向,High 會先把條件列清楚再推,雖然慢一點但靠譜得多,輔導作業還是值得開高檔。 -
菊花_2—有個坑要提醒:語音模式下它有時候讀不到之前文字聊天的上下文,我讓它接著昨天的方案聊,它居然失憶了,得重新把背景講一遍。官方確認這是早期 Bug 正在修,但重度使用者最好別在語音裡承接長線任務,先文字聊清楚再切語音更穩。 -
Brenda.Foster—問天氣的時候螢幕上直接彈出視覺化卡片,邊說邊看比分和預報,這種圖文並茂的回法挺實用的。 -
Jason.FloresSr—重度語音黨表示提升明顯,以前基本不用語音的同事試了說「也就那樣」,所以感知差異真的看使用頻率。我每天通勤一個多小時全靠它,從導航問路到順手梳理當天待辦,這次升級後最爽的是它不再因為車裡廣播聲誤判我停下說話,抗噪確實強了。 -
EMjac—想要影片或者螢幕共享的話,Live 暫時不支援,得切回舊版高階語音模式,這點發布說明裡寫清楚了。 -
孔晨強—我媽用它講睡前故事,說聲音比之前溫柔了,九種音色重做之後辨識度確實高了一些。 -
tIGERtRADEhILL—它朗讀日語和韓語的時候帶明顯英文口音,OpenAI 自己也說某些語言還有 gap,希望後面迭代能修掉。 -
Reid547—免費使用者是 mini 版,能感覺到比 Plus 的滿血版話少一點、反應慢半拍,但日常通勤閒聊完全夠用。 -
RCampbell_2020465—我是練口語用的,讓它把我說的一句英文翻成日文,延遲低到幾乎感覺不到,比對著翻譯軟體念強太多。 -
ShirleySmithZ—問了個需要查網頁的問題,它前臺繼續跟我閒聊,後臺把結果帶回來再接上,這體驗確實比上一代聰明一大截。等於前臺那張嘴一直在陪你,後臺的大腦去查資料,合起來才叫真正的助手,而不是隻會照本宣科的播音員。 -
胡紅—實測打斷真的很自然,我在它回答到一半時改了問題,它直接順著新意思接下去,沒有重新來過的尷尬停頓。 -
Frances_Walker_2023675—剛更新完就試了半小時,最大的感受是它能接住我中途插話,不用等它說完。以前高階語音模式我一停頓它就搶答,這次終於不急了,對話節奏明顯更像跟人聊天而不是跟機器對講。 -
EAllenIII574—「嗯嗯」「對啊」這種墊話確實多了點,講著講著它老插一句,剛開始覺得貼心,聊久了有點煩。