OpenAI 推 GPT-Live 全雙工語音,聊天不再你一句我一句
語音互動終於能「同時說和聽」
OpenAI 最近放出 GPT-Live,一款重新定義人機語音互動的模型。過去我們用語音助手,模式很笨:你說完,停下來,等它回,再接著說。GPT-Live 打破了這個回合制,它支援 全雙工通訊——模型可以一邊聽一邊說,你能自然插話,它也會用「嗯」「明白了」這類語氣詞表示在聽,你思考時它還會耐心等著。
模型分兩個版本。GPT-Live-1 面向 Go、Plus 和 Pro 訂閱使用者,GPT-Live-1 mini 面向免費使用者,兩者正在網頁、iOS 和安卓上全球推送。OpenAI 透露,每週使用 ChatGPT 語音功能的使用者已經超過 1.5 億,這意味著這可能是本月份最受關注的消費級 AI 產品釋出。
架構上的差別才是關鍵。GPT-Live 不是把一個語音介面硬套在文字模型上,而是從零開始設計的流式模型:它持續處理輸入、持續生成輸出,每秒能做好幾次「該說、該聽、該停、該打斷,還是該調工具」的判斷,底層跑著 GPT-5.5 來做複雜推理。這讓實時翻譯、通勤時的擴音助手、對話式輔導都變得自然得多。
真正有意思的是它對「實時」的重新定義。傳統語音助手像對講機,按下說、鬆開聽;GPT-Live 則像和人面對面聊天,雙方的資訊流是同時流動的。這種看似細微的改變,其實繞開了過去語音 AI 最大的尷尬:那種明顯的機械感和延遲感。
OpenAI 的 Atty Eleti 說得很直白:未來人們會透過語音,去打理那些越來越複雜、耗時、且需要智慧體自主完成的任務。OpenAI 押注的下一個主入口是語音,而不是文字。看得出來,這家公司正在把互動的重心,從鍵盤悄悄挪向嘴巴。
把這件事放進行業裡看,語音正在從「附屬功能」變成「主戰場」。當模型能像人一樣自然對話,很多原本需要打字和點選的場景,會被一句話接管。對普通使用者來說,最實在的變化或許是:以後再也不用對著手機一頓戳,開口就能把事辦了。從 Siri 到 GPT-Live,蘋果和 OpenAI 在語音入口上的代差,正被實時全雙工這一刀拉開。誰先把「開口辦事」變成肌肉記憶,誰就握住了下一代人機互動的遙控器。