GPT-Live 语音

OpenAI 全新一代全双工语音模型,让 ChatGPT 语音对话更自然、更聪明、更会倾听

深度报告

  • GPT-Live 是 OpenAI 于 2026 年 7 月 8 日发布的新一代语音模型,用于驱动 ChatGPT Voice 的全部语音对话体验。它从底层改用「全双工架构」,让 AI 可以同时听和说,对话不再是回合制。付费用户默认使用完整版 GPT-Live-1,免费用户使用轻量版 GPT-Live-1 mini。官方称,每周有超过 1.5 亿人通过语音或听写功能与 ChatGPT 交谈,这次升级是这批用户最直接的体验跃迁。

  • OpenAI 的语音路线走过三代。最早的级联语音系统(Standard Voice)把语音拆成「转写—推理—合成」三个模型串起来,信息在环节间流失,响应慢而僵硬。2024 年的 Advanced Voice Mode(高级语音模式)改用单一端到端模型处理音频流,延迟大幅下降,但它仍是回合制——靠检测静音来判断用户是否说完,一旦你停顿或背景有噪音,它就容易误判并抢话。GPT-Live 要解决的就是这个「对讲机」式交互。它并非一个独立 App,而是 ChatGPT 所有能力的新语音入口;真正干重活的推理仍交给后台前沿模型,发布时挂的是 GPT-5.5。

  • 最核心的变化是「连续交互」。全双工架构让模型在生成语音的同时持续聆听,每秒做多次决策:现在该说话、继续听、停顿、打断还是调用工具。于是你插话时它能立刻停、你卡壳时它会安静等待、它还会用「嗯嗯」「明白了」这类垫话让你知道它跟上了。OpenAI 还重新混音了 ChatGPT 内置的九种声音,让每种音色更有辨识度。 第二项架构变化是「委派」。当你的问题需要搜网页、深度推理或多步任务时,GPT-Live 把活儿甩给后台的 GPT-5.5,前台继续陪你聊,结果算完再自然接回对话。你还能在语音界面右侧滑块里选推理强度:Instant 极速、Medium 均衡、High 最优。 除此之外,GPT-Live 新增了实时语音翻译(口述一句外语,AI 无延迟翻成另一种),并在谈天气、股票、赛事时弹出可视化卡片;语音依旧支持搜索、记忆、图片与文件上传。需要视频或屏幕共享时,仍可切回旧版高级语音模式。

  • GPT-Live 本身不是一个单独售卖的产品,而是 ChatGPT 既有订阅体系内的能力升级。Go、Plus、Pro 用户默认获得满血版 GPT-Live-1,免费用户拿到 GPT-Live-1 mini。可用性随地区与套餐分批灰度,发布初期 Live 不向 Business、Enterprise、Edu 工作空间开放。换句话说,这是一次「存量用户的体验增值」,不创造新收费点,但通过把语音做成更强的入口,巩固了 ChatGPT 作为日常助手的黏性。

  • 正面反馈集中在「自然度」。不少重度语音用户表示,打断、轮番接话、自然停顿都明显优于上一代,陪伴感强。在 OpenAI 自己做的 5 到 10 分钟真人盲测里,GPT-Live-1 整体偏好率 75.7%,mini 也达 69.2%,均大幅甩开 Advanced Voice Mode 的 50% 打平线;流畅度与愉悦度 7 分制评分中,GPT-Live-1(4.96/5.19)压过上代(3.80/3.82)。 负面声音同样突出。最大的槽点是「过度热情」:AI 频繁用「嗯嗯」「对啊」垫话,本意是给心理安全感,实际却显得啰嗦甚至烦人。有用户抱怨它总打断人。另有早期缺陷被官方确认:语音模式下部分场景读不到历史对话上下文(记忆不稳定)、朗读其他语种时带英文口音、偶发卡顿。对本来就少用语音的人,感知变化有限。

  • 媒体普遍认为这是语音交互从「能对话」到「像真人」的关键一步。技术派指出,真正的质变未必来自语音层本身,而来自后台委派给 GPT-5.5——在硬核基准上差距巨大:专家级科学推理 GPQA 上,GPT-Live-1 高推理档准确率达 84.2%,近乎 Advanced Voice Mode(45.3%)的两倍;复杂智能体网页搜索 BrowseComp 上,上代仅 0.7%(基本不可用),GPT-Live-1 冲到 75.2%。这意味着语音回答不再是文字回答的「降级版」。竞品格局上,它直接对标 Google Gemini Live、字节豆包等实时语音助手,把「语音即 AI 入口」的争夺推到前台。

  • 安全是这次发布的重点。GPT-Live 内置实时护栏:检测到不安全内容时,可引导到更安全的回复、弹出提示、提供文字求助资源,高风险情形直接结束对话。针对青少年,它把家长控制扩展到 ChatGPT Voice,高风险信号下可通知关联家长。模型还被训练为「不模仿真人声线」,防止声音克隆。不过,伴随「情感依赖」风险,OpenAI 也上线了针对情感依赖的长期监测。这些机制仍在随真实使用迭代。

  • 它适合把 ChatGPT 当陪练的人:练外语、通勤闲聊、讲睡前故事、免提交互。重度语音用户提升最明显。如果你需要视频或屏幕共享、或身处 Business/Enterprise/Edu 工作区,暂时得用旧版高级语音模式。嫌垫话太多的人,可以试着在设置里给它「保持安静、继续听」的指令,或降低推理档位减少话密。对严肃长文写作或代码,语音仍不如打字高效。想尝鲜先确认 App 已更新、语音选项里出现「Live」标识。

  • GPT-Live 把 ChatGPT 语音从「对讲机」升级成「电话」,自然度和可用性都上了一个台阶,但「过度热情」的垫话与早期记忆缺陷仍需打磨;它会是 OpenAI 押注语音入口的第一块基石。

用户评论

  • 头像
    Phillip_Murphy033
    从对讲机升级成电话,这个比喻很准。它不再死盯着我有没有沉默,停顿就是停顿,不再被背景噪音骗去抢话。

  • 头像
    Christian.Gonzalez_77
    整体比我预期顺,卡顿很少,官方确认的几个早期 Bug 我也碰到了记忆不稳,但无伤大雅,日常用已经回不去了。

  • 头像
    RavenRocketRodriguez
    给孩子讲题的时候用 High 档,它会多想一会儿再答,准确率比 Instant 高不少,代价是回话前多等几秒。我对比过同一道几何题,Instant 偶尔跳步给错方向,High 会先把条件列清楚再推,虽然慢一点但靠谱得多,辅导作业还是值得开高档。

  • 头像
    菊花_2
    有个坑要提醒:语音模式下它有时候读不到之前文字聊天的上下文,我让它接着昨天的方案聊,它居然失忆了,得重新把背景讲一遍。官方确认这是早期 Bug 正在修,但重度用户最好别在语音里承接长线任务,先文字聊清楚再切语音更稳。

  • 头像
    Brenda.Foster
    问天气的时候屏幕上直接弹出可视化卡片,边说边看比分和预报,这种图文并茂的回法挺实用的。

  • 头像
    Jason.FloresSr
    重度语音党表示提升明显,以前基本不用语音的同事试了说「也就那样」,所以感知差异真的看使用频率。我每天通勤一个多小时全靠它,从导航问路到顺手梳理当天待办,这次升级后最爽的是它不再因为车里广播声误判我停下说话,抗噪确实强了。

  • 头像
    EMjac
    想要视频或者屏幕共享的话,Live 暂时不支持,得切回旧版高级语音模式,这点发布说明里写清楚了。

  • 头像
    孔晨强
    我妈用它讲睡前故事,说声音比之前温柔了,九种音色重做之后辨识度确实高了一些。

  • 头像
    tIGERtRADEhILL
    它朗读日语和韩语的时候带明显英文口音,OpenAI 自己也说某些语言还有 gap,希望后面迭代能修掉。

  • 头像
    Reid547
    免费用户是 mini 版,能感觉到比 Plus 的满血版话少一点、反应慢半拍,但日常通勤闲聊完全够用。

  • 头像
    RCampbell_2020465
    我是练口语用的,让它把我说的一句英文翻成日文,延迟低到几乎感觉不到,比对着翻译软件念强太多。

  • 头像
    ShirleySmithZ
    问了个需要查网页的问题,它前台继续跟我闲聊,后台把结果带回来再接上,这体验确实比上一代聪明一大截。等于前台那张嘴一直在陪你,后台的大脑去查资料,合起来才叫真正的助手,而不是只会照本宣科的播音员。

  • 头像
    胡红
    实测打断真的很自然,我在它回答到一半时改了问题,它直接顺着新意思接下去,没有重新来过的尴尬停顿。

  • 头像
    Frances_Walker_2023675
    刚更新完就试了半小时,最大的感受是它能接住我中途插话,不用等它说完。以前高级语音模式我一停顿它就抢答,这次终于不急了,对话节奏明显更像跟人聊天而不是跟机器对讲。

  • 头像
    EAllenIII574
    「嗯嗯」「对啊」这种垫话确实多了点,讲着讲着它老插一句,刚开始觉得贴心,聊久了有点烦。