深度报告
-
GPT-5.6 Sol 是 OpenAI 于 2026 年 7 月 9 日发布的 GPT-5.6 系列旗舰模型,以「太阳(Sol)」命名,定位最高复杂推理、代码开发、科学研究与网络安全等高端场景。 它是 OpenAI 目前综合能力最强的大模型,引入 Max 推理强度与 Ultra 子智能体加速两种新能力,定价为每百万 token 输入 5 美元、输出 30 美元。
-
GPT-5.6 系列采用全新的天体命名分层体系,于 2026 年 7 月 9 日由 OpenAI 正式公布,在经历美国政府约两周严格安全审查后,于 7 月 13 日前后全量上线。 数字代表世代(5.6),天体名代表档位,各档位可独立迭代更新。这是 OpenAI 首次在单一世代内以「太阳 / 地球 / 月亮」明确划分性能与价格梯度,直接对标 Anthropic 的 Claude 系列。
-
系列共三款:旗舰版 Sol(太阳)、均衡版 Terra(地球)、轻量版 Luna(月亮)。 Terra 性能接近上代 GPT-5.5 但成本仅为其一半;Luna 主打速度与最低成本,适合高频调用与低延迟场景。三档在 ChatGPT、Codex 与 API 中同步开放,用户可按任务难度自由路由,用 Luna 跑简单任务、用 Sol 啃硬骨头。
-
Sol 新增两种努力模式。Max 让模型投入更多时间推理,探索替代方案、检查并修正方法,适合需要深度推导的任务。 Ultra 默认协调四个智能体并行处理复杂任务,以更高的词元使用量换取更强结果并缩短高难度任务的完成时间,面向 Pro 与 Enterprise 用户。官方称 Ultra 是把「AI 指挥 AI」落到实处的加速通道。
-
在 Agents' Last Exam 评测中,Sol 取得 53.6 分,领先 Claude Fable 5 达 13.1 分。 Terminal-Bench 2.1 标准模式 88.8%,超过 Claude Mythos 5 的 88.0%;开启 Ultra 后提升至 91.9%。 Artificial Analysis Intelligence Index 中,启用最大推理的 Sol 与 Fable 5 得分几乎持平,但以约一半估算成本、快 61% 完成。奥尔特曼称 Sol 在智能体编程任务的 Token 使用效率较前代提升 54%。
-
三档每百万 token 定价:Sol 输入 5 / 输出 30 美元,Terra 2.5 / 15 美元,Luna 1 / 6 美元。 Responses API 支持 Programmatic Tool Calling(ZDR 兼容)与 Multi-agent 并发子智能体(beta)。 Prompt Caching 引入显式缓存断点与 30 分钟最小缓存寿命,长上下文调用成本显著下降,对每天跑几百轮 Agent 对话的场景尤为友好。
-
伴随 GPT-5.6 上线,OpenAI 推出由该系列驱动的 ChatGPT Work 智能体,主打长时间、多步骤连续任务。 原独立 Codex 应用并入新版 ChatGPT 桌面客户端,Chat、Work、Codex 统一入口,旧版桌面应用更名为 ChatGPT Classic。 Work 现已面向 Pro、Enterprise、教育版开放,Plus 与商业标准版分批上线,对标 Claude Cowork。
-
GPT-5.6 配备 OpenAI 迄今最稳健的安全防护,生物与网络安全能力强于前代,cyber safeguards 阻断约十倍潜在有害活动。 发布前完成约 70 万 A100e GPU 小时的黑盒自动化红队测试,并更新系统卡。 官方在 ChatGPT 与 Codex 提供降级重试选项,持续降低护栏对良性使用的影响,同时维持高鲁棒性门槛。
-
Sol 最擅长把完整项目做出来:使用终端、多文件改动、调用工具、观察运行结果、按错误继续修复。 实测在代码排查、多轮纠错、技术任务拆解上表现突出,但响应偏慢,在 SWE-Bench Pro 等需要细腻理解和代码可读性的任务上仍落后 Fable 5。 建议按难度路由选模型,70%–80% 的日常任务用 Terra 即可省下一半成本。
用户评论
-
bigladybug118—Multi-agent 并发子智能体这个 beta 太适合我们做批量分析,一次请求跑几个子任务合成结果,效率起飞。 -
Bruce.Ramirez_Pro30—Pro 用户才给 Max,Plus 只能标准模式,想体验满血还是得加钱,商业标准版还要再等等。 -
sTAKEfI—SWE-Bench Pro 上 Sol 还是输给 Fable 5,细腻活儿还是 Anthropic 更稳,别被跑分冲昏头。 -
PCox369—奥尔特曼说 Sol 在智能体编程的 Token 效率比前代提升 54%,体感确实成立,同样的需求花的钱少了一截,就是响应慢得要有耐心,简单问答别浪费它,按难度路由才是正解,七成的日常活交给 Terra 就够。 -
Austin_Allen_99—安全审查两周才全量,护栏是真严,良性任务偶尔被挡,好在能一键降级重试,整体能接受。 -
TheresaWardX—ChatGPT Work 把 Codex 并进桌面端了,文档表格 PPT 一把抓,对标 Claude Cowork,办公党可以冲了。 -
钱素—150 万上下文是真的爽,一整本书丢进去做跨学科分析都不带断片的,做科研的福音。 -
兔兔836—Prompt Caching 显式断点真帮我们省了大钱,我们的系统提示和项目上下文超过两万 token,加上缓存断点后写入按原价 1.25 倍、读取享九折,每天几百轮 Agent 对话下来输入成本直接砍掉八成多,长上下文场景的性价比一下就起来了。 -
Kathleen.RamosII043—对比了一圈 Fable 5,Sol 在规划上更听话更严格,但它前端审美真的很草率,我用同一套提示词生成的页面呆得我想笑,南瓜和胡萝卜长相无力吐槽,希望 OpenAI 后面在视觉审美上好好补补课,别让跑分赢了口碑输了。 -
LBaker_2023—把 Sol 接进我们的 CI 做自动修 bug,最惊艳的是多轮纠偏能力,你指出哪里不对它能自己慢慢收回来,而不是修着修着把原来的逻辑线弄散。对长期维护的复杂项目这是刚需,省了我们大量来回拉扯的时间,也减少了把推测当已知条件的风险。 -
CharlesGonzalesSr—Ultra 四个智能体并行确实猛,批量生成测试用例一把梭,但全局一致性任务还是老老实实用 Max。 -
EColeman168—Terra 性价比才是真香,日常代码审查用 Terra 就够了,别啥都扔给 Sol,钱包会感谢你的。 -
BlockBear884—实测下来最大的感受就是慢,我让它审查一段 11 行的异步 Python,单次等待就在 21 到 44 秒之间,但它在事务边界、行锁、阻塞 I/O、异常回滚这些容易被普通审查漏掉的问题上确实找全了,问题不在于它会不会做,而在于什么任务值得等,慢是慢,但该出的活一个不少。 -
J_udyEvans—Sol 在 Terminal-Bench 2.1 拿到 88.8%,Ultra 模式 91.9%,这个成绩确实能打,就是前端审美还是差点意思。 -
GAlop—终于等到了 GPT-5.6 Sol,Codex 里跑复杂重构比上代稳太多了,终于不像以前那样动不动跑偏。