OpenAI 把 GPT-5.6 用来自我优化:推理成本降 20%,token 效率涨 15%

自己优化自己,第一次认真做

2026-07-30 23:28

OpenAI 昨天凌晨一口气放了四个消息:GPT-5.6 开始自己优化自己了、翁荔可能回归、硬件计划浮出水面,还有产品规模破了 10 亿人。

OpenAI CEO Sam Altman 出席活动
OpenAI CEO Sam Altman 出席活动

最值得细看的是第一个——OpenAI 公开了 GPT-5.6 Sol「自我进化」的技术细节。

说白了就是,OpenAI 让最强模型 GPT-5.6 Sol 反过来优化 GPT-5.6 系列本身的推理链路。结果也够直接:端到端推理服务成本降了 20%,token 生成效率涨了 15% 以上。

这事怎么做到的?

首先,用 Sol 优化 GPU 内核。 大模型跑推理时,真正耗时的是 GPU 上那些底层计算程序——也就是「内核」。OpenAI 提前训练了 GPT-5.6 Sol,让它学会 Triton 和 Gluon 两种 GPU 编程语言,然后直接上手改写生产环境里的内核代码。改完之后的效果是,内核层面的优化就给整体成本砍掉了 20%。

GPT-5.6 全栈分层效率优化方案
GPT-5.6 全栈分层效率优化方案

其次是推测解码的升级。 这技术本身不难理解:先让一个小模型快速「猜」一串 token,再让主模型并行校验。如果猜对了,一次前向计算就能输出多个 token。Sol 这次针对配套的草稿模型做了大几百组架构对比实验,还让模型自己值守训练流程、自动处理硬件故障。最终 token 效率提升了 15% 以上。

但真正有意思的,是 OpenAI 在过程中发现的一个问题——也是之前 GPT-5.6 Sol 明明能攻克数学公开难题(圆覆盖猜想之类),却在 ARC-AGI-3 二维解谜评测上只拿 7.8% 的核心原因。

问题出在智能体调度框架上,不是模型本身。

他们发现,ARC-AGI-3 配套的调度框架每执行完一步操作,就把模型的私有推理思考过程全部清空。结果 Sol 每做一步都得从头分析谜题规则,完全留不住上一轮的推演思路。更麻烦的是,这套框架用的是滚动截断窗口,随着交互历史积累,早期的操作记录自动被剔除——不仅思考记不住,连自己做过的操作也会慢慢忘掉。

OpenAI 只做了两件事:一是开启推理内容持久留存,让 Sol 能在多轮操作之间保留完整的推理过程;二是用上下文压缩替换滚动截断。就这两项 API 配置参数,直接把 Sol 在 ARC-AGI-3 上的得分提了 3 倍,输出 token 消耗缩到了原来的六分之一。

ARC-AGI-3 评测得分对比图示
ARC-AGI-3 评测得分对比图示

回过头看,这其实暴露了一个被很多人忽略的事实:大模型的能力天花板,很多时候不在模型本身,而在怎么调度它。同样的模型,配不同的调度框架,效果能差几倍。

其他几个消息也值得一提。翁荔(Lilian Weng)刚离开 Thinking Machines Lab 两天就被曝要回归 OpenAI,带队搞递归自我改进(RSI)研究——这正是 OpenAI 所说的「自进化」方向。OpenAI 总裁布罗克曼还透露正打造 AI 硬件,首款无屏智能音箱「很快就能看到」。用户规模上,ChatGPT 已经突破 10 亿人、服务 200 万家企业。

更值得关注的是,OpenAI 的 CFO 在内部会议上透露,7 月单月的年化经常性收入已经超过了整个第二季度,到月底 ARR 接近 600 亿美元。增长主要来自 GPT-5.6 系列、企业版 ChatGPT Work 和编程工具 Codex。

把视线拉远一点,这场「自己优化自己」的能力迭代,说明 AI 行业已经进入了全栈工程化竞争。过去比谁参数大、谁跑分高,现在比的是谁用更低的成本跑出更好的服务。大模型的下半场,拼的不再是模型本身,而是谁先把工程优化做到极致。