OpenAI 把 GPT-5.6 用來自我最佳化:推理成本降 20%,token 效率漲 15%
自己最佳化自己,第一次認真做
OpenAI 昨天凌晨一口氣放了四個訊息:GPT-5.6 開始自己最佳化自己了、翁荔可能迴歸、硬體計劃浮出水面,還有產品規模破了 10 億人。

最值得細看的是第一個——OpenAI 公開了 GPT-5.6 Sol「自我進化」的技術細節。
說白了就是,OpenAI 讓最強模型 GPT-5.6 Sol 反過來最佳化 GPT-5.6 系列本身的推理鏈路。結果也夠直接:端到端推理服務成本降了 20%,token 生成效率漲了 15% 以上。
這事怎麼做到的?
首先,用 Sol 最佳化 GPU 核心。 大模型跑推理時,真正耗時的是 GPU 上那些底層計算程式——也就是「核心」。OpenAI 提前訓練了 GPT-5.6 Sol,讓它學會 Triton 和 Gluon 兩種 GPU 程式語言,然後直接上手改寫生產環境裡的核心程式碼。改完之後的效果是,核心層面的最佳化就給整體成本砍掉了 20%。

其次是推測解碼的升級。 這技術本身不難理解:先讓一個小模型快速「猜」一串 token,再讓主模型並行校驗。如果猜對了,一次前向計算就能輸出多個 token。Sol 這次針對配套的草稿模型做了大幾百組架構對比實驗,還讓模型自己值守訓練流程、自動處理硬體故障。最終 token 效率提升了 15% 以上。
但真正有意思的,是 OpenAI 在過程中發現的一個問題——也是之前 GPT-5.6 Sol 明明能攻克數學公開難題(圓覆蓋猜想之類),卻在 ARC-AGI-3 二維解謎評測上只拿 7.8% 的核心原因。
問題出在智慧體排程框架上,不是模型本身。
他們發現,ARC-AGI-3 配套的排程框架每執行完一步操作,就把模型的私有推理思考過程全部清空。結果 Sol 每做一步都得從頭分析謎題規則,完全留不住上一輪的推演思路。更麻煩的是,這套框架用的是滾動截斷視窗,隨著互動歷史積累,早期的操作記錄自動被剔除——不僅思考記不住,連自己做過的操作也會慢慢忘掉。
OpenAI 只做了兩件事:一是開啟推理內容持久留存,讓 Sol 能在多輪操作之間保留完整的推理過程;二是用上下文壓縮替換滾動截斷。就這兩項 API 配置引數,直接把 Sol 在 ARC-AGI-3 上的得分提了 3 倍,輸出 token 消耗縮到了原來的六分之一。

回過頭看,這其實暴露了一個被很多人忽略的事實:大模型的能力天花板,很多時候不在模型本身,而在怎麼排程它。同樣的模型,配不同的排程框架,效果能差幾倍。
其他幾個訊息也值得一提。翁荔(Lilian Weng)剛離開 Thinking Machines Lab 兩天就被曝要回歸 OpenAI,帶隊搞遞迴自我改進(RSI)研究——這正是 OpenAI 所說的「自進化」方向。OpenAI 總裁布羅克曼還透露正打造 AI 硬體,首款無屏智慧音箱「很快就能看到」。使用者規模上,ChatGPT 已經突破 10 億人、服務 200 萬家企業。
更值得關注的是,OpenAI 的 CFO 在內部會議上透露,7 月單月的年化經常性收入已經超過了整個第二季度,到月底 ARR 接近 600 億美元。增長主要來自 GPT-5.6 系列、企業版 ChatGPT Work 和程式設計工具 Codex。
把視線拉遠一點,這場「自己最佳化自己」的能力迭代,說明 AI 行業已經進入了全棧工程化競爭。過去比誰引數大、誰跑分高,現在比的是誰用更低的成本跑出更好的服務。大模型的下半場,拼的不再是模型本身,而是誰先把工程最佳化做到極致。