GPT-5.6 Sol 拿下 ARC-AGI-3:首個通關該基準的 AI,離「人類級流體智慧」還有多遠?

抽象推理的里程碑

2026-07-11 11:08

2026 年 7 月 9 日,ARC Prize 基金會發布了最新評測結果:OpenAI 的旗艦模型 GPT-5.6 Sol 在第三代抽象推理基準 ARC-AGI-3 上拿到了 7.8% 的成績,成為有史以來第一個真正「打通」該基準公開遊戲關卡的模型。此前這個號稱「唯一未被攻破」的基準,最強模型得分只有 1.5%。這一步看著不大,但放在整個 AI 圈裡,分量不輕。

GPT-5.6 Sol 拿下 ARC-AGI-3:首個通關該基準的 AI,離「人類級流體智慧」還有多遠?
GPT-5.6 Sol 拿下 ARC-AGI-3:首個通關該基準的 AI,離「人類級流體智慧」還有多遠?

先說背景。ARC-AGI 這套基準是 Keras 作者、前 Google 工程師 François Chollet 設計的,用來衡量「流體智慧」——也就是人類那種能從極少量樣本里歸納規則、舉一反三的能力。它刻意避開知識儲備,對人類很容易、對 AI 卻極難。ARC-AGI-1 和 -2 已經被陸續攻克(GPT-5.6 Sol 在 -1 上 96.5%、-2 上 92.5%),而 -3 改成了一個互動式遊戲:模型得自己探索環境、理解規則、規劃動作,像人玩遊戲一樣。這正是當前 agent 智慧體最缺的那塊能力。

資料上值得細看。Sol 在 Max 推理檔位下,Public 環境平均 13.33%、Semi-Private 平均 7.78%;在 25 個公開遊戲關卡里,FT09 這一關以 87% 的透過率奪冠。橫向對比更說明問題:同門的 Terra 只有 0.8%、Luna 0.18%,GPT-5.5 是 0.43%,Gemini 3.1 Pro 預覽版 0.42%。換句話說,抽象推理這種活兒,幾乎全壓在旗艦層級和推理算力上,小模型基本指望不上。

ARC Prize 自己的點評點出了關鍵。他們寫道:Sol 能在 ARC-AGI 上表現,「不是因為它執行得更好,而是因為它先在一個全新環境里正確地定向了自己」。它能讀懂陌生場景,用遊戲自己的「詞彙」去理解環境,把一次失敗的假設當成重新規劃的理由,而不是胡亂試錯。多數 agent 不是輸在寫程式碼或執行,而是輸在動手之前那個「認識環境」的上游環節——Sol 把這一環補上了。

我的看法是:別被 7.8% 這個低分嚇到,也別被它衝昏頭。這個基準打的就是「從零樣本里歸納規則」的能力,被認為是目前最接近 AGI 定義(人類學習效率)的標尺之一。從 0 到 7.8%,意義有點像當年某個模型第一次跨過某道看不見的門檻——它證明這條路能走,之前只是沒人走通。但冷靜講,7.8% 離「真正理解」還差得遠,而且 OpenAI 是用 Max 甚至 Ultra 檔位、砸了大量推理算力把這個結果堆出來的,不是便宜地「隨手就過」。

放到更大的盤子裡看,這條訊息和 GPT-5.6 全家桶(Sol/Terra/Luna)同一天全球開放、GPT-Live 語音模型釋出、ChatGPT Work 企業 agent 上線,是連成一氣的。OpenAI 現在明顯在「推理 + agent + 多模態」三條線一起推。ARC-AGI-3 還沒被真正攻克,但 Sol 已經把天花板頂開了一條縫。對做 agent、自動化科研、UI 操作這類方向的團隊來說,「先定向環境再行動」這個能力,比分數本身更值得盯。