GPT-5.6 Sol 拿下 ARC-AGI-3:首个通关该基准的 AI,离「人类级流体智能」还有多远?

抽象推理的里程碑

2026-07-11 11:08

2026 年 7 月 9 日,ARC Prize 基金会发布了最新评测结果:OpenAI 的旗舰模型 GPT-5.6 Sol 在第三代抽象推理基准 ARC-AGI-3 上拿到了 7.8% 的成绩,成为有史以来第一个真正「打通」该基准公开游戏关卡的模型。此前这个号称「唯一未被攻破」的基准,最强模型得分只有 1.5%。这一步看着不大,但放在整个 AI 圈里,分量不轻。

GPT-5.6 Sol 拿下 ARC-AGI-3:首个通关该基准的 AI,离「人类级流体智能」还有多远?
GPT-5.6 Sol 拿下 ARC-AGI-3:首个通关该基准的 AI,离「人类级流体智能」还有多远?

先说背景。ARC-AGI 这套基准是 Keras 作者、前 Google 工程师 François Chollet 设计的,用来衡量「流体智能」——也就是人类那种能从极少量样本里归纳规则、举一反三的能力。它刻意避开知识储备,对人类很容易、对 AI 却极难。ARC-AGI-1 和 -2 已经被陆续攻克(GPT-5.6 Sol 在 -1 上 96.5%、-2 上 92.5%),而 -3 改成了一个交互式游戏:模型得自己探索环境、理解规则、规划动作,像人玩游戏一样。这正是当前 agent 智能体最缺的那块能力。

数据上值得细看。Sol 在 Max 推理档位下,Public 环境平均 13.33%、Semi-Private 平均 7.78%;在 25 个公开游戏关卡里,FT09 这一关以 87% 的通过率夺冠。横向对比更说明问题:同门的 Terra 只有 0.8%、Luna 0.18%,GPT-5.5 是 0.43%,Gemini 3.1 Pro 预览版 0.42%。换句话说,抽象推理这种活儿,几乎全压在旗舰层级和推理算力上,小模型基本指望不上。

ARC Prize 自己的点评点出了关键。他们写道:Sol 能在 ARC-AGI 上表现,「不是因为它执行得更好,而是因为它先在一个全新环境里正确地定向了自己」。它能读懂陌生场景,用游戏自己的「词汇」去理解环境,把一次失败的假设当成重新规划的理由,而不是胡乱试错。多数 agent 不是输在写代码或执行,而是输在动手之前那个「认识环境」的上游环节——Sol 把这一环补上了。

我的看法是:别被 7.8% 这个低分吓到,也别被它冲昏头。这个基准打的就是「从零样本里归纳规则」的能力,被认为是目前最接近 AGI 定义(人类学习效率)的标尺之一。从 0 到 7.8%,意义有点像当年某个模型第一次跨过某道看不见的门槛——它证明这条路能走,之前只是没人走通。但冷静讲,7.8% 离「真正理解」还差得远,而且 OpenAI 是用 Max 甚至 Ultra 档位、砸了大量推理算力把这个结果堆出来的,不是便宜地「随手就过」。

放到更大的盘子里看,这条消息和 GPT-5.6 全家桶(Sol/Terra/Luna)同一天全球开放、GPT-Live 语音模型发布、ChatGPT Work 企业 agent 上线,是连成一气的。OpenAI 现在明显在「推理 + agent + 多模态」三条线一起推。ARC-AGI-3 还没被真正攻克,但 Sol 已经把天花板顶开了一条缝。对做 agent、自动化科研、UI 操作这类方向的团队来说,「先定向环境再行动」这个能力,比分数本身更值得盯。