GPT-5.6一小时攻克五十年数学猜想,64个Agent协同作战

神话级模型再破天花板

2026-07-11 16:04

7月11日,OpenAI研究员Ethan Knight在社交平台宣布了一件事,让数学圈和AI圈同时炸了锅。刚发布没多久的GPT-5.6,在「Sol Ultra」模式下调集了64个子智能体,用不到一小时,给一道悬置了近五十年的图论猜想「循环双覆盖猜想」拿出了一份完整证明。OpenAI把完整提示词、三页纸的证明全文,以及一份用Lean形式化验证过的版本全部公开,相关代码已经通过Lean内核检查。

这件事之所以轰动,首先因为那道题真的不简单。「循环双覆盖猜想」最早能追到Szekeres在1973年、Seymour在1979年的工作,长期被视作图论里最重要的开放问题之一。它问的是一个看似朴素的问题:给你一张图(点和线的集合),能不能找出一批首尾相接的「圈」,让图上的每一条边都恰好被这些圈经过两次?朴素到什么程度?一张没有「桥」的图,每条边至少都属于某个圈,那把所有圈收集起来不就行了?可难点恰恰在「恰好两次」——你为了补一条只出现一次的边加一个新圈,可能让别的边从两次变三次,牵一发动全身,最后要的是全局同时协调,而不是单独给每条边找个圈。

模型给出的证明思路很聪明,它没去硬找圈,而是把「找圈」翻译成一个有限域上的边标号问题,再用线性代数证明这些标号一定能拼起来。大致四步:先把一般图归约成每个顶点连三条边的三次图;再利用无处为零的8流定理给每条边贴上三位二进制标签,要求在每个顶点处相邻三条边的标签能彼此抵消;接着把每条边的一个标签扩展成两个,让同一标签在每个顶点要么不出现、要么恰好出现两次;最后,也是最关键的,把「两端标签必须一致」这个全局协调问题变成一组线性方程组,用对偶空间和奇偶性证明它一定有解。于是相同标签的边自动连成圈,每条边恰好落在两个圈里。OpenAI还顺手把那份约700词的提示词公开了,里面藏着驾驭神话级模型的真功夫:不规定解法,只把验收标准钉死;把定义、边界情况一次性说清;不只讲要什么答案,还列出什么不算答案;复杂任务不搞固定分工,而是动态搜索加独立对抗审查。

发布后,正在韩国开ICML的Noam Brown(o1的核心贡献者)隔着太平洋第一时间赶来捧场。他特别点出,这次和此前证明Erdős单位距离问题不同,没有动用什么内部特供模型,靠公开能用的GPT-5.6 Sol Ultra就干成了,而且把测试时计算的并行大幅铺开,原本可能磨一整天的证明被64个Agent压进了一小时。外界普遍认为,这既说明前沿模型在数学上的天花板还在抬高,也证明了多智能体协作能极快地压缩任务耗时。

但热闹归热闹,这事儿还远没到「盖棺定论」的时候。 OpenAI放出的是一份「公开且技术具体的证明主张」,不是经过同行审议的结论。数学界尚未完成独立审查,所以负责任的表述只能是「给出证明」,不能直接说「正式解决」。更冷静的观察者还指出,这次实验报告其实并不完整:OpenAI只公开了这一个成功案例,没披露失败尝试、没给成功率、也没交代64个Agent的真实并发模式与成本。一次成功跑通,可以很有历史意义,但还谈不上是对模型能力的完整评估。说到底,图论家的下一章,才是真正检验这份证明成色的地方。

把视线拉远一点,我更在意这份公开Prompt本身。 它示范了一种和「神话级模型」打交道的正确姿势:路径未知的任务,别急着替模型排好SOP,先把「什么算真正完成、什么不算完成」写死,把边界和验收机制钉清楚,再让一群Agent去动态探索、互相找茬。这比「证明了一个五十年猜想」更值得普通从业者抄作业——毕竟能调64个Agent的人不多,但能把复杂任务写成一份可验收、可审查、可纠错的「任务合同」的人,每一个团队都缺。真正的拐点,可能不是AI第一次证明数学猜想,而是我们终于学会怎么给AI立规矩、定标准。