GPT-5.6一小时破了50年数学难题:64个子Agent的威力

AI独立证明时代来了

2026-07-12 17:47

OpenAI的GPT-5.6系列在7月10日全面上线,24小时内就扔出了一颗重磅炸弹——旗舰版Sol Ultra不到一小时就完成了一道悬而未决50多年的数学猜想证明。

这道题叫「循环双覆盖猜想」,是图论里的经典难题,由数学家Szekeres和Seymour分别在1973年和1979年独立提出。核心问题是一句话就能说清的事:对于任意无桥图,能不能找到一组循环,让每条边都恰好出现在两个循环里?但就是这道「小学生能听懂题面、教授证不出来」的题目,困了数学界半个世纪。

GPT-5.6 Sol Ultra怎么做到的?关键不在于它本身有多强,而在于OpenAI给了它一个聪明的策略。

研究员的提示词只有700词,但策略设计很精妙:不替模型规定解法,只把验收标准钉死。模型被要求最多同时调用64个子Agent并行工作,各自尝试不同的数学表示方法和代数思路。早期阶段保持路线多样性,不让所有Agent撞进同一条死胡同。同时还安排了专门的「对抗Agent」,负责找漏洞、边界情况和潜在错误。系统原本预留了8小时计算时间,结果只用了不到一小时就完成了全部证明。OpenAI把证明全文和三页PDF都公开了,连带那份700词的prompt也一起放了上来。

英国曼彻斯特大学的数学家Thomas Bloom是最早公开评价的人,他认为这份证明「非常漂亮」——简洁、基础,使用的方法并不复杂,如果当年有人想到,80年代就有可能完成。不过他也在细节里发现了一个挺有意思的问题:整篇证明没有引用任何一篇已有的数学文献。比如1983年Bermond、Jackson和Jaeger那篇经典论文应该被引用的,完全没有出现。Bloom认为这是目前AI自动生成数学论文普遍存在的毛病。

按照OpenAI官方Sol定价,这次推理消耗的计算资源大约275到485美元——一杯咖啡的钱,换来一条50年没被解开的定理。如果用Cerebras平台跑,最高成本可能到1.3万美元。

当然,数学界目前持谨慎态度。这份证明虽然已经发布,但还没经过正式的同行评审。循环双覆盖猜想历史上已经出现过多次所谓「证明」,后来都发现存在漏洞,有些甚至撤了稿。而且这次也没用Lean等形式化证明工具做机器验证——目前图论相关的形式化数学库还不足以支持这种级别的研究。

Bloom教授还做了一个很有意思的评价。他认为AI最大的优势不是提出全新的数学思想,而是拥有远超人类的耐心。人类数学家通常会尝试一种自然的方法,如果失败了就放弃了;AI不会气馁,会继续不断尝试各种细微变化。而这份证明恰恰用的是几十年前就已存在的经典数学工具——没有惊天动地的新理论,靠的就是穷举式的坚持。

如果最终通过数学界验证,这将是大语言模型首次独立解决一个被列入维基百科「未解决数学问题」列表的重要数学难题。此前DeepMind在帽子集合问题和纽结理论上的突破,都属于人类和AI协同完成。而这次,AI自己挑了大梁。

把视线拉远一点,这件事的真正意义可能不只是那个数学猜想本身。GPT-5.6 Sol Ultra展示了「64个子Agent异步并行+对抗验证」这种多Agent协作模式的有效性。同样的策略未来可能被用到物理、化学、生物学等其他领域——从证明数学定理到设计新材料,再到破解蛋白质折叠。AI不再只是辅助人类思考的工具,它开始成为独立的研究者了。