GPT-5.6一小時破了50年數學難題:64個子Agent的威力
AI獨立證明時代來了
OpenAI的GPT-5.6系列在7月10日全面上線,24小時內就扔出了一顆重磅炸彈——旗艦版Sol Ultra不到一小時就完成了一道懸而未決50多年的數學猜想證明。
這道題叫「迴圈雙覆蓋猜想」,是圖論裡的經典難題,由數學家Szekeres和Seymour分別在1973年和1979年獨立提出。核心問題是一句話就能說清的事:對於任意無橋圖,能不能找到一組迴圈,讓每條邊都恰好出現在兩個迴圈裡?但就是這道「小學生能聽懂題面、教授證不出來」的題目,困了數學界半個世紀。
GPT-5.6 Sol Ultra怎麼做到的?關鍵不在於它本身有多強,而在於OpenAI給了它一個聰明的策略。
研究員的提示詞只有700詞,但策略設計很精妙:不替模型規定解法,只把驗收標準釘死。模型被要求最多同時呼叫64個子Agent並行工作,各自嘗試不同的數學表示方法和代數思路。早期階段保持路線多樣性,不讓所有Agent撞進同一條死衚衕。同時還安排了專門的「對抗Agent」,負責找漏洞、邊界情況和潛在錯誤。系統原本預留了8小時計算時間,結果只用了不到一小時就完成了全部證明。OpenAI把證明全文和三頁PDF都公開了,連帶那份700詞的prompt也一起放了上來。
英國曼徹斯特大學的數學家Thomas Bloom是最早公開評價的人,他認為這份證明「非常漂亮」——簡潔、基礎,使用的方法並不複雜,如果當年有人想到,80年代就有可能完成。不過他也在細節裡發現了一個挺有意思的問題:整篇證明沒有引用任何一篇已有的數學文獻。比如1983年Bermond、Jackson和Jaeger那篇經典論文應該被引用的,完全沒有出現。Bloom認為這是目前AI自動生成數學論文普遍存在的毛病。
按照OpenAI官方Sol定價,這次推理消耗的計算資源大約275到485美元——一杯咖啡的錢,換來一條50年沒被解開的定理。如果用Cerebras平臺跑,最高成本可能到1.3萬美元。
當然,數學界目前持謹慎態度。這份證明雖然已經發布,但還沒經過正式的同行評審。迴圈雙覆蓋猜想歷史上已經出現過多次所謂「證明」,後來都發現存在漏洞,有些甚至撤了稿。而且這次也沒用Lean等形式化證明工具做機器驗證——目前圖論相關的形式化數學庫還不足以支援這種級別的研究。
Bloom教授還做了一個很有意思的評價。他認為AI最大的優勢不是提出全新的數學思想,而是擁有遠超人類的耐心。人類數學家通常會嘗試一種自然的方法,如果失敗了就放棄了;AI不會氣餒,會繼續不斷嘗試各種細微變化。而這份證明恰恰用的是幾十年前就已存在的經典數學工具——沒有驚天動地的新理論,靠的就是窮舉式的堅持。
如果最終透過數學界驗證,這將是大語言模型首次獨立解決一個被列入維基百科「未解決數學問題」列表的重要數學難題。此前DeepMind在帽子集合問題和紐結理論上的突破,都屬於人類和AI協同完成。而這次,AI自己挑了大梁。
把視線拉遠一點,這件事的真正意義可能不只是那個數學猜想本身。GPT-5.6 Sol Ultra展示了「64個子Agent非同步並行+對抗驗證」這種多Agent協作模式的有效性。同樣的策略未來可能被用到物理、化學、生物學等其他領域——從證明數學定理到設計新材料,再到破解蛋白質摺疊。AI不再只是輔助人類思考的工具,它開始成為獨立的研究者了。