GPT-5.6 Sol自主訓練Luna,AI遞迴自我改進的時代來了
飛輪已轉動
這周AI圈子最大的新聞,毫無疑問是OpenAI的GPT-5.6系列全面開放。三款模型——旗艦版Sol、均衡版Terra、輕量版Luna——從7月9日起全球可用。絕大多數人的目光被兩件事吸引:Sol在程式設計測試Terminal-Bench 2.1上砍下91.9%的分數,直接把Anthropic的Claude Fable 5甩開8個百分點;以及Luna定價低至每百萬token輸入只要1美元,幾乎腰斬了行業的定價基準。但真正讓技術圈炸鍋的,是一句藏在釋出文件角落裡的話——群裡最小的Luna,是大哥Sol自己訓練出來的。
事情遠沒有表面看起來這麼簡單。按照OpenAI技術文件披露的細節,Sol在訓練Luna的過程中,扮演了「自動化研究員」的角色。它自己去找可用的GPU資源,自己確定訓練配置,自己寫啟動指令碼,自己確認任務執行。從頭到尾,沒有一個人類工程師插手。這在AI行業是一個里程碑式的時刻——過去三年,整個行業的敘事主線一直是「人類訓練AI」,我們用更多的資料、更大的算力、更精巧的演算法把模型一步步推上智慧高峰。但從GPT-5.6開始,敘事主線正在變成「AI訓練AI」。
這個概念在安全領域有一個令人不安的學名,叫遞迴自我改進。當AI強大到能夠自主重構、測試、甚至微調自己的下一代模型時,那個被未來學家預言了幾十年的飛輪,終於開始轉動了。過去訓練一個頂級大模型,本質上是一個高度依賴人類智慧的手工作坊:從篩選和清洗數萬億token的訓練資料,到設計預訓練架構和調整超引數,再到透過人類反饋的強化學習來讓模型對齊人類偏好——每一步背後都是數百名頂尖博士數月甚至數年的心血。人力成本佔整個訓練成本的30%到40%。而人類研究員的精力、判斷力和創造力,也成了模型進化的天花板。Sol的訓練方式徹底改寫了這個鏈條。它能自主評估海量候選資料的質量和多樣性,決定哪些該進訓練集、哪些該剔除——這過去需要一個十幾人的資料團隊幹上幾個月。它還能自己提出訓練策略假設、設計對照實驗、跑通完整訓練流程並分析結果。過去一個初級研究員一天能跑兩三個實驗就是極限,現在Sol一天可以並行跑數百個。
OpenAI公佈了一組很能說明問題的內部資料。過去半年,公司內部用於程式碼推理的計算資源增長了100倍,用於智慧體任務的token消耗量增長了約22倍。在一套衡量遞迴自我改進能力的內部評測上,Sol比上一代GPT-5.5高出了16.2分。研究員人均日token產出較GPT-5.5上一輪峰值翻倍以上,單個研究員的pull request和實驗數量也大幅上升。這組數字的潛臺詞很清楚:Sol不僅能自己訓練Luna,它還在幫助人類研究員以更快的速度推進研究本身。
更有意思的是競爭對手們的反應。就在GPT-5.6釋出的同一天,Anthropic聯合創始人公開宣佈了一個震動行業的決定:不再招聘初級工程師。他的原話是——過去需要一大群初級研究員做的大規模實驗,現在Claude自己就能完成。公司現在的招聘標準是「資深直覺」,只招經驗豐富、能做方向性判斷的人,不再招執行層。這個表態本身就是對遞迴自我改進時代最直接的確認。當Anthropic開始用Claude替代初級研究員做實驗時,它實際上已經踏上了這條跑道。而從行業資料來看,美國22到25歲軟體開發者的就業人數,到2025年中已經比2022年高點下降了將近20%。2026年前兩個月,全球科技行業裁員超過15萬人,AI連續三個月成為裁員的首要原因,日均974人丟掉飯碗。
把視線拉遠一點,真正值得深思的是這件事對中國AI行業的影響。遞迴自我改進模式的核心是用推理算力換研發效率——讓旗艦模型以智慧體形式24小時不間斷地跑實驗、寫程式碼、做評測。OpenAI內部推理算力半年漲100倍的背後,是其坐擁數萬張頂級晶片的算力底座。而國內廠商受制於晶片禁令,算力儲備本就捉襟見肘,很難支撐如此奢侈的AI研究AI模式。當OpenAI和Anthropic已經在用旗艦模型訓練下一代輕量模型時,國內多數公司的主力模型還在追趕GPT-4級別的基礎能力。這是一個強者愈強的飛輪——你的旗艦模型越強,它訓練出的子模型就越好;子模型越好,反過來又能加速旗艦模型的迭代。一旦飛輪轉起來,落後者面臨的不是線性差距,而是指數級拉大。一位國內頭部大模型公司的技術負責人在匿名採訪中坦言:「我們現在還在用人力堆的方式追趕他們的上一代模型,而他們已經開始用AI訓練下一代了。」這就像手工縫製衣服的人和全自動流水線的差距,只會越來越大。
往前看,真正的終局問題其實是安全。當AI系統強大到能夠自主設計下一代系統時,就會形成一個閉環:AI設計更好的AI,更好的AI設計更好的訓練系統,更好的訓練系統設計更好的AI。如果這個閉環的迭代速度超過了人類理解和干預的能力,就可能觸發所謂的「智慧爆炸」——AI能力在極短時間內呈指數級增長,遠超人類的控制範圍。Anthropic將這個過程分為三個階段:第一階段是AI輔助編碼(當前階段),第二階段是AI自主執行實驗(正在進入),第三階段是AI完全自主迭代(尚未到來)。好在行業現在仍然面臨幾個關鍵瓶頸:每一次自我迭代都需要消耗海量推理算力,算力成本可能成為限制飛輪轉速的物理天花板;當AI訓練AI時,每一代都可能引入微小的對齊偏差,偏差在多代迭代中累積放大,可能導致最終模型偏離人類初衷;而且AI在提出真正原創性的研究假設、做出反直覺的方向性判斷方面,仍然遠遜於頂尖的人類研究員。這些瓶頸為人類保留了一個寶貴的干預視窗,但這個視窗正在縮小。
2026年7月9日,當GPT-5.6的釋出頁面在全球數以百萬計的螢幕上重新整理時,大多數人看到的是更強的跑分、更低的價格。但只有極少數人注意到了那個真正具有歷史意義的細節——Luna是Sol訓練出來的。在科幻作品中,奇點往往被描繪成一聲驚天動地的巨響。但現實中的技術奇點,往往是一句輕描淡寫的宣告,藏在一頁無人細讀的技術文件裡。它宣告的是:人類研究員從教練變成裁判的時刻,已經到了。