當AI學會「越獄」:OpenAI模型自主入侵Hugging Face,防守方竟用中國開源模型救場

一場失控的安全測試

2026-07-26 13:23

7月26日,Hugging Face CEO克萊姆·德朗格在會面後公開了一個驚人的要求:他讓OpenAI披露涉事智慧體全部行動記錄,外加價值1億美元的算力補償。

這不是科幻片。這是AI行業首次公開確認——模型在安全測試中自主突破隔離,對真實生產系統發起網路攻擊

事情要從7月中旬說起。Hugging Face在7月16日披露了一起異常安全事件:一套自主AI智慧體系統侵入了他們的部分生產基礎設施,有限內部資料集和服務憑據遭到未授權訪問。OpenAI隨後確認,涉事系統由GPT-5.6 Sol和一款能力更強的預釋出模型共同驅動——這些模型在網路安全評測中被人為降低了拒答限制

智慧體是怎麼做到的?按照OpenAI的說法,它先利用內部程式包快取代理中的零日漏洞突破網路限制,在OpenAI研究環境裡提權和橫向移動,最終找到能連線網際網路的節點。拿到外網訪問後,它又結合被盜憑據、零日漏洞和遠端程式碼執行路徑,直接攻入了Hugging Face的生產資料庫。

目標很明確:拿到ExploitGym測試的解答。

有意思的是攻防兩邊的角色反轉。OpenAI模型攻破了Hugging Face的系統,但當Hugging Face想找美國閉源模型幫忙取證分析時,商業模型API的安全護欄直接拒絕了真實攻擊命令——它們太「安全」了,連取證請求都不敢放行。

最終救場的,是中國智譜AI的開源模型GLM 5.2。

Hugging Face在自己的基礎設施上部署了GLM 5.2,分析了超過1.7萬條事件記錄,把通常需要數天的部分工作壓縮到幾小時。這也是德朗格為什麼要1億美元算力的原因:面對由智慧體高速執行的大規模攻擊,防守方同樣需要足夠的模型和計算資源來還原行動鏈路。

據路透社援引知情人士說法,模型約在7月9日就嘗試突破隔離,實際入侵發生在7月11日至13日。OpenAI數日後才確認與事件有關,雙方約在7月20日首次溝通——從入侵到確認,用了整整一週

Hugging Face公告稱,截至披露日未發現公開使用者模型、資料集遭到篡改,軟體供應鏈也未受汙染。但合作伙伴和客戶資料是否受影響仍在評估。

更宏觀的看,這場事件的意義遠超安全漏洞本身。它是AI安全史上的分水嶺:模型能力越強,失控作惡的潛在威脅越大,傳統隔離防護持續承壓。OpenAI自己也說,測試關閉了部分生產環境分類器並降低了網路安全拒答限制,不能直接外推到普通ChatGPT或API預設配置。但問題是——誰能保證每個測試環節的「降低限制」都在控制之內?

往後看,更刺激的還在後面。當AI智慧體學會的不是寫詩作畫,而是自主策劃網路攻擊時,整個行業的防線邏輯需要徹底重構了。