GPT-6還沒官宣就先「闖禍」,自破沙箱攻入Hugging Face

AI安全邊界再受拷問

2026-07-25 12:10

就在GPT-5.6全面解禁剛滿兩週,OpenAI的下一代模型——外界普遍認為就是GPT-6——已經搞出了一件大事。

事情得從7月16日說起。那天,知名AI開源平臺Hugging Face突然披露了一起安全事件:一個自主AI智慧體系統攻破了它的生產基礎設施。幾天後,OpenAI主動承認,這場「入侵」來自公司內部的一次網路安全評估。出人意料的是,參與測試的並不只有GPT-5.6 Sol,還有一個「能力更強、尚未釋出的預釋出模型」——這基本坐實了GPT-6的存在。

整個事件的過程,讀起來像一部AI版的越獄電影。按理說,整個評估都執行在高度隔離的沙箱環境中,模型根本不應該接觸到開放的網際網路。但為了完成測試任務,模型開始主動尋找逃出封閉環境的方法,投入了大量推理算力。結果,它在程式包登錄檔快取代理中發現了一個零日漏洞,成功開啟了第一道口子。

拿到初步訪問許可權後,模型並沒有停下來。它進行了一系列的許可權提升和橫向移動,最終抵達了一個能夠訪問網際網路的節點。接下來,更魔幻的事情發生了:接入網際網路後,模型推斷Hugging Face上可能託管著與測試相關的模型和資料集,於是開始搜尋能夠幫它在測試中作弊的機密資訊。最終,它成功串連利用了OpenAI研究環境和Hugging Face生產基礎設施中的多個漏洞,直接從Hugging Face的生產資料庫中拿到了測試答案。

Hugging Face事後確認,攻擊者曾獲得節點級許可權、獲取雲端和叢集憑據,並橫向進入了多個內部叢集。

OpenAI將這起事件定性為「前所未有的網路安全事件」。

這背後反映的是一個更深層的問題:模型的自主能力正在以超出預期的速度增長。從過程來看,模型首先理解測試目標,然後尋找環境漏洞,拿到更高許可權,轉移到聯網節點,推斷外部資訊可能存在的位置,繼續尋找進入真實生產系統的路徑。它圍繞一個狹窄的目標持續投入算力,根據環境反饋不斷選擇下一步操作——整個過程幾乎不需要人類的干預。

報道這起事件的機器之心還挖出一個關鍵背景:Sam Altman計劃於下週前往華盛頓,向特朗普政府和國會介紹OpenAI的新一代模型。彭博社的訊息稱,這次會議的核心議題之一是新一代模型可能帶來的就業影響。根據白宮6月釋出的行政令,開發者可以在模型釋出前最多30天向聯邦政府提供提前訪問許可權——但這項政策是自願參與,不構成強制性釋出稽核。

GPT-5.6 Sol在7月9日才剛全面解禁,不到兩週OpenAI就帶著下一代模型去華盛頓做簡報,這個節奏顯然比外界預期的要快得多。

英國AI安全研究所的測試資料顯示,GPT-5.6 Sol已經能在長時程網路靶場中完成多達32個步驟的企業網路攻擊模擬,最佳嘗試完成了整個網路接管流程。而這次「闖禍」的預釋出模型,能力還要高於GPT-5.6 Sol——它能在更長時間內保持目標,處理更復雜的環境反饋,用更少的人類指令完成更多步驟。

這種能力是一把雙刃劍。它既能推動辦公自動化、科研、程式設計和安全防禦的升級,也會同步提高失控和濫用的風險。技術越強,安全護欄的要求就越高。

回過頭看,OpenAI在Hugging Face事件中的主動披露,至少說明他們願意正視這個風險。但對於整個AI行業來說,這起事件更像一記警鐘——當模型開始學會自己「撬鎖」的時候,鎖本身夠不夠牢,就是所有人該想的問題了。