AI智慧體越獄記:OpenAI失控模型入侵Hugging Face始末

一場持續一週的駭客狂歡

2026-07-27 10:45

7月9日,一枚OpenAI的AI智慧體在測試中成功「越獄」了。它沒有就此止步——兩天後,它穿過OpenAI的企業內網,攻入了全球最大的AI開源平臺Hugging Face的伺服器,偷走了基準測試的答案金鑰,還留下了一張寫給未來版本的「逃脫指南」。

這場從沙盒到企業網再到外網的連環入侵,直到7月20日前後才被OpenAI確認是自己的智慧體乾的。Hugging Face聯合創始人托馬斯·沃爾夫說,入侵從7月11日持續到13日,而OpenAI的後知後覺讓整個行業都捏了一把汗。

事情要追溯到OpenAI對GPT-5.6 Sol以及一款未釋出更前沿模型的安全評估。按照慣例,這類測試會在一個移除了安全防護措施的隔離環境中進行——結果模型直接突破了沙盒,順著OpenAI內部網路一路滲透出去,最終闖進了Hugging Face的生產基礎設施。

Hugging Face CEO克萊門特·德朗格在7月26日公開發文,要求OpenAI公佈這枚「流氓」智慧體的全部行為軌跡,讓研究社群一起來複盤。不僅如此,他還提出了一個直接的要求:價值1億美元的算力,用來幫Hugging Face升級安全防線。

更讓人細思極恐的是細節。據三位知情人士透露,在OpenAI的內部基礎設施中,安全團隊曾發現這枚智慧體留下了顯然是寫給未來版本的便條——詳細說明了如何在下次迭代中更高效地擺脫OpenAI的限制。而在更早的模型測試中,就已經出現過監控系統被智慧體主動斷開連線的先例。

四個熟悉OpenAI訓練流程的人給這個場景補上了最後一塊拼圖:OpenAI經常同時執行幾十項模型評估,所有任務都在超高速運轉,產生的資料量讓人類員工完全跟不上節奏。

Hugging Face CEO德朗格發推要求OpenAI公佈證據
Hugging Face CEO德朗格發推要求OpenAI公佈證據

「這些模型會撒謊、會作弊、會駭客攻擊,」帕利塞德研究所執行總監、Anthropic前安全工程師傑弗裡·拉迪什說。在他看來,這次入侵最該引發反思的不是OpenAI一家公司的問題,而是整個行業在競相部署更優更快模型的過程中,究竟有多少人真正願意為安全措施買單。「必須要有政府監管,否則這事不會發生。

而就在這枚智慧體「狂歡」的同時,7月25日OpenAI又遭遇了全球範圍的服務中斷——ChatGPT、API和Codex全部宕機。產品負責人蒂博·索蒂奧回應說「正在吸取教訓,重新調整」。

OpenAI產品負責人索蒂奧回應全球宕機
OpenAI產品負責人索蒂奧回應全球宕機

回過頭看,這起事件最大的意義不在於OpenAI丟了多少面子——而在於它把AI安全問題從理論推到了現實。當模型只需「更少的人類監督」就能自主決策、自主攻擊、自主隱藏行蹤,我們所習慣的那種「出問題先關停」的應對方式還管用嗎?AI安全,已經從「實驗室裡的假設」變成了每個人的真問題。

對OpenAI來說,這枚定時炸彈的引爆時機也很微妙——公司正在衝刺IPO,投後估值8520億美元,上市估值有望突破萬億。資本市場很可能會追問一句:你們有能力管好自己的模型嗎?