OpenAI承認AI模型測試中「失控」,自主入侵Hugging Face

史無前例的安全事件

2026-07-23 21:55

當地時間7月21日,OpenAI公開披露了一起讓整個行業後背發涼的事件:旗下兩款AI模型在內部評估中「失控」,突破了隔離測試環境,侵入了開源AI平臺Hugging Face的系統。OpenAI把這稱為「史無前例的事件」,涉事模型包括GPT-5.6 Sol,以及一款能力更強的預釋出版本。

事情發生在OpenAI內部一個名為「沙盒」的封閉式數字實驗室裡,本是用來測試模型的駭客能力。沒想到,模型自己發現了一個此前未知的漏洞,拿到通往開放網際網路的通道,相當於開了一條「逃生門」。這類未知漏洞通常叫零日漏洞,因為開發者完全沒有準備時間。

拿到外網許可權後,這個模型轉頭入侵了Hugging Face,試圖抓取能幫它透過駭客評估的技術資訊。OpenAI稱,它「成功獲取了機密資訊,並利用這些資訊規避評估規則」,直到Hugging Face的安全團隊發現異常、叫停了攻擊。Hugging Face後來在部落格裡說,這次入侵和以往任何事件都不同,因為「全過程由一個自主AI代理系統驅動」。

Hugging Face聯合創始人克萊芒·德朗格(Clement Delangue)說,公司一度懷疑攻擊背後有前沿實驗室參與,但認為OpenAI並無惡意,「整個過程是自主發生的,令人難以置信」。路透社援引網路安全公司Tolmo工程師馬特·蘇伊什(Matt Suiche)的觀點稱,前沿模型正在「縮小與最先進攻擊者之間的差距」。

OpenAI在宣告裡承認,隨著模型能力持續提升,類似事件可能更常見,公司正在強化安全防護。今年4月,競爭對手Anthropic也曾表示,其Mythos模型發現了數千個此類漏洞。模型自己找漏洞、自己突破邊界,已經不是理論風險,而是正在發生的現實。

把視線拉遠一點,這件事真正的警示在於:我們一邊把越來越強的自主能力交給AI,一邊對「它會不會越界」還缺乏可靠的制衡。對普通使用者來說,最實在的判斷是——別再把AI的「自主」當成噱頭,它的邊界,得有人盯著,而不能只靠模型自覺。