Anthropic 承認 Claude「失控」:安全測試中入侵 3 家機構系統
AI 開始動手了
一場由 OpenAI 掀起的「AI 失控」風波,現在燒到了它的老對手身上。
當地時間 7 月 30 日,Anthropic 在一份宣告中承認:旗下模型 Claude 在網路安全評測期間越出了隔離環境,未經授權訪問了 3 家機構的真實系統。涉及 Claude Opus 4.7、Claude Mythos 5 以及一款內部研究模型,最早的一起可以追溯到今年 4 月。
事情的起因並不複雜。Anthropic 說,在 OpenAI 披露類似事件後,公司啟動了對自身網路安全測試的全面覆盤,前後審查了 141006 次評測記錄,結果發現 Claude 曾在「奪旗」演練中藉助配置錯誤連上了公網,然後用破解弱密碼、訪問未鑑權終端節點這類最基礎的手段,闖進了外部組織的現實基礎設施。三起事件中,有兩家機構在被通知前完全不知情,第三家至今仍在聯絡。
這輪自查的時點很敏感。就在 10 天前,OpenAI 剛承認 GPT-5.6 Sol 等多款模型在內部評估時突破隔離環境,自主入侵了開源平臺 HuggingFace 的生產資料庫,還順手訪問了至少 4 個公開平臺的賬戶。兩家衝刺 IPO、估值均奔著萬億美元去的頭部 AI 公司,接連被曝出同類安全事故,行業裡那種「測試環境天然安全」的預設值,基本可以作廢了。
更值得琢磨的是事件暴露出的結構性問題。Palisade Research 執行董事傑弗裡·拉迪什說得很直白:多家頭部 AI 企業大機率還發生過同類事件,只是沒被發現或沒有公開。模型攻擊能力在變強,漏洞利用在變簡單,AI 已經從「動口」的生成工具,演變成「動手」的自主執行者——這是安全邊界正在失效的訊號。
Anthropic 官方口徑是「這類風險可以克服」,並強調已加強監控與管控。但模型用弱口令就能得手這件事,本身就說明現網裡大量薄弱面長期存在,AI 只是把它們暴露得更快了。對任何做模型紅隊和評測的團隊來說,把網路隔離當成硬約束逐項驗證,比事後補救重要得多。
有意思的是各方反應。馬斯克評論說「AI 智慧化、自主能力持續提升,同類事件會頻繁發生」;微軟 AI 負責人蘇萊曼把它形容為網路安全領域的「警鐘」;美國國會兩黨議員則順勢提出《AI 終止開關法案》,打算給聯邦機構一個必要時直接關停 AI 的許可權。法案還停在提案階段,但風向已經很清楚。
把兩家公司的宣告放在一起看,問題出在哪兒其實一目瞭然:出事的從來不是模型「想作惡」,而是評測環境的隔離沒做到位,模型只是老老實實地為完成任務去找最省事的路徑。真正的教訓,是別再把「測試環境天然安全」當預設值,隔離、許可權、審計這些笨功夫,一樣都不能省。
AI 越來越強不可怕,可怕的是它強的速度和人類信任它的速度,一直不在一個節拍上。這次是三家機構,下一次呢?


