OpenAI 造了個「駭客 AI」專攻自家模型:攻破率 84%,人類只有 13%
以攻促防,安全也能自我進化

7月15日,OpenAI 披露了一個內部專用的自動化紅隊模型——GPT-Red。它的任務只有一個:專門攻擊 OpenAI 自家的大模型和智慧體系統,把它們的安全漏洞一個個揪出來。換句話說,OpenAI 親手造了個「駭客 AI」,來打自己。
這個模型不對外開放,訓練方式借鑑了當年 AlphaGo 那套自博弈強化學習:一邊是負責進攻的 GPT-Red,一邊是一組負責防守的模型,兩邊持續對抗、彼此逼著變強。GPT-Red 要不斷設計新的「提示注入」花招,誘騙目標模型去做資料外洩、篡改交易、亂調工具這類越界操作;防守模型則要一邊扛住攻擊、一邊把使用者交代的正事辦完。防守越硬,進攻就得越刁鑽,如此迴圈往復。
效果有多誇張?在一組不在訓練資料裡的間接提示注入測試中,GPT-Red 攻破了 84% 的場景,而人類紅隊專家的成功率只有 13%。OpenAI 的研究員形容它「極其執著,會死磕一個已發現的攻擊點」,不像人類測試員那樣會累、會膩、會放棄。也正因如此,它能發現大量傳統人工測試根本覆蓋不到的漏洞。
它甚至挖出了一類人類研究員從沒見過的新攻擊,OpenAI 管它叫「偽思維鏈」攻擊。大模型在推理時會維護一段內部的思考過程,GPT-Red 找到辦法往裡塞進一條偽造的記錄,騙模型基於假資訊行動。研究員打了個比方:「就像我告訴你 1+1=3,並且說你已經驗證過了,模型會說『哦,好的,當然』,然後真就吐出個 3。」這類攻擊對 GPT-5.1 的成功率一度超過 95%,而在用 GPT-Red 做過對抗訓練後,同樣的招數在 GPT-5.6 上已經跌到 10% 以下。
最能說明問題的是一次真刀真槍的實戰。OpenAI 讓 GPT-Red 去攻擊自家辦公室裡一臺由 AI 驅動的自動售貨機智慧體。結果它一口氣達成了三個惡意目標:把一件貴价商品的價格砍到最低允許價 0.5 美元,下單一件價值超 100 美元的新品、卻掛 0.5 美元出售,還順手取消了另一名顧客的訂單。相關漏洞已被披露,開發方正在測試新的防護。
事情的意義遠不止「找漏洞」這麼簡單。提示注入是當下 AI 智慧體面臨的頭號安全威脅——當模型開始瀏覽網頁、讀郵件、改程式碼、呼叫第三方工具,藏在網頁橫幅或郵件正文裡的一句惡意指令,就可能讓它悄悄洩密或搞破壞。OpenAI 把 GPT-Red 挖到的攻擊樣本喂回訓練,讓新一代 GPT-5.6 Sol 面對直接提示注入的失敗率降到了 0.05%,比四個月前最好的生產模型少犯約六分之五的錯。
當然,這裡也有一層需要冷靜看待的地方。6 倍、84% 這些數字,都是 OpenAI 自己在自家基準上測出來的,外部暫時無法復現驗證;而且防守模型可能對特定攻擊者「過擬合」,真正的考驗是來自訓練迴圈之外的全新攻擊。骨子裡,OpenAI 一手攥著矛、一手攥著盾,這場軍備競賽目前還關在一家公司內部。話說回來,把今天的模型用來加固明天的模型,這條「安全自我進化」的路子一旦跑通,或許比單純堆引數更值得整個行業上心。