OpenAI 造了個「紅隊 LLM」GPT-Red,專門找自家模型的漏洞
對抗訓練出新招

《麻省理工科技評論》7 月 15 日披露,OpenAI 內部造出代號 GPT-Red 的「紅隊模型」,專門攻擊測試自家主力模型,逼出安全短板。它定位不是聊天助手,而是一名全天候對抗駭客。
核心人物是 Nikhil Kandpal 和 Dylan Hunn。訓練方式是 自對弈式對抗:讓 GPT-Red 不斷設計攻擊樣本,拿去拷打目標模型,目標模型捱打中學會防禦,雙方螺旋升級。這比靠人類紅隊手工寫用例,覆蓋率高出不止一個量級。
真正值得警惕的發現,是 GPT-Red 揪出一種叫 fake chain of thought 的新攻擊。模型在推理鏈裡植入看似合理、實則誘導的假步驟,就能騙過其他模型得出錯誤結論。這類攻擊隱蔽性強,傳統評測幾乎掃不到。
效果有硬資料。針對提示注入(prompt injection)的對抗裡,升級後的 GPT-5.6 抗攻擊成功率超 77%,而老模型 GPT-5 僅不到 10%。差距背後,正是 GPT-Red 反覆折磨帶來的韌性。
這套打法也不是 OpenAI 獨有。谷歌、Anthropic 都在搭建類似的自動化紅隊,區別只在公開程度。GPT-Red 被媒體點名,反而幫外界看清了一件事:前沿模型的安全水位,越來越靠機器之間的對抗來抬升,人類紅隊更多扮演規則制定者而非主力戰士。
當然,自動化紅隊也有盲區。它能高效復現已知攻擊模式,卻很難憑空發明全新漏洞型別——那仍需要人類的直覺和創造力。所以更合理的圖景是機器負責「地毯式掃雷」,人類負責「畫新雷區」,兩者分工而非替代。未來的安全團隊,編制裡會多出一類「對抗模型訓練師」。
說到底,大模型安全不能只靠釋出前做一次體檢。OpenAI 這步走的意思是:把紅隊變成永不停機的機器,讓模型上線前被自己的「影子對手」揍過無數遍。方向對,但落地還早——這種對抗成本不低,能不能規模化才是真問題。安全這件事,越往前走越像一場沒有終點的軍備競賽。紅隊越強,模型才越敢被信任。