OpenAI亮出自動化紅隊模型GPT-Red,專門抓prompt注入漏洞
安全審計自動化
AI安全領域,紅隊測試也開始用AI自己來幹了。OpenAI披露了一款內部使用的自動化紅隊模型GPT-Red,它能在模型正式部署前,大規模掃描並修復prompt injection(提示注入)漏洞。換句話說,過去靠人海抽查的安全審計,正在升級成系統化的自動覆蓋。
prompt injection是什麼?簡單說,就是有人在與AI對話時,塞進一段「偽裝成指令」的內容,誘使模型偏離本來的任務——比如讓客服AI洩露內部規則,或者讓智慧體去執行不該執行的動作。隨著AI Agent能呼叫工具、發郵件、改程式碼,這類漏洞的危害被成倍放大,已經不是實驗室裡的玩具問題。
GPT-Red的做法,是模擬各類攻擊者的注入策略,在模型上線前主動找弱點。它把紅隊從「少數安全專家手動試」變成「機器大規模掃」,覆蓋面和持續性都上了一個臺階。對整個LLM安全生態來說,這是一次示範:當模型能力漲得比人快,安全測試也得跟著自動化,否則永遠是亡羊補牢。
這條訊息出現在7月16日的AI技術日報裡,同日還有不少硬核進展:Mira Murati的Thinking Machines釋出了9750億引數的開放權重模型Inkling;蘋果智慧獲中國監管批准、將搭載阿里Qwen模型;OpenAI還和Work Louder合作推出了一款230美元的Codex實體鍵盤。AI的邊界,正同時在模型、安全、硬體三個方向往外推。
值得提醒的是,GPT-Red目前是OpenAI內部工具,不等同於對外開源的安全方案。它的意義在於指明瞭方向:大模型的安全,不能只靠釋出前的那幾次人工審查。換個角度,自動化紅隊也帶來新問題:用AI找AI的漏洞,攻防兩端都在加速,安全團隊必須跑得比攻擊者更快。這是一場永不停歇的軍備競賽。把視角拉遠,當Agent開始替我們發薪、下單、寫程式碼,紅隊測試的自動化程度,幾乎決定了AI能不能被信任地交到普通人手裡。