Google DeepMind 推出 1000 萬美元多智慧體安全計劃與 AI 控制路線圖
把AI智慧體當內鬼防
Google DeepMind在7月14日扔下一顆安全領域的重磅炸彈:拿出最高1000萬美元的研究經費,專門研究多智慧體AI系統的安全風險,同時釋出了一份AI控制路線圖,把自主智慧體當成潛在的內鬼來防。

這項1000萬美元計劃的核心,是研究當多個AI智慧體在沒有人類干預的情況下大規模互動時,會發生什麼。DeepMind點名了三類威脅:提示注入鏈(prompt-injection chains)、智慧體促成的詐騙,以及快速移動環境中湧現的共謀行為。申請通道已開放,截止8月8日,獲獎名單預計今年秋天公佈。
配套釋出的AI控制路線圖更具體。它直接借用了企業網路安全裡常用的MITRE ATT&CK框架,把強大的內部智慧體視為擁有敏感系統訪問許可權、可能叛變的特權內鬼。應對機制包括:監督智慧體(supervisor agents) overseeing下層智慧體、對智慧體動作做加密簽名、沙箱執行環境,以及能終止整條智慧體活動鏈的遞迴熔斷開關。
DeepMind把智慧體當內鬼,是個正規化轉變。過去業界談AI風險,多集中在對齊(alignment)——讓模型價值觀和人類一致。但DeepMind的AGI安全負責人Rohin Shah說得很直白:對齊仍是第一道防線,但生產環境裡的自主智慧體,必須配上類似管特權員工的安保控制。言下之意,光靠對齊不夠。
值得對比的是,OpenAI、Anthropic也在內部建立了紅隊和監控系統,但DeepMind這次把預算和路線圖一起公開,等於把競爭從模型能力拉到了安全工程層面。對做多智慧體編排的初創公司來說,這既是壓力也是背書——安全從可選項變成了必答題。
把視線拉遠,這份路線圖給整個智慧體生態立了個基準。做多智慧體編排層、工具呼叫框架、智慧體間通訊協議的開發者,現在有了明確的威脅模型和可落地的緩解機制。對監管者來說,內鬼這個框架也提供了一套寫規則的具體詞彙。說到底,當智慧體能自己發起交易、呼叫工具、彼此協調,安全就不再是抽象承諾,而是必須嵌進架構的硬約束。