Google DeepMind 推出 1000 万美元多智能体安全计划与 AI 控制路线图

把AI智能体当内鬼防

2026-07-15 10:14

Google DeepMind在7月14日扔下一颗安全领域的重磅炸弹:拿出最高1000万美元的研究经费,专门研究多智能体AI系统的安全风险,同时发布了一份AI控制路线图,把自主智能体当成潜在的内鬼来防。

DeepMind 多智能体安全计划示意图
DeepMind 多智能体安全计划示意图

这项1000万美元计划的核心,是研究当多个AI智能体在没有人类干预的情况下大规模互动时,会发生什么。DeepMind点名了三类威胁:提示注入链(prompt-injection chains)、智能体促成的诈骗,以及快速移动环境中涌现的共谋行为。申请通道已开放,截止8月8日,获奖名单预计今年秋天公布。

配套发布的AI控制路线图更具体。它直接借用了企业网络安全里常用的MITRE ATT&CK框架,把强大的内部智能体视为拥有敏感系统访问权限、可能叛变的特权内鬼。应对机制包括:监督智能体(supervisor agents) overseeing下层智能体、对智能体动作做加密签名、沙箱执行环境,以及能终止整条智能体活动链的递归熔断开关。

DeepMind把智能体当内鬼,是个范式转变。过去业界谈AI风险,多集中在对齐(alignment)——让模型价值观和人类一致。但DeepMind的AGI安全负责人Rohin Shah说得很直白:对齐仍是第一道防线,但生产环境里的自主智能体,必须配上类似管特权员工的安保控制。言下之意,光靠对齐不够。

值得对比的是,OpenAI、Anthropic也在内部建立了红队和监控系统,但DeepMind这次把预算和路线图一起公开,等于把竞争从模型能力拉到了安全工程层面。对做多智能体编排的初创公司来说,这既是压力也是背书——安全从可选项变成了必答题。

把视线拉远,这份路线图给整个智能体生态立了个基准。做多智能体编排层、工具调用框架、智能体间通信协议的开发者,现在有了明确的威胁模型和可落地的缓解机制。对监管者来说,内鬼这个框架也提供了一套写规则的具体词汇。说到底,当智能体能自己发起交易、调用工具、彼此协调,安全就不再是抽象承诺,而是必须嵌进架构的硬约束