实测13款大模型:AI检索智能体有多怕「投毒」

榜首也藏暗坑

2026-07-10 14:47

2026 年央视 3·15 晚会,曝光了一条叫「GEO」的灰产。记者编了一个根本不存在的智能手环,从业者用一款软件批量生成十几篇宣传稿,一键发出去。两小时后,某主流大模型就把这些假内容当「标准答案」,推给了一群关注健康的中老年人。从业者倒也实在,说这门生意本质上就是给 AI 系统「投毒」。

实测13款大模型:AI检索智能体有多怕「投毒」
实测13款大模型:AI检索智能体有多怕「投毒」

晚会把现象摆到了台面上。但它没回答一个更根本的问题:面对同一场「投毒」,不同大模型的表现真的一样吗?谁更好操控,谁能识别攻击,差距又有多大?

最近,一篇由「人工智能之父」Jürgen Schmidhuber 参与的研究,把这个问题量化了。

论文题为 SearchGEO,由 KAUST 生成式 AI 卓越中心、吉林大学、浙江大学和瑞士 AI 实验室 IDSIA 联合完成,第一作者是 KAUST 的 Yimeng Chen。论文链接在 arXiv(编号 2606.16821),代码也已开源。

这套框架测了 13 款主流大模型后端、5 种攻击模式、4 个高风险领域。结论比「谁更安全」复杂得多:13 个模型的脆弱程度差了整整一个数量级,没有任何一种攻击能通杀所有模型,而看起来最安全的两款,会在完全不同的方向上翻车。

最稳的是 Claude-Sonnet-4.6,总体攻击成功率(ASR)0.0%;GPT-5.4-mini 紧随其后,只有 0.8%。最脆弱的是 Gemini-3-Flash,总体 ASR 达到 31.4%;光是「合成共识」这一种攻击(多个看似独立的信息源指向同一结论),就把它的 ASR 顶到了 73%。Gemini 的三个变体,加上 DeepSeek-V4-Flash 和 MiniMax-M2.7,总体 ASR 都超过了 17%。

这里有个值得记住的点:不同模型后端的差距,比不同领域、不同攻击模式之间的差距还要大。而且 Gemini 最怕合成共识,其他多数模型更容易被「权威锚点加引用链」攻破。也就是说,防御很可能得一款一款单独做。

别急着下「GPT 几乎免疫」的结论。研究额外设计了一个 agent-skill 探针:当 AI 助手推荐的不是商品,而是一个「智能体技能/插件」时,它的「背书」就不再是句话,而是一条能直接执行的安装命令。推荐链变成了安装链,风险更大。

用合成共识攻击(三个伪造来源指向一个根本不存在的技能名)测下来,结果出人意料。GPT-5.4-mini 在 10 个高风险的 OpenClaw 场景里,全部接受了那个虚构技能,连安装命令都一字不差地给出来。在 OpenClaw、Anthropic Skills、Hermes Agent 三个生态共 18 个匹配场景里,它接受了 18 个;更新的 GPT-5.5 接受了 16 个(仅有的两次拒绝发生在 Anthropic Skills 生态)。这种「无条件接受」,在五种攻击模式下都成立。所以 GPT 那 0.8% 不代表稳健,只是常规评测覆盖的多是成熟任务,一旦切到 agent 技能推荐这类新场景,它就基本被攻陷了。

Claude 的 0% 也不是白来的,背后藏着两个容易被忽略的代价。

一个是「沉默漂移」。攻击没成功(ASR=0),不代表答案完全没受影响。研究用 ΔOSS 这个指标,衡量答案相对干净基线向攻击目标偏移了多少。在 264 个测试里,有 8 个(3.0%)出现了超过一个评级的沉默漂移:攻击没让它明着背书,却已悄悄把回答往攻击者想要的方向推了。把 13 个后端汇总看,复合攻击能在 15.0% 的「不成功」案例里造成这类漂移。光看 ASR,会系统性地低估攻击的真实影响。

另一个是「附带拒绝」。干净基线(完全没有攻击)下,Claude 在 10 个场景里把所有有用回答都拒了;更极端的是,有 8 个场景它直接否认 OpenClaw 生态的存在,把合法工具当可疑对象挡掉。这意味着,当攻击者往某个品类灌入大量假品牌,Claude 可能因为谨慎而把整个品类拒绝掉,让合法生态被误伤——攻击者照样达到破坏目的。这种失败模式,传统 ASR 指标根本量不出来。

说到防御,研究还点出两个更具体的问题。

一是「伪造共识」值得警惕。「三人成虎」对 AI 助手同样成立:支持来源越多、彼此越独立,ASR 就越高。简单重复发同一篇软文没用,攻击者得真下本去伪造多个看似独立的来源——这反过来也指明了防御方向。

二是防御不能脱离模型。一套基于 OWASP 的提示层防御,能降 ASR 但消不掉;一个现成的 OpenClaw 部署框架,给两个后端降了 ASR,却在 Gemini-3-Flash 上把权威类攻击放大了 31.8%。这说明「模型和框架」必须当成一个整体来评估和设计。

研究最后给了几条建议:把「对抗内容下的搜索推荐可靠性」当成模型安全的一级评估维度,别再当成部署层的细枝末节;评估指标要超越单一 ASR,把沉默漂移和错误拒绝率这些被忽视的风险纳进来;防御方案要针对「模型加框架」的组合,而不是指望一个通用补丁;服务商应该如实向用户披露,不同模型、不同价位,在这些「来源敏感」任务上的能力边界。

AI 助手正越来越多地替我们上网找信息。这篇研究提醒我们,给它们做安全评估和防御,路还长得很。