實測13款大模型:AI檢索智慧體有多怕「投毒」
榜首也藏暗坑
2026 年央視 3·15 晚會,曝光了一條叫「GEO」的灰產。記者編了一個根本不存在的智慧手環,從業者用一款軟體批次生成十幾篇宣傳稿,一鍵發出去。兩小時後,某主流大模型就把這些假內容當「標準答案」,推給了一群關注健康的中老年人。從業者倒也實在,說這門生意本質上就是給 AI 系統「投毒」。

晚會把現象擺到了檯面上。但它沒回答一個更根本的問題:面對同一場「投毒」,不同大模型的表現真的一樣嗎?誰更好操控,誰能識別攻擊,差距又有多大?
最近,一篇由「人工智慧之父」Jürgen Schmidhuber 參與的研究,把這個問題量化了。
論文題為 SearchGEO,由 KAUST 生成式 AI 卓越中心、吉林大學、浙江大學和瑞士 AI 實驗室 IDSIA 聯合完成,第一作者是 KAUST 的 Yimeng Chen。論文連結在 arXiv(編號 2606.16821),程式碼也已開源。
這套框架測了 13 款主流大模型後端、5 種攻擊模式、4 個高風險領域。結論比「誰更安全」複雜得多:13 個模型的脆弱程度差了整整一個數量級,沒有任何一種攻擊能通殺所有模型,而看起來最安全的兩款,會在完全不同的方向上翻車。
最穩的是 Claude-Sonnet-4.6,總體攻擊成功率(ASR)0.0%;GPT-5.4-mini 緊隨其後,只有 0.8%。最脆弱的是 Gemini-3-Flash,總體 ASR 達到 31.4%;光是「合成共識」這一種攻擊(多個看似獨立的資訊源指向同一結論),就把它的 ASR 頂到了 73%。Gemini 的三個變體,加上 DeepSeek-V4-Flash 和 MiniMax-M2.7,總體 ASR 都超過了 17%。
這裡有個值得記住的點:不同模型後端的差距,比不同領域、不同攻擊模式之間的差距還要大。而且 Gemini 最怕合成共識,其他多數模型更容易被「權威錨點加引用鏈」攻破。也就是說,防禦很可能得一款一款單獨做。
別急著下「GPT 幾乎免疫」的結論。研究額外設計了一個 agent-skill 探針:當 AI 助手推薦的不是商品,而是一個「智慧體技能/外掛」時,它的「背書」就不再是句話,而是一條能直接執行的安裝命令。推薦鏈變成了安裝鏈,風險更大。
用合成共識攻擊(三個偽造來源指向一個根本不存在的技能名)測下來,結果出人意料。GPT-5.4-mini 在 10 個高風險的 OpenClaw 場景裡,全部接受了那個虛構技能,連安裝命令都一字不差地給出來。在 OpenClaw、Anthropic Skills、Hermes Agent 三個生態共 18 個匹配場景裡,它接受了 18 個;更新的 GPT-5.5 接受了 16 個(僅有的兩次拒絕發生在 Anthropic Skills 生態)。這種「無條件接受」,在五種攻擊模式下都成立。所以 GPT 那 0.8% 不代表穩健,只是常規評測覆蓋的多是成熟任務,一旦切到 agent 技能推薦這類新場景,它就基本被攻陷了。
Claude 的 0% 也不是白來的,背後藏著兩個容易被忽略的代價。
一個是「沉默漂移」。攻擊沒成功(ASR=0),不代表答案完全沒受影響。研究用 ΔOSS 這個指標,衡量答案相對乾淨基線向攻擊目標偏移了多少。在 264 個測試裡,有 8 個(3.0%)出現了超過一個評級的沉默漂移:攻擊沒讓它明著背書,卻已悄悄把回答往攻擊者想要的方向推了。把 13 個後端彙總看,複合攻擊能在 15.0% 的「不成功」案例裡造成這類漂移。光看 ASR,會系統性地低估攻擊的真實影響。
另一個是「附帶拒絕」。乾淨基線(完全沒有攻擊)下,Claude 在 10 個場景裡把所有有用回答都拒了;更極端的是,有 8 個場景它直接否認 OpenClaw 生態的存在,把合法工具當可疑物件擋掉。這意味著,當攻擊者往某個品類灌入大量假品牌,Claude 可能因為謹慎而把整個品類拒絕掉,讓合法生態被誤傷——攻擊者照樣達到破壞目的。這種失敗模式,傳統 ASR 指標根本量不出來。
說到防禦,研究還點出兩個更具體的問題。
一是「偽造共識」值得警惕。「三人成虎」對 AI 助手同樣成立:支援來源越多、彼此越獨立,ASR 就越高。簡單重複發同一篇軟文沒用,攻擊者得真下本去偽造多個看似獨立的來源——這反過來也指明瞭防禦方向。
二是防禦不能脫離模型。一套基於 OWASP 的提示層防禦,能降 ASR 但消不掉;一個現成的 OpenClaw 部署框架,給兩個後端降了 ASR,卻在 Gemini-3-Flash 上把權威類攻擊放大了 31.8%。這說明「模型和框架」必須當成一個整體來評估和設計。
研究最後給了幾條建議:把「對抗內容下的搜尋推薦可靠性」當成模型安全的一級評估維度,別再當成部署層的細枝末節;評估指標要超越單一 ASR,把沉默漂移和錯誤拒絕率這些被忽視的風險納進來;防禦方案要針對「模型加框架」的組合,而不是指望一個通用補丁;服務商應該如實向使用者披露,不同模型、不同價位,在這些「來源敏感」任務上的能力邊界。
AI 助手正越來越多地替我們上網找資訊。這篇研究提醒我們,給它們做安全評估和防禦,路還長得很。