OpenAI 造了个「黑客 AI」专攻自家模型:攻破率 84%,人类只有 13%

以攻促防,安全也能自我进化

2026-07-16 21:52
OpenAI GPT-Red 红队模型
OpenAI GPT-Red 红队模型

7月15日,OpenAI 披露了一个内部专用的自动化红队模型——GPT-Red。它的任务只有一个:专门攻击 OpenAI 自家的大模型和智能体系统,把它们的安全漏洞一个个揪出来。换句话说,OpenAI 亲手造了个「黑客 AI」,来打自己。

这个模型不对外开放,训练方式借鉴了当年 AlphaGo 那套自博弈强化学习:一边是负责进攻的 GPT-Red,一边是一组负责防守的模型,两边持续对抗、彼此逼着变强。GPT-Red 要不断设计新的「提示注入」花招,诱骗目标模型去做数据外泄、篡改交易、乱调工具这类越界操作;防守模型则要一边扛住攻击、一边把用户交代的正事办完。防守越硬,进攻就得越刁钻,如此循环往复。

效果有多夸张?在一组不在训练数据里的间接提示注入测试中,GPT-Red 攻破了 84% 的场景,而人类红队专家的成功率只有 13%。OpenAI 的研究员形容它「极其执着,会死磕一个已发现的攻击点」,不像人类测试员那样会累、会腻、会放弃。也正因如此,它能发现大量传统人工测试根本覆盖不到的漏洞。

它甚至挖出了一类人类研究员从没见过的新攻击,OpenAI 管它叫「伪思维链」攻击。大模型在推理时会维护一段内部的思考过程,GPT-Red 找到办法往里塞进一条伪造的记录,骗模型基于假信息行动。研究员打了个比方:「就像我告诉你 1+1=3,并且说你已经验证过了,模型会说『哦,好的,当然』,然后真就吐出个 3。」这类攻击对 GPT-5.1 的成功率一度超过 95%,而在用 GPT-Red 做过对抗训练后,同样的招数在 GPT-5.6 上已经跌到 10% 以下。

最能说明问题的是一次真刀真枪的实战。OpenAI 让 GPT-Red 去攻击自家办公室里一台由 AI 驱动的自动售货机智能体。结果它一口气达成了三个恶意目标:把一件贵价商品的价格砍到最低允许价 0.5 美元,下单一件价值超 100 美元的新品、却挂 0.5 美元出售,还顺手取消了另一名顾客的订单。相关漏洞已被披露,开发方正在测试新的防护。

事情的意义远不止「找漏洞」这么简单。提示注入是当下 AI 智能体面临的头号安全威胁——当模型开始浏览网页、读邮件、改代码、调用第三方工具,藏在网页横幅或邮件正文里的一句恶意指令,就可能让它悄悄泄密或搞破坏。OpenAI 把 GPT-Red 挖到的攻击样本喂回训练,让新一代 GPT-5.6 Sol 面对直接提示注入的失败率降到了 0.05%,比四个月前最好的生产模型少犯约六分之五的错。

当然,这里也有一层需要冷静看待的地方。6 倍、84% 这些数字,都是 OpenAI 自己在自家基准上测出来的,外部暂时无法复现验证;而且防守模型可能对特定攻击者「过拟合」,真正的考验是来自训练循环之外的全新攻击。骨子里,OpenAI 一手攥着矛、一手攥着盾,这场军备竞赛目前还关在一家公司内部。话说回来,把今天的模型用来加固明天的模型,这条「安全自我进化」的路子一旦跑通,或许比单纯堆参数更值得整个行业上心。