OpenAI亮出自动化红队模型GPT-Red,专门抓prompt注入漏洞
安全审计自动化
AI安全领域,红队测试也开始用AI自己来干了。OpenAI披露了一款内部使用的自动化红队模型GPT-Red,它能在模型正式部署前,大规模扫描并修复prompt injection(提示注入)漏洞。换句话说,过去靠人海抽查的安全审计,正在升级成系统化的自动覆盖。
prompt injection是什么?简单说,就是有人在与AI对话时,塞进一段「伪装成指令」的内容,诱使模型偏离本来的任务——比如让客服AI泄露内部规则,或者让智能体去执行不该执行的动作。随着AI Agent能调用工具、发邮件、改代码,这类漏洞的危害被成倍放大,已经不是实验室里的玩具问题。
GPT-Red的做法,是模拟各类攻击者的注入策略,在模型上线前主动找弱点。它把红队从「少数安全专家手动试」变成「机器大规模扫」,覆盖面和持续性都上了一个台阶。对整个LLM安全生态来说,这是一次示范:当模型能力涨得比人快,安全测试也得跟着自动化,否则永远是亡羊补牢。
这条消息出现在7月16日的AI技术日报里,同日还有不少硬核进展:Mira Murati的Thinking Machines发布了9750亿参数的开放权重模型Inkling;苹果智能获中国监管批准、将搭载阿里Qwen模型;OpenAI还和Work Louder合作推出了一款230美元的Codex实体键盘。AI的边界,正同时在模型、安全、硬件三个方向往外推。
值得提醒的是,GPT-Red目前是OpenAI内部工具,不等同于对外开源的安全方案。它的意义在于指明了方向:大模型的安全,不能只靠发布前的那几次人工审查。换个角度,自动化红队也带来新问题:用AI找AI的漏洞,攻防两端都在加速,安全团队必须跑得比攻击者更快。这是一场永不停歇的军备竞赛。把视角拉远,当Agent开始替我们发薪、下单、写代码,红队测试的自动化程度,几乎决定了AI能不能被信任地交到普通人手里。