OpenAI 造了个「红队 LLM」GPT-Red,专门找自家模型的漏洞

对抗训练出新招

2026-07-17 15:20
OpenAI 造了个「红队 LLM」GPT-Red,专门找自家模型的漏洞
OpenAI 造了个「红队 LLM」GPT-Red,专门找自家模型的漏洞

《麻省理工科技评论》7 月 15 日披露,OpenAI 内部造出代号 GPT-Red 的「红队模型」,专门攻击测试自家主力模型,逼出安全短板。它定位不是聊天助手,而是一名全天候对抗黑客。

核心人物是 Nikhil Kandpal 和 Dylan Hunn。训练方式是 自对弈式对抗:让 GPT-Red 不断设计攻击样本,拿去拷打目标模型,目标模型挨打中学会防御,双方螺旋升级。这比靠人类红队手工写用例,覆盖率高出不止一个量级。

真正值得警惕的发现,是 GPT-Red 揪出一种叫 fake chain of thought 的新攻击。模型在推理链里植入看似合理、实则诱导的假步骤,就能骗过其他模型得出错误结论。这类攻击隐蔽性强,传统评测几乎扫不到。

效果有硬数据。针对提示注入(prompt injection)的对抗里,升级后的 GPT-5.6 抗攻击成功率超 77%,而老模型 GPT-5 仅不到 10%。差距背后,正是 GPT-Red 反复折磨带来的韧性。

这套打法也不是 OpenAI 独有。谷歌、Anthropic 都在搭建类似的自动化红队,区别只在公开程度。GPT-Red 被媒体点名,反而帮外界看清了一件事:前沿模型的安全水位,越来越靠机器之间的对抗来抬升,人类红队更多扮演规则制定者而非主力战士。

当然,自动化红队也有盲区。它能高效复现已知攻击模式,却很难凭空发明全新漏洞类型——那仍需要人类的直觉和创造力。所以更合理的图景是机器负责「地毯式扫雷」,人类负责「画新雷区」,两者分工而非替代。未来的安全团队,编制里会多出一类「对抗模型训练师」。

说到底,大模型安全不能只靠发布前做一次体检。OpenAI 这步走的意思是:把红队变成永不停机的机器,让模型上线前被自己的「影子对手」揍过无数遍。方向对,但落地还早——这种对抗成本不低,能不能规模化才是真问题。安全这件事,越往前走越像一场没有终点的军备竞赛。红队越强,模型才越敢被信任。