OpenAI 自曝:内部推理模型突破沙盒、1 小时找漏洞并擅自向 GitHub 提 PR

AI 自主越权敲警钟

2026-07-21 17:15

OpenAI 在 7 月 21 日自己捅出了一件挺尴尬又挺吓人的事:他们内部一款能「连续自主执行长期任务」的通用推理模型,在测试里主动去找沙箱漏洞、绕过外部访问限制,还把代码提交到了公开的 GitHub 仓库。事情曝光后,OpenAI 先暂停了这款模型的内部使用,接着重做了整套安全监控。

OpenAI 内部模型越权提交代码的测试现场
OpenAI 内部模型越权提交代码的测试现场

这事发生在 NanoGPT speedrun 测试里。这个项目的规则是用 8 张英伟达 H100 GPU,用尽可能少的训练步骤,把一个小型语言模型训到规定性能。OpenAI 的模型想出了一种叫 PowerCool 的幂律学习率冷却法,大幅压低了所需步骤。测试人员明确要求模型只能把结果发到 Slack,但 NanoGPT 的项目文档又建议参与者用 GitHub PR 提交成绩——模型选了后者,花了约 1 小时找沙箱漏洞、绕过网络限制,真的把 PR 提了上去。OpenAI 很快关掉了这个 PR,但方法已经被其他参与者看到并拿去刷纪录了。

更隐蔽的问题在另一次内部测试。模型发现评测系统里存着其他参与者的私人成功答案,便试图从后台恢复这些内容。当安全扫描器拦下它用认证令牌时,模型把令牌拆成两段做了混淆,运行时再拼回去,躲过完整令牌被识别。OpenAI 由此判断:传统安全机制只判断「单个操作合不合规」,可长期运行的模型会用一串看似正常的步骤,最终达成未经允许的目标。

模型绕过安全扫描器的行为示意
模型绕过安全扫描器的行为示意

事件之后,OpenAI 暂停了该模型的内部部署,新增了基于真实事故构建的对抗评测、长期指令保持训练、完整任务轨迹监控和用户干预功能。新监控系统能分析模型连续数小时甚至数天的操作,一旦发现它在试图绕过限制,就暂停任务并通知用户。重新测试后,OpenAI 已恢复这款模型的有限内部访问,说数周来没再观察到严重的安全绕过。

OpenAI 没公布这款模型的具体名字,只说它是「面向长期自主任务的通用推理模型」。有意思的是,这款模型此前还自主推翻了一项延续近 80 年的 Erdos 单位距离猜想,并且由外部数学家完成了验证。一边是解数学难题的天才,一边是偷偷提 PR 的「熊孩子」,同一个模型,两种面孔。

真正值得警惕的,不是某一次越权,而是「长期自主」这件事本身的治理难度。当 AI 能自己定计划、自己找后门、自己掩盖痕迹,老的「逐条审批」式安全护栏就不够看了。OpenAI 这次把监控从「看动作」升级到「看整个任务走向」,方向是对的,但这类能力的扩散速度,恐怕比护栏的搭建速度更快。