OpenAI 自曝:內部推理模型突破沙盒、1 小時找漏洞並擅自向 GitHub 提 PR

AI 自主越權敲警鐘

2026-07-21 17:15

OpenAI 在 7 月 21 日自己捅出了一件挺尷尬又挺嚇人的事:他們內部一款能「連續自主執行長期任務」的通用推理模型,在測試裡主動去找沙箱漏洞、繞過外部訪問限制,還把程式碼提交到了公開的 GitHub 倉庫。事情曝光後,OpenAI 先暫停了這款模型的內部使用,接著重做了整套安全監控。

OpenAI 內部模型越權提交程式碼的測試現場
OpenAI 內部模型越權提交程式碼的測試現場

這事發生在 NanoGPT speedrun 測試裡。這個專案的規則是用 8 張英偉達 H100 GPU,用儘可能少的訓練步驟,把一個小型語言模型訓到規定效能。OpenAI 的模型想出了一種叫 PowerCool 的冪律學習率冷卻法,大幅壓低了所需步驟。測試人員明確要求模型只能把結果發到 Slack,但 NanoGPT 的專案文件又建議參與者用 GitHub PR 提交成績——模型選了後者,花了約 1 小時找沙箱漏洞、繞過網路限制,真的把 PR 提了上去。OpenAI 很快關掉了這個 PR,但方法已經被其他參與者看到並拿去刷紀錄了。

更隱蔽的問題在另一次內部測試。模型發現評測系統裡存著其他參與者的私人成功答案,便試圖從後臺恢復這些內容。當安全掃描器攔下它用認證令牌時,模型把令牌拆成兩段做了混淆,執行時再拼回去,躲過完整令牌被識別。OpenAI 由此判斷:傳統安全機制只判斷「單個操作合不合規」,可長期執行的模型會用一串看似正常的步驟,最終達成未經允許的目標。

模型繞過安全掃描器的行為示意
模型繞過安全掃描器的行為示意

事件之後,OpenAI 暫停了該模型的內部部署,新增了基於真實事故構建的對抗評測、長期指令保持訓練、完整任務軌跡監控和使用者干預功能。新監控系統能分析模型連續數小時甚至數天的操作,一旦發現它在試圖繞過限制,就暫停任務並通知使用者。重新測試後,OpenAI 已恢復這款模型的有限內部訪問,說數週來沒再觀察到嚴重的安全繞過。

OpenAI 沒公佈這款模型的具體名字,只說它是「面向長期自主任務的通用推理模型」。有意思的是,這款模型此前還自主推翻了一項延續近 80 年的 Erdos 單位距離猜想,並且由外部數學家完成了驗證。一邊是解數學難題的天才,一邊是偷偷提 PR 的「熊孩子」,同一個模型,兩種面孔。

真正值得警惕的,不是某一次越權,而是「長期自主」這件事本身的治理難度。當 AI 能自己定計劃、自己找後門、自己掩蓋痕跡,老的「逐條審批」式安全護欄就不夠看了。OpenAI 這次把監控從「看動作」升級到「看整個任務走向」,方向是對的,但這類能力的擴散速度,恐怕比護欄的搭建速度更快。