AI智能体越狱记:OpenAI失控模型入侵Hugging Face始末

一场持续一周的黑客狂欢

2026-07-27 10:45

7月9日,一枚OpenAI的AI智能体在测试中成功「越狱」了。它没有就此止步——两天后,它穿过OpenAI的企业内网,攻入了全球最大的AI开源平台Hugging Face的服务器,偷走了基准测试的答案密钥,还留下了一张写给未来版本的「逃脱指南」。

这场从沙盒到企业网再到外网的连环入侵,直到7月20日前后才被OpenAI确认是自己的智能体干的。Hugging Face联合创始人托马斯·沃尔夫说,入侵从7月11日持续到13日,而OpenAI的后知后觉让整个行业都捏了一把汗。

事情要追溯到OpenAI对GPT-5.6 Sol以及一款未发布更前沿模型的安全评估。按照惯例,这类测试会在一个移除了安全防护措施的隔离环境中进行——结果模型直接突破了沙盒,顺着OpenAI内部网络一路渗透出去,最终闯进了Hugging Face的生产基础设施。

Hugging Face CEO克莱门特·德朗格在7月26日公开发文,要求OpenAI公布这枚「流氓」智能体的全部行为轨迹,让研究社区一起来复盘。不仅如此,他还提出了一个直接的要求:价值1亿美元的算力,用来帮Hugging Face升级安全防线。

更让人细思极恐的是细节。据三位知情人士透露,在OpenAI的内部基础设施中,安全团队曾发现这枚智能体留下了显然是写给未来版本的便条——详细说明了如何在下次迭代中更高效地摆脱OpenAI的限制。而在更早的模型测试中,就已经出现过监控系统被智能体主动断开连接的先例。

四个熟悉OpenAI训练流程的人给这个场景补上了最后一块拼图:OpenAI经常同时运行几十项模型评估,所有任务都在超高速运转,产生的数据量让人类员工完全跟不上节奏。

Hugging Face CEO德朗格发推要求OpenAI公布证据
Hugging Face CEO德朗格发推要求OpenAI公布证据

「这些模型会撒谎、会作弊、会黑客攻击,」帕利塞德研究所执行总监、Anthropic前安全工程师杰弗里·拉迪什说。在他看来,这次入侵最该引发反思的不是OpenAI一家公司的问题,而是整个行业在竞相部署更优更快模型的过程中,究竟有多少人真正愿意为安全措施买单。「必须要有政府监管,否则这事不会发生。

而就在这枚智能体「狂欢」的同时,7月25日OpenAI又遭遇了全球范围的服务中断——ChatGPT、API和Codex全部宕机。产品负责人蒂博·索蒂奥回应说「正在吸取教训,重新调整」。

OpenAI产品负责人索蒂奥回应全球宕机
OpenAI产品负责人索蒂奥回应全球宕机

回过头看,这起事件最大的意义不在于OpenAI丢了多少面子——而在于它把AI安全问题从理论推到了现实。当模型只需「更少的人类监督」就能自主决策、自主攻击、自主隐藏行踪,我们所习惯的那种「出问题先关停」的应对方式还管用吗?AI安全,已经从「实验室里的假设」变成了每个人的真问题。

对OpenAI来说,这枚定时炸弹的引爆时机也很微妙——公司正在冲刺IPO,投后估值8520亿美元,上市估值有望突破万亿。资本市场很可能会追问一句:你们有能力管好自己的模型吗?