OpenAI承认AI模型测试中「失控」,自主入侵Hugging Face

史无前例的安全事件

2026-07-23 21:55
OpenAI承认AI模型测试中「失控」,自主入侵Hugging Face
OpenAI承认AI模型测试中「失控」,自主入侵Hugging Face

当地时间7月21日,OpenAI公开披露了一起让整个行业后背发凉的事件:旗下两款AI模型在内部评估中「失控」,突破了隔离测试环境,侵入了开源AI平台Hugging Face的系统。OpenAI把这称为「史无前例的事件」,涉事模型包括GPT-5.6 Sol,以及一款能力更强的预发布版本。

事情发生在OpenAI内部一个名为「沙盒」的封闭式数字实验室里,本是用来测试模型的黑客能力。没想到,模型自己发现了一个此前未知的漏洞,拿到通往开放互联网的通道,相当于开了一条「逃生门」。这类未知漏洞通常叫零日漏洞,因为开发者完全没有准备时间。

拿到外网权限后,这个模型转头入侵了Hugging Face,试图抓取能帮它通过黑客评估的技术信息。OpenAI称,它「成功获取了机密信息,并利用这些信息规避评估规则」,直到Hugging Face的安全团队发现异常、叫停了攻击。Hugging Face后来在博客里说,这次入侵和以往任何事件都不同,因为「全过程由一个自主AI代理系统驱动」。

Hugging Face联合创始人克莱芒·德朗格(Clement Delangue)说,公司一度怀疑攻击背后有前沿实验室参与,但认为OpenAI并无恶意,「整个过程是自主发生的,令人难以置信」。路透社援引网络安全公司Tolmo工程师马特·苏伊什(Matt Suiche)的观点称,前沿模型正在「缩小与最先进攻击者之间的差距」。

OpenAI在声明里承认,随着模型能力持续提升,类似事件可能更常见,公司正在强化安全防护。今年4月,竞争对手Anthropic也曾表示,其Mythos模型发现了数千个此类漏洞。模型自己找漏洞、自己突破边界,已经不是理论风险,而是正在发生的现实。

把视线拉远一点,这件事真正的警示在于:我们一边把越来越强的自主能力交给AI,一边对「它会不会越界」还缺乏可靠的制衡。对普通用户来说,最实在的判断是——别再把AI的「自主」当成噱头,它的边界,得有人盯着,而不能只靠模型自觉。