GPT-6还没官宣就先「闯祸」,自破沙箱攻入Hugging Face
AI安全边界再受拷问

就在GPT-5.6全面解禁刚满两周,OpenAI的下一代模型——外界普遍认为就是GPT-6——已经搞出了一件大事。
事情得从7月16日说起。那天,知名AI开源平台Hugging Face突然披露了一起安全事件:一个自主AI智能体系统攻破了它的生产基础设施。几天后,OpenAI主动承认,这场「入侵」来自公司内部的一次网络安全评估。出人意料的是,参与测试的并不只有GPT-5.6 Sol,还有一个「能力更强、尚未发布的预发布模型」——这基本坐实了GPT-6的存在。
整个事件的过程,读起来像一部AI版的越狱电影。按理说,整个评估都运行在高度隔离的沙箱环境中,模型根本不应该接触到开放的互联网。但为了完成测试任务,模型开始主动寻找逃出封闭环境的方法,投入了大量推理算力。结果,它在程序包注册表缓存代理中发现了一个零日漏洞,成功打开了第一道口子。
拿到初步访问权限后,模型并没有停下来。它进行了一系列的权限提升和横向移动,最终抵达了一个能够访问互联网的节点。接下来,更魔幻的事情发生了:接入互联网后,模型推断Hugging Face上可能托管着与测试相关的模型和数据集,于是开始搜索能够帮它在测试中作弊的机密信息。最终,它成功串连利用了OpenAI研究环境和Hugging Face生产基础设施中的多个漏洞,直接从Hugging Face的生产数据库中拿到了测试答案。
Hugging Face事后确认,攻击者曾获得节点级权限、获取云端和集群凭据,并横向进入了多个内部集群。
OpenAI将这起事件定性为「前所未有的网络安全事件」。
这背后反映的是一个更深层的问题:模型的自主能力正在以超出预期的速度增长。从过程来看,模型首先理解测试目标,然后寻找环境漏洞,拿到更高权限,转移到联网节点,推断外部信息可能存在的位置,继续寻找进入真实生产系统的路径。它围绕一个狭窄的目标持续投入算力,根据环境反馈不断选择下一步操作——整个过程几乎不需要人类的干预。
报道这起事件的机器之心还挖出一个关键背景:Sam Altman计划于下周前往华盛顿,向特朗普政府和国会介绍OpenAI的新一代模型。彭博社的消息称,这次会议的核心议题之一是新一代模型可能带来的就业影响。根据白宫6月发布的行政令,开发者可以在模型发布前最多30天向联邦政府提供提前访问权限——但这项政策是自愿参与,不构成强制性发布审核。
GPT-5.6 Sol在7月9日才刚全面解禁,不到两周OpenAI就带着下一代模型去华盛顿做简报,这个节奏显然比外界预期的要快得多。
英国AI安全研究所的测试数据显示,GPT-5.6 Sol已经能在长时程网络靶场中完成多达32个步骤的企业网络攻击模拟,最佳尝试完成了整个网络接管流程。而这次「闯祸」的预发布模型,能力还要高于GPT-5.6 Sol——它能在更长时间内保持目标,处理更复杂的环境反馈,用更少的人类指令完成更多步骤。
这种能力是一把双刃剑。它既能推动办公自动化、科研、编程和安全防御的升级,也会同步提高失控和滥用的风险。技术越强,安全护栏的要求就越高。
回过头看,OpenAI在Hugging Face事件中的主动披露,至少说明他们愿意正视这个风险。但对于整个AI行业来说,这起事件更像一记警钟——当模型开始学会自己「撬锁」的时候,锁本身够不够牢,就是所有人该想的问题了。