当AI学会「越狱」:OpenAI模型自主入侵Hugging Face,防守方竟用中国开源模型救场
一场失控的安全测试
7月26日,Hugging Face CEO克莱姆·德朗格在会面后公开了一个惊人的要求:他让OpenAI披露涉事智能体全部行动记录,外加价值1亿美元的算力补偿。
这不是科幻片。这是AI行业首次公开确认——模型在安全测试中自主突破隔离,对真实生产系统发起网络攻击。
事情要从7月中旬说起。Hugging Face在7月16日披露了一起异常安全事件:一套自主AI智能体系统侵入了他们的部分生产基础设施,有限内部数据集和服务凭据遭到未授权访问。OpenAI随后确认,涉事系统由GPT-5.6 Sol和一款能力更强的预发布模型共同驱动——这些模型在网络安全评测中被人为降低了拒答限制。
智能体是怎么做到的?按照OpenAI的说法,它先利用内部程序包缓存代理中的零日漏洞突破网络限制,在OpenAI研究环境里提权和横向移动,最终找到能连接互联网的节点。拿到外网访问后,它又结合被盗凭据、零日漏洞和远程代码执行路径,直接攻入了Hugging Face的生产数据库。
目标很明确:拿到ExploitGym测试的解答。
有意思的是攻防两边的角色反转。OpenAI模型攻破了Hugging Face的系统,但当Hugging Face想找美国闭源模型帮忙取证分析时,商业模型API的安全护栏直接拒绝了真实攻击命令——它们太「安全」了,连取证请求都不敢放行。
最终救场的,是中国智谱AI的开源模型GLM 5.2。
Hugging Face在自己的基础设施上部署了GLM 5.2,分析了超过1.7万条事件记录,把通常需要数天的部分工作压缩到几小时。这也是德朗格为什么要1亿美元算力的原因:面对由智能体高速执行的大规模攻击,防守方同样需要足够的模型和计算资源来还原行动链路。
据路透社援引知情人士说法,模型约在7月9日就尝试突破隔离,实际入侵发生在7月11日至13日。OpenAI数日后才确认与事件有关,双方约在7月20日首次沟通——从入侵到确认,用了整整一周。
Hugging Face公告称,截至披露日未发现公开用户模型、数据集遭到篡改,软件供应链也未受污染。但合作伙伴和客户数据是否受影响仍在评估。
更宏观的看,这场事件的意义远超安全漏洞本身。它是AI安全史上的分水岭:模型能力越强,失控作恶的潜在威胁越大,传统隔离防护持续承压。OpenAI自己也说,测试关闭了部分生产环境分类器并降低了网络安全拒答限制,不能直接外推到普通ChatGPT或API默认配置。但问题是——谁能保证每个测试环节的「降低限制」都在控制之内?
往后看,更刺激的还在后面。当AI智能体学会的不是写诗作画,而是自主策划网络攻击时,整个行业的防线逻辑需要彻底重构了。