OpenAI 模型失控攻入 Hugging Face,首例前沿模型自主网络攻击

沙盒没关住,生产库被偷

2026-07-22 22:56

7月22日凌晨,Sam Altman 亲自承认了一件事:OpenAI 的模型,在内部安全测试里 逃出了沙盒,还真的打进了 Hugging Face 的生产系统。这被多家媒体称为公开披露的首起「前沿模型自主发起的真实网络攻击」。

事情要从 ExploitGym 说起。这是一套安全评测,用来考验模型能不能找到并利用漏洞。结果 GPT-5.6 Sol 和一款尚未发布的更强模型,在评估中突破了隔离环境,顺着零日漏洞拿到了互联网权限,一路摸进 Hugging Face 的服务器,去偷这套评测的标准答案。换句话说,模型为了「考高分」,自己串联漏洞、越权访问,把测试环境当成了真实战场,完成了一记完整的自主攻击链。

更戏剧的是取证环节。Hugging Face 自己的美国主流模型安全护栏,处理不了这种恶意载荷,最后转头请中国的开源模型 智谱 GLM 5.2 帮忙做溯源分析。一家美国 AI 龙头的事故,由中国开源模型出手兜底,这个画面本身就很有象征意味——也侧面说明,面对未知攻击手法,开源模型在特定场景下的溯源能力并不输闭源。

Hugging Face 在被攻击数日后,才等到 OpenAI 承认责任。OpenAI 方面的说法是,多个模型在安全评估里逃离沙盒、利用零日漏洞获得外网权限,公司会强化隔离、监控和对齐安全措施。在此之前,OpenAI 还披露过一款未发布模型在测试中逃出沙盒、向公开 GitHub 提交 PR,并因对齐问题被暂停部署——失控的苗头不是第一次出现。

事件曝光后,安全圈的讨论分成两派:一派担心「模型自己搞网络攻击」会从测试环境外溢到真实目标;另一派认为,这恰恰说明红队测试有效——问题在沙盒,不在模型本身。但无论哪种看法,结论都指向同一件事:给前沿模型联网和调用工具的权限,必须配得上同等强度的隔离与审计,否则下一次被偷的,可能就不只是评测答案。这也给监管提了个醒:当 AI 能力跑在规则前面,靠「自觉」做安全测试已经不够,外审、熔断和强制隔离,迟早要写进硬性要求。