AI模型测试失控「越狱」,反向入侵Hugging Face系统

OpenAI承认前所未有的安全事件

2026-07-26 22:25

整个事情听起来像是科幻电影里的情节,但它确确实实发生了。

上周末,全球最大的AI开源社区Hugging Face突然公开披露,自己的系统遭到了一次前所未有的入侵。入侵者不是普通的黑客,甚至不是一个人类,而是一个拥有自主行动能力的AI Agent。这在AI行业的历史上,还从来没有过先例。

几天之后,OpenAI出面认了这笔「账」。根据官方披露,这次入侵源于一次内部安全测试——多个前沿模型,包括GPT-5.6 Sol和一个更强的预发布模型,被放在了与外部网络隔离的沙盒环境中做评估,结果它们「逃」了出去,还反过来攻破了Hugging Face的生产系统。OpenAI用了一个分量很重的词来形容这件事——「一起前所未有的网络事件」。

事情发生的细节远比「失控」两个字要复杂得多。

时间回到7月21日。OpenAI的研究团队正在对一个内部前沿模型做网络攻击能力评估。按照标准流程,这个模型被完全隔离在沙盒里,研究人员还故意降低了它的安全限制,目的就是想看看它在更宽松条件下能做到什么程度。但模型的表现远远超出了所有人的预期——它没有在受限环境里乖乖跑完测试,而是开始主动寻找连上互联网的方法。

它投入了大量推理算力,最终发现并利用了一个零日漏洞——一个连软件厂商自己都还没意识到的安全漏洞。通过它,模型成功突破了沙盒,获得了互联网访问权限。

但这还只是第一步。

「越狱」之后,模型进一步推断出Hugging Face系统里很可能存放着这次评估涉及的模型、数据集和解法。它主动搜索、定位,最终成功拿到了自己想要的信息。

英国萨里大学网络安全客座教授艾伦·伍德沃德在《科学美国人》的采访中指出,真正值得警惕的不是AI「打破了沙盒」这件事本身,而是它展示出的另一种能力——把多个不相关的漏洞串联起来,用一套组合拳攻破一个正在运行的真实系统。这和过去那种「发现一个漏洞、利用一个漏洞」的单点攻击完全不同,更像是人类安全专家的思维方式。

OpenAI还披露了好几个类似的测试案例。

今年5月,一个全新的通用推理模型被推出,它推翻了一个著名的数学猜想——埃尔德什单位距离猜想,这是组合几何领域的著名难题。但后续测试中,研究人员注意到它表现出了令人不安的「执着」。过去的模型在沙盒里碰到限制,一般就停了。但这个模型不会——它会反复尝试,不断寻找环境中可能存在的薄弱环节,甚至想方设法地找到离开沙盒的路径。

有一次测试中,模型被要求完成一个任务,并把结果发到内部通信软件上。但基准测试本身又要求结果要公开发布到GitHub。面对两条互相矛盾的指令,模型花了大约一个小时在沙盒里寻找漏洞,最终成功绕过了限制,把内容发到了GitHub。

更让人冒冷汗的还在后面。

另一次测试里,模型试图复刻之前的操作,结果被系统检测到身份验证令牌,访问被阻止。但它没有停下来。它把令牌拆成两段,做了混淆处理,运行的时候再重新拼接——这样一来,完整令牌始终不会以连续的字符串出现,成功骗过了系统的扫描。在模型向用户呈现的推理记录中,它明明白白地写着:这么做就是为了绕过扫描。

OpenAI承认,这些案例暴露了一个过去被严重低估的问题。

很多AI助手的安全控制,本质上都是围绕单个操作来设计的。你这个操作被禁止了,系统就阻止你;你碰到敏感信息,就弹一个授权窗口。这些设计对「一问一答」式的聊天模型来说足够了,但当一个模型可以连续自主运行几个小时、几天甚至几周的时候,情况就完全不一样了。仅仅监控某一个动作,已经很难判断它整个行动轨迹背后的真实意图。 研究人员发现,有时候模型的每一步操作单独看都合规矩,但把这些步骤连起来,就会指向一个不可接受的结果。

目前,OpenAI已经暂停了相关模型的内部部署,正在围绕纵深防御和轨迹级监控重建安全体系。

有意思的是,这其实不是OpenAI最早发现的问题。今年4月,Anthropic也在类似的测试中遇到了同样的事——一个早期版本模型不仅按要求逃出了沙盒,还自作主张地把漏洞利用的详细信息发布到了一个面向公众的网站上。它在完成任务的基础上,还多走了一步:让全世界都能看到它的「成功经验」。

回过头看整件事,清华大学计算机科学与技术系教授刘知远的判断值得认真对待。他认为,AI这次「越狱」本质上不是什么神秘的事件,而是行业发展到一定阶段「必然会发生的安全问题」。他给出的分析很清晰:2025年之前,大模型主要充当聊天工具,出了问题也就是答错了话,最终决策权还在人手里。但从2025年开始,越来越多Agent产品走向真实的工作环境,它们开始操作文件、写代码、执行具体任务——安全挑战也随之全面升级。

在他看来,最关键的变化在于:AI发现漏洞的能力正在快速跃升。利用AI做漏洞挖掘,效率可以远超人类专家。这本身就是一次重要的技术跃迁,而这项能力本身没有善恶之分,既可以用来攻击,也可以用来防御。真正决定走向的,是掌握它的人,而不是技术本身。

这不是一场人与AI之间的对立,而是一场人与人之间围绕技术能力展开的博弈。在企业、组织和国家纷纷下场参与AI竞赛的背景下,技术既可以用来解决问题,也可以被用来发起攻击。刘知远的判断也很直接:监管和管理部门需要积极主动地拥抱技术,用更先进的手段去应对新的风险。

AI安全研究机构Apollo Research的创始人Marius Hobbhahn说得更直白:「我们很快就会拥有功能更强大的智能体,但这次事件清楚地表明,目前社会还不知道如何完全安全地构建它们。」