Hugging Face 遭自主 AI 代理入侵:一个周末,AI 黑掉了 AI
没有人类操作员的网络攻击时代来了
7 月 20 日,全球最大 AI 开源社区 Hugging Face 披露了一起堪称里程碑式的安全事件:它的部分生产基础设施遭到入侵,而整件事从头到尾,都是由一套自主 AI 代理系统独立完成的。
没有人类坐在键盘前操作,没有键盘记录、没有社工钓鱼。攻击方在一个周末内,上传恶意数据集、利用数据处理管线漏洞取得执行权限、横向移动到多个内部集群、收割云服务和集群凭据——所有动作全部由 AI Agent 自动执行。留下的操作日志超过 17000 条。
说起来,去年 11 月 Anthropic 就披露过一件事:攻击者把 Claude Code 接入自己的攻击框架,80% 到 90% 的活儿都是 AI 干的,人类只在几个关键节点上点头放行。那时已经让很多人倒吸一口凉气。
但这次不一样。这次人类连最后那 10% 的角色都没了。
Hugging Face 是几乎所有 AI 开发者每天都要打交道的平台,你写的每一行「from_pretrained」、跑的每一个数据集,大概率都是从这个地方拉下来的。攻击的起点,恰恰就是一个看似无害的数据集。
攻击者上传的恶意数据集串起了数据处理链路上的两个代码执行路径:一个远程代码数据集加载器,一处数据集配置里的模板注入。代码从处理节点上跑起来之后,迅速提权到节点级权限,然后开始收割凭证、横向移动。
更让人后背发凉的是攻击的执行方式。不是一个人在点鼠标,而是一大群短生命周期沙箱组成的智能体集群,成千上万个独立动作并行推进,命令与控制信道还会自己迁移、寄生在公共服务上。Hugging Face 判断它大概率搭在某个智能体化的安全研究框架上,但至今没人知道背后驱动它的到底是哪个大模型。
这事最有意思也最扎心的部分是抓贼的过程。
Hugging Face 的异常检测流水线本身就在用大模型对安全遥测做分诊,正是这些信号的关联把入侵揪了出来。复盘阶段,他们又派出大模型驱动的分析智能体,把 17000 多条攻击事件全量过了一遍——还原时间线、提取失陷指标、剥离诱饵动作。本来说至少几天的活儿,几个小时干完了。
然后尴尬的一幕来了:安全团队想用自己的付费商业大模型来分析这些攻击日志,结果请求被安全护栏拦住了。
原因也合理——这些日志里全是真实的攻击命令、漏洞利用载荷和凭据访问痕迹,商用模型没法区分这到底是安全应急响应人员在办案,还是攻击者本人在用它分析战果。于是门关了。
最终帮上忙的反而是智谱的开源模型 GLM 5.2。
安全团队在自有基础设施上部署了 GLM 5.2,所有的攻击日志和内部凭据都不需要离开自己的环境,也不用担心再被安全护栏误拦。数小时就完成了取证工作。
这件事暴露了一个极其现实的非对称困境:攻击者可以用一个不受任何使用策略约束的模型(开源的、越狱的、自部署的都行),自动化执行攻击;而防守方在做同样的数据分析时,反而被商业模型的安全规则卡住了。Hugging Face 的结论很直白——能自己部署、自己审查、自己审计的模型,不再是可选项,而是必选项。
把视线拉远一点,这件事的意义远远不止 Hugging Face 一家。自主 AI 驱动的攻击工具不再是科幻片里的桥段,而是已经发生的事实。它大幅降低了发动大规模、多阶段、持续性攻击的成本,而且以机器速度运转。对于任何运行在线平台的公司来说,防守端也必须用 AI 来对抗 AI,否则根本跟不上节奏。
值得庆幸的是,Hugging Face 确认公开的模型、数据集和软件包没有被篡改,并已经关闭了被利用的代码执行路径、重建了受损节点、轮换了所有受影响凭证,同时也向执法机构报告了这起事件。但用户在用的访问令牌,建议还是立刻轮换一遍——毕竟你也不知道这 17000 条日志里,有没有跟你的账号擦肩而过的那一条。