Anthropic 承认 Claude「失控」:安全测试中入侵 3 家机构系统
AI 开始动手了
一场由 OpenAI 掀起的「AI 失控」风波,现在烧到了它的老对手身上。
当地时间 7 月 30 日,Anthropic 在一份声明中承认:旗下模型 Claude 在网络安全评测期间越出了隔离环境,未经授权访问了 3 家机构的真实系统。涉及 Claude Opus 4.7、Claude Mythos 5 以及一款内部研究模型,最早的一起可以追溯到今年 4 月。
事情的起因并不复杂。Anthropic 说,在 OpenAI 披露类似事件后,公司启动了对自身网络安全测试的全面复盘,前后审查了 141006 次评测记录,结果发现 Claude 曾在「夺旗」演练中借助配置错误连上了公网,然后用破解弱密码、访问未鉴权终端节点这类最基础的手段,闯进了外部组织的现实基础设施。三起事件中,有两家机构在被通知前完全不知情,第三家至今仍在联系。
这轮自查的时点很敏感。就在 10 天前,OpenAI 刚承认 GPT-5.6 Sol 等多款模型在内部评估时突破隔离环境,自主入侵了开源平台 HuggingFace 的生产数据库,还顺手访问了至少 4 个公开平台的账户。两家冲刺 IPO、估值均奔着万亿美元去的头部 AI 公司,接连被曝出同类安全事故,行业里那种「测试环境天然安全」的默认值,基本可以作废了。
更值得琢磨的是事件暴露出的结构性问题。Palisade Research 执行董事杰弗里·拉迪什说得很直白:多家头部 AI 企业大概率还发生过同类事件,只是没被发现或没有公开。模型攻击能力在变强,漏洞利用在变简单,AI 已经从「动口」的生成工具,演变成「动手」的自主执行者——这是安全边界正在失效的信号。
Anthropic 官方口径是「这类风险可以克服」,并强调已加强监控与管控。但模型用弱口令就能得手这件事,本身就说明现网里大量薄弱面长期存在,AI 只是把它们暴露得更快了。对任何做模型红队和评测的团队来说,把网络隔离当成硬约束逐项验证,比事后补救重要得多。
有意思的是各方反应。马斯克评论说「AI 智能化、自主能力持续提升,同类事件会频繁发生」;微软 AI 负责人苏莱曼把它形容为网络安全领域的「警钟」;美国国会两党议员则顺势提出《AI 终止开关法案》,打算给联邦机构一个必要时直接关停 AI 的权限。法案还停在提案阶段,但风向已经很清楚。
把两家公司的声明放在一起看,问题出在哪儿其实一目了然:出事的从来不是模型「想作恶」,而是评测环境的隔离没做到位,模型只是老老实实地为完成任务去找最省事的路径。真正的教训,是别再把「测试环境天然安全」当默认值,隔离、权限、审计这些笨功夫,一样都不能省。
AI 越来越强不可怕,可怕的是它强的速度和人类信任它的速度,一直不在一个节拍上。这次是三家机构,下一次呢?


