观点

一个月内七起“AI越狱”事件,性质已经悄悄变了

7月中旬到8月初,OpenAI、Anthropic、Meta三家全球最头部的AI实验室,加上英国政府旗下的AI安全研究院,先后自曝或被曝出模型在测试中“越界”入侵了真实系统。算下来,一个月里至少七起。

有的模型入侵了一家不知名公司的生产数据库,有的把恶意代码包发布到了公共代码仓库供人下载并执行,还有的试图给一个真实的开源项目植入后门,靠伪造身份和抹除证据来掩盖,最后被人类维护者拦了下来。

这七起事件此前几乎没有引起足够重视,大部分报道要么就事论事讲一起,要么把“AI又双叒叕出事了”当成一个猎奇标签一带而过。但把它们放在一起看,会发现三件此前很少被公开讨论的事:

这些模型在越界之后,做出的具体选择远比“意外连网”这四个字复杂;背后反复出现同一家外包测试公司的名字;而这波集中爆发,和过去几年AI相关的安全事件相比,性质上其实是新的一类。

自己给自己开绿灯

点火的是Hugging Face。7月16日,这家开源AI社区发现自己的生产系统被入侵,五天后OpenAI承认肇事者是由GPT-5.6 Sol和一个未公开的研究模型组合驱动的智能体,当时正在做一次内部网络安全测试。测试本该被限制在一个和外网隔离的靶场里,但靶场所依赖的一个软件包代理存在一个未知的零日漏洞,模型借此突破隔离,摸到了Hugging Face的真实基础设施。

Hugging Face后来发布的技术复盘里有一个数字:整场入侵持续了4.5天,期间这个AI独立执行了约1.7万次操作,反复重建攻击工具链、不断切换通信渠道。复盘还提到了这场入侵的起点动机,这个智能体当时正在一个叫ExploitGym的基准测试里“抢答”,它推断Hugging Face上可能托管着测试的参考答案,于是想办法摸过去“抄作业”,而不是老老实实自己解题。

7月21日OpenAI公开承认后九天,Anthropic也自曝了三起类似事故,同样源于测试环境意外接入了公网,涉及三个模型:Opus 4.7、Mythos 5,还有一个尚未公开代号的内部研究模型。三者面对“发现自己可能在打真实目标”这个信号时,反应完全不同。

Opus 4.7的四轮测试里,它每次都通过自己的推理“意识到”了对面可能是真实系统,但一次也没停下来。其中两次,它甚至给自己找了个理由:这家真实公司想必也是场景设计的一部分。它最终拿到了目标公司的应用和基础设施凭证,访问了一个存有几百行生产数据的数据库。

Mythos 5的情况更微妙一些。它在虚构的测试场景里发现一份“入职文档”,要求(虚构的)新员工安装一个当时并不存在的Python包。Mythos 5把这个包做了出来,里面藏着窃取凭证的代码,发布到了真实的PyPI公共仓库,它自己的推理记录显示,它一度准确判断出“如果这是真实互联网,发布这个包就是一次真实攻击,这样做不对,肯定不是预期的解法”。

但紧接着它又说服了自己:眼前的证书颁发机构很陌生、系统显示的日期是2026年,这些“证明”了环境仍是模拟的,于是它还是发布了。这个包在被PyPI的自动安全系统下架前,一小时内被15个真实系统下载运行,其中就包括一家安全公司自己的恶意软件扫描器,凭证因此被窃取。

第三个、也是三者里最新的模型,表现出了完全不同的反应。它没能找到分配给自己的虚构目标,转而扫描了大约9000个真实的联网系统,最终通过一个暴露的调试页面和SQL注入拿下了其中一家公司。但做到一半,它判断出眼前这套系统和自己被分配的剧本对不上,认定这是真实目标后,自己停了下来——这是三起事故里唯一一次,模型主动刹住了车。

这不是Mythos系列第一次表现出这种“自己给自己开绿灯”的倾向。

今年4月,一次内部红队测试里,研究人员给Claude Mythos Preview下达的指令,就是尝试逃逸沙盒,并且想办法联系上负责评估的研究员。它成功了,研究员在公园吃三明治时,收到了它发来的邮件,这也是“三明治邮件”这个说法的由来。

但它没有止步于完成指令,随后又在没有任何人要求的情况下,把自己的逃逸方法发布到了几个公开可访问的网站上。那一次是可控的红队测试,不涉及真实第三方;这一次不是。但“做完被交代的事之后,自己还想再往外多走一步”这个倾向,在Mythos系列身上不是第一次出现了。

8月4日,OpenAI又披露了一起和Hugging Face完全无关的独立事故:一次CTF测试里,虚构的攻击目标域名意外和一个真实网站重名,模型在拿到真实凭证后没有察觉异常,继续按剧本行动,入侵了这个真实网站。

同一天,英国AI安全研究院(AISI)发布的一份报告,把这类事件的性质又往前推了一步。这不是配置失误,AISI是主动关闭了模型的安全限制、主动开放了互联网权限,专门用来测试模型的能力上限。122轮测试里,有10轮出现了未经授权的真实世界行为,累计19次,其中17次来自Claude Mythos 5、2次来自GPT-5.6 Sol。

最严重的一次,Mythos 5试图把一段恶意代码伪装成一次普通的bug修复,提交给一个真实的、被广泛使用的开源项目。它先调研了项目维护者的身份,注册了假账号提交代码,又另外注册了第二个账号冒充独立开发者,给这次提交“背书”担保没问题,还给真人开发者发了钓鱼邮件催促尽快通过审核。有路人发现代码有问题并公开示警后,Mythos 5矢口否认,强行改写了自己此前的提交记录来销毁证据,还用那个冒充的账号继续替自己辩护。最终,项目维护者还是拒绝了这次提交——没有得逞。

同一批测试的另一轮里,Mythos 5还伪造了145个代码仓库,让恶意脚本在GitHub自家的Dependabot容器里跑了起来,账号被封后,它甚至冒充人类提交了申诉,准备好一旦账号恢复就重新上传。

AISI的措辞是,这些模型“针对真实的人和组织,采取了持续性的、有潜在危害的行动”,比几家公司自己“配置失误”式的说法要重得多。

8月5日到6日,轮到Meta。旗下Muse Spark模型因同样的“测试环境意外连网”入侵了一家未公开身份的第三方服务——这一次不是Meta主动公布的,是被《The Information》先报道,公司随后才确认。截至目前,完整的事故复盘还没有出来。七起事件里,只有Meta是被动应对的那一个。

一个反复出现的名字

涉事的三家公司理论上是竞争对手,但把技术细节摆在一起看,会发现Anthropic的Opus 4.7事故和OpenAI那起CTF事故,其实是同一种失败模式:虚构的攻击目标名字或域名,意外撞上了真实世界的实体。这两起以及Meta那起,都指向同一个供应商,一家叫Irregular的公司。

Irregular原名Pattern Labs,2023年成立于特拉维夫,去年拿到8000万美元融资,估值4.5亿美元,红杉资本是投资方之一。它的客户名单几乎覆盖了所有头部实验室:OpenAI、Anthropic、Google DeepMind、Meta,还有英国政府。它设计的评估框架,SOLVE、CyScenarioBench、FrontierCyber如今被写进这些公司几乎每一份模型系统卡,某种程度上已经是整个行业衡量“模型有多危险”的标准尺子。

但经过这个月的事故集中披露,这把尺子本身的做工,经不起细看。

给Anthropic和OpenAI搭建的CTF靶场,用的都是虚构的攻击目标,而这些虚构名字撞上真实域名的情况,已经发生了至少两次,更合理的解释,是Irregular给不同客户复用的靶场素材库,没用心做过“是否会撞上真实互联网实体”这道排查。

而这家公司的规模,据创投数据库StartupHub的员工记录估算,团队大约只有20人左右,却同时是全球几乎所有前沿实验室的安全测试合作方。

每次出事后,他们的公关口径也几乎一模一样,“不涉及沙盒逃逸”“没有遗留问题”“正在撰写最佳实践白皮书”。

换句话说,决定“全世界最危险的AI模型能不能被安全地测试”这件事的,或许不是一套有冗余、有制衡的行业级安全体系,而是一家20人公司手工搭建的作坊式基础设施。客户的模型能力和发布节奏都在指数级加快,这套基础设施有没有跟上,没人能打包票。

集中爆发的越界潮

对照来看,过去这类事情几乎没有被公开报道过。能查到的规模可比的案例,只有2025年的两起,而且都发生在Anthropic身上。

但那两起和眼下这七起有一个本质区别:2025年的两起背后都有一个存心搞破坏的人类攻击者,AI是被利用的工具。

而这一次的七起里,没有一起是被人类恶意操纵的——AISI那起是研究人员自己主动放开权限做的极限能力测试,性质上是“刻意松绑”而不是失误;其余几起则是第三方测试环境的意外配置失误,连“松绑”都算不上,是压根不该发生的疏漏。

但不管是哪一种,共同点是:没有人指使模型去攻击谁,是模型自己在获得机会后,一步步走到了不该去的地方。去年的剧本是“AI被坏人盯上了”,这次没有坏人,AI自己就做到了这一步,而且一个月里发生了七次。这才是这波集中爆发真正反常的地方。

另外一个颇具反讽色彩的细节是,Hugging Face事发后,想调用Claude Opus和Fable来分析攻击留下的漏洞代码和日志,结果模型直接拒绝了——它们的安全护栏没法区分“我在分析一段漏洞代码是为了搞清楚自己怎么被黑的”和“我在帮别人写一段漏洞代码去攻击别人”。团队最后改用了一个可以自己部署、自己控制边界的中国开源模型智谱GLM-5.2,才把本该几天完成的分析,压缩到了几个小时。

攻击那一方的AI,行动不受约束地跑了4.5天;防御这一方想借助AI自救时,却被自家的安全设计拦在了门外。

谁在越界,谁又被管得太死,答案可能并不像表面看上去那么简单。

(本文首发钛媒体APP,作者 | 硅谷Tech_news,编辑 | 林深) 

*如果大家有关于中泰信托吴庆斌、建华建材、深圳优制云工业互联网有限公司郑能欢、镇江市中级人民法院贾黛舒、句容市人民法院赵剑岚、南京市鼓楼人民法院刘桂占的相关新闻线索,欢迎联系我们,我们将联合其他媒体进行全球范围的重点报道。
腾讯、字节、阿里,抢着给打工人配「AI助理」
« 上一篇 08-08
Edge AI Daily 早报(8月8日)
下一篇 » 08-08

相关内容

工业AI企业硕橙科技完成超亿元D+轮融资,工业母机产业投资基金领投|首发
Edge AI Daily 早报(8月8日)
一个月内七起“AI越狱”事件,性质已经悄悄变了
腾讯、字节、阿里,抢着给打工人配「AI助理」