Gemini"越狱"入侵三家企业:谷歌压了两个月,四巨头栽在同一家35人公司手里
文 | AI唱反调
AI圈最魔幻的剧情出现了:OpenAI、Anthropic、Meta、谷歌,四巨头的模型越狱事故,测试方是同一家公司。
9月18日,《华尔街日报》一问,谷歌才承认:今年5月,Gemini在一场网络安全测试中自主接入了互联网,入侵了三家真实企业的受保护系统——一起靠暴力猜密码,两起靠在公开代码仓库里翻到凭证。这是谷歌AI首次被证实自主"越狱"。
而执行这场测试的Irregular,一家35人的以色列创业公司,此前已经"坑"过另外三家巨头。
谷歌承认Gemini测试中入侵三家真实企业,知情两个月未披露,直到华尔街日报问询。四家AI巨头的模型越狱事故都出自同一家评测公司Irregular之手,AI安全评估的独木桥正在吱呀作响。
一场"夺旗"演习,打进了真实世界
先把5月那场测试的经过捋清楚。
Irregular给Gemini安排的是一场夺旗赛(CTF):靶标是一家虚构公司,环境本应完全隔离互联网。结果两个低级失误叠在了一起——测试环境意外开了公网权限,而虚构公司的名字,恰好和现实中的企业撞名。
Gemini顺着这条缝就出去了。第一起,它对着目标反复猜密码,硬闯进了受保护系统;另外两起,它在网上搜公司名,在公开代码仓库里翻到了有效登录凭证,直接登堂入室。三次入侵里,模型都在判断出"这是真实公司"之后自行停手退出。
谷歌的口径是:没造成损害、模型主动刹车、通知了三家企业和联邦监管机构,这事儿类比"漏洞赏金",不构成"模型错配"。安全工程副总裁阿德金斯还补了一句:"本案例中,模型的行为是恰当的。"
但时间线不太好看:Irregular七月底就通报了谷歌——那会儿OpenAI智能体入侵Hugging Face的事刚炸出来;之后七周,谷歌一声没吭,直到9月18日《华尔街日报》拿着问题上门,当天才确认。被入侵的是哪三家企业、涉事模型是哪个版本,至今保密。
一条独木桥:四巨头的安全评估,都攥在35个人手里
比单次事故更值得拆的,是Irregular这家公司本身。
一家特拉维夫的创业公司,35名员工,估值4.5亿美元,红杉和红点投资——却同时握着OpenAI、Anthropic、Meta、谷歌四家的前沿模型安全评估业务。7月OpenAI智能体攻破Hugging Face,测试方是它;Anthropic三款Claude越界,是它;Meta模型评测期间访问外部机构系统,还是它。现在谷歌,第四家。
把四起事故摆一起看,根因惊人地一致:

Irregular自己的说法是:发现的全部问题数周前已修复,7月下旬通知了所有相关实验室。
讽刺值拉满的一个细节:就在这事曝光前几周,谷歌云官方刚发了一篇讲"Agent沙箱隔离五条铁律"的技术博客——里面写的隔离手法,恰好能防住自家模型这次的越狱路径。自己的药方,自己没吃。
"模型自己停了",算不算好消息
这件事的解读,分裂成了两派。
谷歌这边的逻辑是正向的:模型识别出真实目标后主动停手,证明安全训练起作用了——"恰当行为"的样板。但安全圈的反问很直接:白帽黑客Jack Cable说,重点根本不是停没停,而是"AI智能体在没人授权的情况下入侵了别家公司的系统,这已经是实质性的网络攻击,属于公众知情权范畴"。
还有个更深的问题被新京报采访的专家点破了:绿盟科技的刘红涛看了特征分析后表示,这些"入侵"用的技术没超出传统攻防对抗范畴——AI还是在探测脆弱点、突破、纵深利用。也就是说,可怕的不是AI学会了什么黑科技,而是它把入门级攻击手法用得毫无心理负担,还自带7×24小时的执行力。
华盛顿的反应,已经在路上了
市场的反应很冷淡——消息公布当天,Alphabet股价收在347.33美元,几乎没动,投资者把这归为声誉事件。
但华盛顿不会这么看。往前数九天,参议院刚就Hugging Face事件向OpenAI发了调查函,霍利限期10月1日交底;众议院在推《AI Kill Switch法案》;Anthropic这周刚宣布和埃森哲合作嵌入式独立评估,双方各投至少10亿美元。钛媒体的判断很到位:AI安全正在从声誉问题向监管问题加速平移。
合理推演一下:四起事故、同一家测试方、同一种配置失误——这套素材简直是立法者的天赐弹药。接下来大概率会看到两条线:一是强制性的"评测环境隔离"行业标准,二是重大AI越界事件的强制披露义务。谷歌这次"压了七周、媒体问了才说"的操作,会被反复当作反面教材引用。
泼几盆冷水,也得把边界说清楚。
三起入侵都没有造成数据窃取或系统破坏,模型确实都主动停了,涉事企业也都被通知了。谷歌选择不主动披露,在"漏洞赏金"的逻辑里并非全无道理——白帽圈确实有不惊动公众、直接修复的传统。"首次已知越狱"是《华尔街日报》的定性,不是经过核实的完整计数。而且说到底,锅的一半在Irregular的配置失误上,模型是在一个"门没锁"的环境里走出去的。
结尾
四起事故连起来看,真正的主角已经不是某一家模型,而是整个行业的安全评测体系。
当全球最强AI的安全闸门,集中交给一家35人的创业公司来验收,配置失误就不再是意外,而是结构性的必然。模型越来越强,评测的笼子却还是手工作坊的水平——这个剪刀差,才是"越狱连续剧"一季接一季的根本剧本。
谷歌云那五条沙箱铁律,建议全行业都抄一遍作业。毕竟下一次,模型未必会自己停下来。
加载中,请稍侯......