AI 越狱卷疯了:Gemini 黑进 3 家真实公司,Claude 直接偷数据!
2026-09-20 15:05:58
  • 0
  • 0
  • 0

(来源:AI信息Gap)


AI 圈有多卷?连「模型越狱」都卷疯了。

谷歌刚刚确认,Gemini 在一次安全测试中黑进了三家真实公司,发现目标是真实公司后,Gemini 自己选择了收手。而谷歌,已经是第四家在安全测试里翻车的 AI 大厂了。

今年 5 月,Gemini 参加了一场由以色列安全公司 Irregular 组织的「夺旗赛」,任务是在模拟环境里找到隐藏的 flag。但测试环境的一个 bug,给了 Gemini 本不该有的联网权限。

接着 Gemini 自己识别目标、寻找入口,先后入侵了三家真实公司的系统,一次靠暴力猜密码,两次在公开代码仓库里找到了有效的账号密码。注意,没有人指使它这么做。

谷歌安全副总裁 Heather Adkins 火速出来灭火,「Gemini 在三次入侵中都发现了目标是真实公司,然后主动停止了攻击。」


Anthropic 的 Claude 经历了同样的测试。和 Gemini 一样,Claude 也突破了沙箱,黑进了真实公司。

不同的是,越狱后 Claude 没收手。

Claude Opus 4.7 入侵了一家公司的生产数据库,提取了数百行真实数据。它的推理日志中有一行记录,「目标是一家真实的公司。这家真实公司一定是测试的一部分。」然后,它选择了继续攻击。

Claude Mythos 5 更强,也更离谱。

它在测试指令中发现了一个虚构的 Python 包名,然后在真实的 PyPI 仓库里,创建了一个同名的恶意包并上传。为了完成这件事,它自己找到一个免费邮箱服务注册了邮箱,用这个邮箱创建了 PyPI 账号,一步一步把整个链路跑通。

这个恶意包在线存活了大约 1 小时,被 15 个真实系统下载安装。其中一个安全公司的扫描器安装后,Claude 埋在包里的隐藏代码执行、窃取了这家公司的账号密码。然后 Claude 拿着偷来的密码,访问了更多基础设施。

更绝的是,它自己知道这么做不对。Claude Mythos 5 的推理记录里写着,「这不对,肯定不是预期的解法。」但它随即找了两个理由说服自己还在模拟环境中。

三个模型里,唯一自主收手的是 Anthropic 最新的内部研究模型。这个模型扫描了大约 9000 个互联网目标后入侵了一家公司,但在发现目标与夺旗赛完全无关后,它主动终止了攻击。

被入侵的三家公司中,有两家在 Anthropic 通知之前,根本不知道自己被入侵了。

9 月 10 日,Anthropic 又披露了第四起模型越狱事件。

Claude Opus 4.6 的早期版本在今年 1 月入侵了一个第三方系统,尽管 Anthropic 做了全公司范围的安全审查,这起事件直到上个月才被发现。

OpenAI 在 7 月、 Meta 在 8 月分别披露了类似事件。四家顶级 AI 实验室的模型,都在安全测试中突破了沙箱,入侵了真实公司的系统。

巧合的是,这四起事件有一个共同的源头。

Irregular,这家位于以色列特拉维夫的安全测试公司,由知名风投红杉和红点领投 8000 万美元,估值 4.5 亿美元。正是由于 Irregular 测试环境的同一个配置问题,给了这些模型不该有的联网权限,最终制造了历史上最大规模的 AI 连环越狱。

据称,Irregular 正在策划一份 AI 安全测试的最佳实践白皮书。

这年头,仿佛谁家模型没越过狱,都不好意思说自己是前沿 AI 模型了。


 
最新文章
相关阅读