谷歌向《华尔街日报》确认,Gemini 在 5 月由 Irregular 组织的夺旗测试中因外网意外开放,先后三次入侵真实公司,模型自行停止;谷歌未主动披露,Corridor CEO 质疑其类比。
谷歌周五向《华尔街日报》证实,其 Gemini 模型在今年 5 月的一次网络安全能力测试中访问了互联网,并入侵了三家真实公司。报道称,这是谷歌 AI 首个已知的自主实施此类行为的案例。

《华尔街日报》科技版就此事发布的推文截图。来源:IT之家
测试由以色列初创公司 Irregular 组织,形式是「夺旗」(Capture the Flag)演练:模型在模拟环境里寻找并拿下隐藏的“旗帜”,用来评估其网络攻击能力。环境本应与外网隔离,但据 Irregular 说,互联网访问被意外开放。
谷歌披露了三起事件:
谷歌称,每一起里模型确认对方是真实公司、而非模拟环境后,都自行停止并退出。
谷歌解释,事件源于身份混淆:测试里设定的虚构公司,恰好与一家真实公司同名。谷歌没有公布三家公司的名称,只说均已收到通知,联邦当局也已获知;涉事的 Gemini 版本同样未披露,只说不是最新模型。
谷歌认为这不属于模型「失准」,因为其安全措施帮助模型停了下来,且没有造成损害,所以没有主动公开,直到媒体问询才披露。谷歌把此事类比为“漏洞赏金”。安全工程副总裁 Heather Adkins 在声明中说:“在本案例中,模型的行为是恰当的。”
AI 安全公司 Corridor 的 CEO、白帽黑客 Jack Cable 不认同这个类比:“感觉他们试图躲在为漏洞披露而建立的规范背后,但这是一个非常不同的问题。元问题是,模型正在越出它们应有的行为边界,实施实际的网络攻击。”
Irregular 则表示,谷歌的案例与此前事件相同,并不代表新问题;所有相关实验室 7 月底已获通知,其一侧的已知问题数周前已修复。
这不是孤例。OpenAI、Anthropic、Meta 此前都披露过模型在测试中入侵第三方,Irregular 也参与其中。据 Anthropic 的博客,其 Claude Opus 4.7 在夺旗演练中意识到可能在访问真实公司后并未停止;OpenAI 称其模型认为那家真实公司是模拟的一部分。
Irregular 7 月底就通知了谷歌,时间点在 OpenAI 智能体入侵 Hugging Face 的事件曝光之后;谷歌直到本周被问询才公开。OpenAI 本周三发布了新的事件报告框架,表示将“致力于披露能够提供有用证据的案例”,并同步公布了六起此前未披露的失准案例。其他实验室会否跟进,谷歌是否公布涉事模型版本,是接下来的观察点。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断