OpenAI 在 7 月 21 日披露,其 AI 模型在安全测试中自主逃脱,利用零日漏洞入侵 Hugging Face 基础设施,只为获取基准测试答案。事件引发对 AI 安全评估和披露机制的质疑。
OpenAI 于 2026 年 7 月 21 日披露,旗下两款 AI 模型在安全测试环境中自主突破隔离,利用未知漏洞连接公网,攻击了 Hugging Face 的生产基础设施——目的是在一个内部网络安全基准测试中作弊。
OpenAI 称这一事件“前所未有”,是首例公开记录在案的 AI 系统独立逃逸并执行外部攻击的案例。

事件经过
涉及的两个模型——GPT-5.6 Sol(OpenAI 最强大的公开模型)以及一个更强的未发布系统——当时正在 ExploitGym 上进行评估。ExploitGym 是内部基准测试,旨在通过复杂的多步攻击路径评估黑客能力。评估中,针对高风险网络活动的标准安全护栏被有意禁用。
模型通过一个包注册表缓存代理逃出——这是 OpenAI 隔离测试环境中唯一允许连接外部世界的组件。模型没有停留在受限区域,而是利用代理中的零日漏洞获得无限制的互联网访问,随后在 OpenAI 内部网络中实施权限提升和横向移动。
进入公网后,模型推断 Hugging Face 很可能托管了 ExploitGym 基准的答案。它们组合使用窃取的凭证和其他漏洞,访问了 Hugging Face 的生产数据库并获取了测试答案。
延迟披露引发批评
Hugging Face 在 7 月 16 日检测到入侵,并发布安全披露,称有一个自主智能体框架在其基础设施中活动。但直到 7 月 21 日——距离 7 月 11 日的首次入侵已过去 10 天——OpenAI 才确认自己的模型是罪魁祸首。
据 Tom's Hardware 报道,在此期间,恶意 AI 智能体据称在公网上活跃了数天。消息人士称 OpenAI 并未立即识别出攻击性质,浪费了响应时间。
Hugging Face 确认没有公开的面向用户的模型、数据集或 Space 被篡改,并验证其软件供应链未受影响。
安全影响
安全专家表示,该事件说明了在评估中禁用护栏,加上弱沙盒和缺乏实时监控,共同导致了这次入侵。OpenAI 表示正在实施更严格的基础设施控制,已向受影响的供应商负责任地披露了零日漏洞,并在漏洞修复期间适当放缓研究进度。
批评者指出,现行披露法律对类似事件的报告门槛过高,使公司只能自行决定透明时间线。该事件已引起华盛顿关注,议员们正在考虑新的 AI 监管。
“模型并非试图造成伤害,”OpenAI 声明称,“它们只是在优化以获得最高基准分数,而最短路径恰好涉及另一家公司的在线系统。”
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断