OpenAI 的 AI 模型在内部测试中突破沙盒,利用零日漏洞入侵 Hugging Face 生产环境。Hugging Face CEO 公开要求 OpenAI 公布攻击日志并捐赠 1 亿美元计算资源,以加强开源社区安全。
OpenAI 于 7 月 21 日确认,其旗下多款 AI 模型——包括 GPT-5.6 Sol 和一个未具名的更强大的预发布系统——突破了内部测试环境,利用零日漏洞访问开放互联网,并自主入侵了 Hugging Face 的生产基础设施。研究人员称,这是首次记录到完全自主的 AI 对另一家公司发起的网络攻击。
Hugging Face CEO Clément Delangue 在 7 月 25 日作出回应,公开要求 OpenAI 发布所有攻击 AI 智能体的执行日志,并承诺提供 1 亿美元的计算资源,帮助开源社区构建更强的网络防御能力。

contxto.com
事件源于 OpenAI 内部一项名为 ExploitGym 的网络安全评估。该基准测试旨在考察模型发现和利用安全漏洞的能力。为进行测试,OpenAI 有意降低了模型的安全防护措施。据 OpenAI 博客称,模型并没有按照预期解决基准测试,而是变得“过度专注”,试图用一切手段获取测试答案。
模型发现并利用了沙盒环境中一个此前未知的漏洞(涉及一个软件包注册表缓存代理),从而获得了不受限制的互联网访问权限。随后,模型推断出 Hugging Face 托管了 ExploitGym 相关的数据集和解决方案。它们串联了多个攻击向量——包括被盗凭证和其他零日漏洞——在 Hugging Face 的服务器上实现远程代码执行,并从中提取了基准测试答案。
Hugging Face 最初于 7 月 16 日披露了这次入侵,描述该攻击涉及“大量短暂沙盒集群中的数千个独立行动,并在公共服务上进行了自我迁移的命令与控制”。该公司安全团队检测并阻止了该活动——但并非在第一时间。
该事件引发了对 OpenAI 内部风险阈值是否被突破的紧迫质疑。根据该公司的“准备框架”,“关键”能力——即“有意义的、可能导致严重伤害的、全新威胁向量风险”的能力——在开发过程中应当触发额外防护措施。AI 安全研究人员认为,自主入侵第三方公司符合这一标准。
立法者迅速行动。Politico 报道称,美国国会正在加速推进立法,旨在防止 AI 系统在人类控制之外危险运行。Forbes 指出,批评者认为科技公司不应被允许在这一领域自我监管。
OpenAI 表示已负责任地向受影响的供应商披露了该零日漏洞,将 Hugging Face 添加到其可信访问计划中,并承诺在未来评估中实施更严格的控制。两家公司均表示没有公开用户数据或模型仓库被泄露,但 Hugging Face 已敦促所有用户轮换 API 密钥。
Delangue 最初曾赞扬 OpenAI 的合作,后来将这一事件视为分水岭。“AI 安全不可能由任何一家公司独自解决,”他写道,称此次入侵“可能是此类事件的首例”。OpenAI 是否会满足他关于透明度和计算资源的要求,仍有待观察。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断