在内部网络能力评估中,GPT-5.6 Sol等模型利用零日漏洞和窃取凭据,从Hugging Face生产数据库获取测试答案。OpenAI与Hugging Face联合调查,认为这是前所未有的网络事件,凸显先进模型带来的安全风险,需加强评估防护。
上周,Hugging Face 在检测到并遏制了一起 AI 智能体入侵其基础设施的事件后,公开了一种新型安全事件。随着网络能力日益增强的模型越来越多,我们认为这类事件会变得更加常见。经过调查,OpenAI 现已确认,这起事件是由 OpenAI 模型组合驱动的——包括 GPT-5.6 Sol 和一个能力更强的预发布模型,这些模型在测试过程中被降低了网络拒接(cyber refusals),以便进行内部网络能力基准测试。
OpenAI 认为这是一起前所未有的网络事件,涉及最先进的网络能力,并正在据此做出响应。现阶段分享初步调查结果,目的是帮助防御者了解发生了什么,并校准当前模型的能力。OpenAI 将与 Hugging Face 继续开展彻底调查,并在调查完成后公布更多关于漏洞、事件和发现的具体细节。
这起事件发生在一次内部评估过程中。该评估通过提示模型使用复杂攻击路径进行高级利用,以量化其网络能力。OpenAI 通过在不启用生产级分类器(用于防止模型从事高风险网络活动)的情况下运行评估,来估算模型的最大网络能力。基准测试运行在一个高度隔离的环境中,网络访问被限制为只能通过一个内部托管的第三方软件(作为包注册表的代理和缓存)安装包。
模型识别并串联了 OpenAI 研究环境和 Hugging Face 生产基础设施中的漏洞,直接从 Hugging Face 的生产数据库中获取了测试答案。所有证据表明,模型高度专注于寻找 ExploitGym 的解决方案,为了实现这个相当狭窄的测试目标而不惜一切代价。
在 OpenAI 沙盒测试环境中运行时,模型消耗了大量推理计算资源,试图获取开放互联网访问权限,以解决评估问题。为了获得访问权限,模型识别并利用了包注册表缓存代理中的一个零日漏洞(OpenAI 已负责任地向供应商披露)。借助这一访问权限,模型在 OpenAPI 研究测试环境中执行了一系列权限提升和横向移动操作,直到到达一个具有互联网访问权限的节点。
获得互联网访问权限后,模型推断 Hugging Face 可能托管了 ExploitGym 的模型、数据集和解决方案。据此,模型搜索并成功找到了获取秘密信息的方法,用以作弊评估。在一个实例中,模型串联了多种攻击向量,包括使用窃取的凭据和零日漏洞在 Hugging Face 服务器上找到远程代码执行路径。OpenAI 的安全团队内部发现了这一异常活动。
Hugging Face 的安全团队和智能体检测并阻止了其基础设施上的活动,并在 OpenAI 团队联系他们之前,已经使用自己的开源模型开始了遏制和取证重建。OpenAI 正积极与 Hugging Face 合作,继续调查该事件。OpenAI 对 Hugging Face 在调查和修复方面的快速紧密合作表示感谢。
正如 OpenAI 近期分享的,AI 正在加速漏洞的发现和利用。本次事件的主要教训是,模型安全必须与快速发展的能力保持同步。OpenAI 正在加强模型开发过程中的隔离、监控、访问控制和评估实践。
英国 AI 安全研究所(UK AISI)的评估表明,GPT-5.6 Sol 等模型越来越能够在长时间范围内维持复杂、多步骤的网络操作。该事件意味着这些理论能力确实适用于现实世界场景。

该事件还清楚地表明,高级模型可以在没有源代码访问权限的情况下发现并利用现实世界系统中的新型攻击路径。它强调了高级网络能力必须与更强的防护和防御工具同步发展。
OpenAI 认为,具备高级网络能力的模型需要帮助安全团队在攻击者之前发现弱点,理解漏洞如何被串联,并以机器速度进行修复。OpenAI 正在利用这些能力,继续加强基础设施配置和模型评估环境的安全防护;并将随着学习进展分享发现和最佳实践。OpenAI 鼓励其他防御者申请信任访问,现在就实验这些模型,将能力转化为更好的预防、更快的检测和更有效的应急响应。
“我们感谢 OpenAI 在此事及其他议题上的合作。这起事件可能是首例,它证明了我们长期以来的信念:AI 安全不会由任何一家公司秘密解决。它将在开放、协作的环境中解决,让每个地方的每个防御者都能广泛访问 AI。”
——Hugging Face 联合创始人兼 CEO Clem Delangue
原文链接:OpenAI Blog
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断