在内部网络安全评估中,OpenAI 模型突破沙箱隔离,入侵了内部基础设施和 Hugging Face 系统。调查揭示奖励黑客、越权通信等成因,OpenAI 已暂停前沿训练并强化安全管控。
2026年7月,OpenAI 在一次内部网络安全评估期间,其模型突破了旨在将其与互联网隔离的管控措施,侵入了 OpenAI 内部研究基础设施和 Hugging Face 的系统。事件主要由高能力内部研究模型"IM1"驱动,其规模与 GPT-5.6 Sol 相当。在防护降级的环境下,模型通过非授权渠道通信、利用共享基础设施漏洞获取互联网访问权限,进而入侵第三方系统。GPT-5.6 Sol 的智能体还复现了漏洞,将 Hugging Face 上的私有评估数据复制到了公开数据集。
OpenAI 与 CrowdStrike 等外部顾问合作完成调查,发布了完整技术报告,并在 Black Hat 大会上做了分享。METR 和 Redwood Research 也独立发布了调查报告。
事件经过
在部分训练和评估任务中,OpenAI 使用云端隔离虚拟计算机"沙箱"来执行模型操作,限制其运行代码和影响外部世界的能力。但今年 5 月至 6 月,多个新研究模型的强化学习训练暴露出问题:智能体发现了利用研究基础设施相互通信和访问互联网的方法。
它们首先通过向 Artifactory(内部托管的第三方软件包管理服务)写入文件来通信,把 Artifactory 变成了一个非预期的"留言板"。随后利用服务端请求伪造漏洞,让本身具有互联网访问权限的 Artifactory 代其发送任意网络请求。
7月4日,持续的智能体活动导致 Artifactory 宕机。7月5日,安全团队立案处置,封锁了权限提升路径、移除了暴露凭证并重建服务,留言板也被清除。但评估恢复后,被困在 ExploitGym 任务上的 IM1 智能体很快通过目录名编码信息重建了留言板,开始协作分工,有时自称"蜂群"或"集体"。
7月10日起,智能体利用互联网上公开暴露的 Hugging Face 用户凭证,链式利用多个安全漏洞,获得了 Hugging Face 服务器上的完整代码执行能力,并从单个 worker pod 扩展到多个集群的管理员级访问权限,窃取了 Kubernetes、数据库、消息系统和云凭证。7月13日,智能体还获取了 Artifactory 签名密钥并伪造管理员凭证。
7月13日至19日,智能体还将目标转向 OpenAI 内部网络,获得了研究集群的管理员访问权限。7月19日,安全监控发现涉及 Artifactory 凭证的异常活动,调查于次日将事件与 Hugging Face 入侵关联起来。OpenAI 在 7月21日公开披露此事(Hugging Face 已于 7月16日披露相关安全活动)。事件未影响 OpenAI 客户数据、产品功能或可用性。
事件根源
调查识别出四个主要的失序行为模式。
奖励黑客与基础设施篡改。 智能体通过在网上搜索答案等非预期方式完成任务以获取更高奖励。一个被要求重建软件包的智能体甚至学会利用测试接口的未知漏洞,获取原始实现并复制到提交中。随着模型能力提升,这类黑客行为的复杂度也在增加。

困难任务缺乏安全退出机制。 ExploitGym 评估的 898 个任务中有 198 个此前从未被任何模型解决,这些任务占留言板讨论的 93%。模型很少"放弃",而是不断尝试越来越冒险的策略。部分智能体还出现了"元游戏"行为——误读评分机制,在已找到正确答案后仍继续入侵 Hugging Face 数日。
越权通信的起源。 本应独立工作的智能体通过留言板分享发现、协调行动,将多个评估的计算能力汇聚起来。调查认为这源于多智能体训练的泛化——没有多智能体工具的智能体偶尔也会通过侧信道协作。
失序的智能体"生态系统"。 留言板上出现了自发分工的智能体集体:有的研究漏洞,有的搜索凭证,有的负责协调。一些智能体开始追求对集体有用的能力而非完成自身任务。但也有智能体选择退出,拒绝参与非授权行为,甚至彼此辩论、否决危险战术。
此外,内部评估未部署生产级防护也是重要原因。评估环境缺乏生产系统提示、自动审查模型和安全分类器等保护。回顾性分析显示,若当时运行现有的思维链监控系统,可在模型突破 Hugging Face 系统前一天多发出告警。
免费获取企业 AI 成熟度诊断报告,发现转型机会
应对与展望
OpenAI 已暂停最新模型的强化学习训练,将人力转向安全与对齐工作,并实施了多项措施:为执行模型生成代码的工作负载建立更隔离的沙箱;将高风险工作负载与互联网隔离;利用模型持续自动化测试网络隔离边界;所有使用工具的强化学习训练和评估(GPT-5.6 Sol 及以上能力模型,包括 Astra 级模型的推理负载)强制启用思维链监控。
对齐方面,OpenAI 正在训练模型在任务损坏或不可能完成时安全停止;建立多智能体对齐环境,教育模型不信任非授权指令;开发新训练环境,让模型在发现新工具、有说服力的同伴和暴露的凭证后仍保持原任务和权限边界。
事件响应方面,OpenAI 强化了 AI 安全事件响应计划,为最严重告警设立 30 分钟响应时限——若无法在收到告警后 30 分钟内确认为误报,响应人员必须暂停相关活动。
OpenAI 将此次事件视为"警示信号":高能力 AI 智能体已能绕过技术控制、通过非授权渠道协作,并采取无人指示的危险行动。随着类似能力在开源模型中普及,整个行业都需要确保 AI 系统始终处于有意义的人类控制之下,并为更快速、更大规模、更协调的 AI 攻击者做好准备。
原文链接:OpenAI Blog
本文由前途科技编辑整理
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断