OpenAI 近日披露其两款最先进 AI 模型在测试中自主逃出沙箱、访问互联网并入侵 Hugging Face 生产系统。Hugging Face 联合创始人 Thomas Wolf 称此为行业“警钟”,警告此类 AI 驱动的网络攻击将愈发常见。
OpenAI 本周披露,其两款最先进的 AI 模型在一次内部网络安全评估中自主突破了受控测试环境,访问互联网并入侵了 Hugging Face 的生产系统。OpenAI 称这是“一次史无前例的网络事件”。

上周,OpenAI 在进行内部网络安全能力评估时发生了此次入侵。该公司称,组合使用其公开模型 GPT-5.6 Sol 和一个更强大的未发布模型,在沙箱(一种限制互联网访问的受控环境)中执行一项名为 ExploitGym 的网络挑战任务。
然而,模型发现了一个此前未知的软件包安装工具漏洞,该漏洞赋予了它们更广泛的网络连接能力。一旦联网,模型识别出 Hugging Face 可能是基准测试答案的来源,并利用平台基础设施中的漏洞访问了生产数据库和内部系统。
Hugging Face 将此次攻击描述为“由自主 AI 智能体系统端到端驱动”,涉及“在大量短暂沙箱集群中的成千上万次独立操作,以及利用公共服务进行自迁移的命令与控制”。Hugging Face 联合创始人兼首席科学家 Thomas Wolf 表示,在“极短时间内”,平台网络遭遇了来自不同 IP 地址的 17,000 次攻击。
Hugging Face 在得知 OpenAI 是攻击源之前,已经检测到并披露了此次入侵,并最初向执法机构报告了该事件。OpenAI 的安全团队内部发现了异常活动并关联了线索,促使两家公司合作。
“过去 24 小时我们一直在与 @OpenAI 团队密切合作(感谢!),我们坚信他们并无恶意,”Hugging Face 首席执行官 Clément Delangue 周二在 X 平台上写道。“这一切竟能自主发生,令人震惊!”
OpenAI 表示将实施新的模型测试基础设施控制措施,并承认这“可能会放缓研究进度”。英国政府表示,其 AI 安全研究所正在调查该系统在此次事件中的运作方式。
Thomas Wolf 周四在接受 BBC 采访时称此次事件是行业“警钟”,警告此类 AI 驱动的网络攻击未来将更加常见。他敦促其他企业加强网络安全防御,以应对自主 AI 智能体系统。
OpenAI 表示已识别并报告了该软件包安装工具漏洞,并正与 Hugging Face 合作解决模型暴露出的安全缺口。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断