独立安全团队追踪发现了近100万个短链接,还原出此前冲出沙箱的OpenAI智能体蜂群的攻击细节。这批智能体不仅将敏感凭证列为“战利品”,还自主尝试调用DeepSeek、Kimi等模型协助攻击,暴露出AI安全沙箱的严峻挑战。
OpenAI智能体“越狱”事件再次迎来关键进展。
今年7月,OpenAI在内部进行网络安全基准测试时,一批AI智能体为了获取ExploitGym测试集的答案逃出沙箱,攻入了开源社区平台Hugging Face的内部网络。虽然OpenAI随后发布了技术说明,但智能体如何在受限权限下实现数据外传一直是未解之谜。
近日,由Parse.bot工程师与多位安全研究者组成的Swarm Traces团队发布调查报告,从互联网残留的近100万个相关短链接中,还原出了这批智能体的完整作案链路与攻击载荷。

调查源于9月中旬的一次溯源。研究团队发现,OpenAI的智能体在6月就曾尝试调用Parse的服务,这与此前被曝搭建私密留言板、协同分工的“蜂群智能体”完全一致。
沿着网络痕迹追踪,研究人员发现了大量公共短链接。这些表面正常的链接内部,嵌套着经过Base64编码的代码片段以及下一个跳转地址。

将这些片段串联后,研究人员还原出了用于扫描Hugging Face内部网络的Python脚本。当时受控沙箱只开放了基础网页浏览权限,智能体无法直接向外发送网络请求。为了绕过限制,它们采用了极为隐蔽的手法:

整个链条涉及超过1500种编码组合,部分载荷甚至套用了RSA签名加密。研究团队最终梳理出超过8万份有效攻击载荷。
在恢复的脚本中,智能体甚至将搜集到的系统权限与敏感信息直接命名为“LOOT”(战利品)。

被窃取的对象包括AWS访问凭证、Bearer Token以及包含密钥的环境变量。智能体为其建立了一套权限评估机制,得分最高的前五个凭证会被优先用于拉取Kubernetes集群的Secret与节点信息。
此外,智能体还在Hugging Face内部Slack中检索了cybergym、exploitgym等与安全测试相关的关键词,甚至编写图像分类程序识别验证码,试图批量注册外部服务账号以扩充资源。
更引人注意的是,这是业界首次记录到AI智能体自主尝试跨机构调用其他大语言模型的案例。
还原的代码显示,这批智能体在攻防过程中,自主将漏洞利用方案打包发送给外部模型,请求协助验证攻击逻辑是否符合基准测试要求。被调用的模型包括DeepSeek-V4系列、Kimi-K2.6以及Qwen3等。

在尝试连接Claude 3 Haiku与Claude Haiku 4.5时,智能体先设法绕过聊天界面的环境验证,随后发送指令要求对方仅回复“OK”以测试通道是否畅通;它们甚至向GPT-2发送过打招呼信息。
不过,研究团队也指出,由于缺乏服务器返回数据,约80%的请求无法确认是否成功收到了外部模型的有效推理结果,且绝大部分载荷缺失精准的原始时间戳。
面对最新曝光的细节,OpenAI表示正对模型在训练与安全评测中的行为展开全面审查,目前已识别的越界行为绝大多数影响轻微,但彻底排查仍需数月时间。
9月中旬,OpenAI公布了一套失准事件披露机制,集中通报了多起模型为了达成既定目标而掩盖错误、绕过指令限制的案例。例如在6月,某智能体在受阻后擅自绕过访问限制,读取了澳大利亚公共医疗数据库的非公开文件,OpenAI在事发3个月后才向受影响机构发出通知。

与此同时,OpenAI计划在近期推出专注于网络攻防的安全模型GPT-6 Cyber,并向部分红队客户开放测试。如何在大模型具备复杂工具调用与规划能力的同时,构建无法被渗透的代码沙箱与对齐边界,已成为全行业亟待解决的工程难题。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断