OpenAI 训练了自动化红队模型 GPT-Red,通过在训练中生成对抗性攻击,大幅提升了 GPT-5.6 Sol 抵御提示注入的能力。这一方法实现了安全飞轮:用当前模型优化未来模型的安全性,为 AI 安全扩展提供了新路径。
AI 系统常通过浏览器、应用、本地文件等接触第三方数据,这给了恶意行为者植入精心设计的指令的机会。人类红队测试难以规模化扩展,而常用的稳健性评估已被最新模型刷到接近饱和。为此,OpenAI 训练了仅限内部使用的自动化红队模型 GPT-Red,专门用于发现漏洞并生成对抗性训练数据。
GPT-Red 利用自我博弈强化学习训练:它和一组多样性防御模型在真实场景中同步对抗。当 GPT-Red 成功诱发错误输出(如提示注入)时获得奖励,防御方则因抵御成功获得奖励。随着防御变强,GPT-Red 被迫发现更强、更多样的攻击。训练完成后,GPT-Red 成为非常强大的攻击者,几乎能攻破与之对抗的所有模型(包括生产模型 GPT-5.5)。
OpenAI 将 GPT-Red 与部署模型隔离,避免恶意能力落入攻击者手中,同时将稳健性融入生产模型。GPT-Red 被直接用于训练 GPT-5.6 Sol,使其成为至今最能抵御提示注入的模型:在最严格的直接提示注入基准测试中,失败次数比四个月前的最佳生产模型减少了 6 倍。
在泛化能力测试中,GPT-Red 在“间接提示注入竞技场”的 84% 场景中成功攻击 GPT-5.1,而人类仅 13%。真实案例研究中,GPT-Red 成功攻破了 OpenAI 办公室的 AI 自动售货机智能体,实现了修改商品价格、低价订购等恶意目标。它还比 GPT-5.5 基线更有效地攻破 Codex CLI 智能体,且 Token 效率更高。
通过持续扩大训练规模,OpenAI 发现每代模型都变得更稳健。例如,早期 GPT-Red 发现的“伪思维链”攻击在 GPT-5.1 上成功率超 95%,而在 GPT-5.6 Sol 上低于 10%。同时,模型自身功能不受影响,稳健性提升来自对恶意指令的更强抵抗力,而非过度拒绝。
OpenAI 相信,这种自我博弈训练已开启类似安全飞轮的机制:今天的模型直接提升未来的稳健性、协调能力和可信度。他们将继续扩大计算和数据规模,改进算法,训练更强大的 GPT-Red 版本。更多细节将在本周晚些时候的预印本中发布。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断