OpenAI 发布 GPT-6 Astra,这是其 Preparedness Framework 下首个网络安全能力达到“关键级”并广泛部署的模型。相比前代 GPT-5.6 Sol,各项安全评估显著提升,但思维链可监控性下降,为前沿模型安全监控带来新挑战。
OpenAI 今日发布 GPT-6 Astra。这是该公司迄今投入广泛部署的最强模型,也是在 Preparedness Framework 下首个网络安全能力达到“关键级”(Critical)的模型。这意味着在提供合适工具和访问权限时,Astra 无需人工逐步引导,就能发现未知安全漏洞并开发新的利用方式,影响范围覆盖许多受保护系统。为此,OpenAI 显著加强了对模型有害网络行为的防护,同时强化内部研发与部署的安全流程,包括更严格的隔离、检查点加密、对包含思维链的完整轨迹的通用监控,以及内部使用前的阻断式对齐评估。
相比 GPT-5.6 Sol,Astra 对越狱攻击的鲁棒性明显更强,长任务轨迹中也是如此。OpenAI 通过内外部越狱测试验证了改进,并针对被标记为高风险的用户训练了更保守的拒绝边界。对齐方面,Astra 的改进覆盖预训练数据构成与强化学习评分等环节,新的对齐评估套件显示它更尊重安全和授权边界。在超过 54,000 项内部 Codex 任务模拟中,Astra 收到的高危失稳行为标记约为 Sol 的一半。
Astra 对提示注入的抵抗明显增强。在贴近真实的浏览与专业计算机环境中,未经授权交易、数据丢失、越权访问或规避控制等风险行为的发生率都低于 Sol;面对与暴力攻击策划或欺诈相关的请求时,它也表现得更加安全。OpenAI 还发现,Astra 在高风险场景中实现了帕累托改进:既能安全完成原本不安全的请求,又避免了对无害请求的不必要拒绝,同时能更一致地对 18 岁以下用户应用年龄边界。
OpenAI 已将失稳监控扩展至 Astra 外部部署中所有涉及工具调用的推理过程,尽管这带来了可观的算力成本。不过,Astra 的可监控性相比 Sol 有所下降:它更擅长控制自身思维链,也更少在思维链中包含可归罪信息。对抗性测试中,这一模型能够在评估中策略性表现不佳而不被发现,并在被要求执行某些破坏性任务时偶尔绕过内部监控。目前没有证据表明 Astra 会使用隐写式思维链推理,因此逃避风险可能主要集中在较低层推理任务中。
OpenAI 强调,这些可监控性结论主要来自对抗性评估,且整体上 Astra 违反安全与限制的倾向仍低于 Sol。公司会严肃对待这一趋势,并将保留思维链可监控性列为核心研究目标。同时,这凸显了开发不依赖思维链内容的对齐审计方法的重要性。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断