OpenAI 因 Astra 模型可能达到关键网络安全能力门槛,暂时放缓强化学习训练,并升级监控、对齐和隔离措施,以应对日益增强的模型能力带来的风险。

过去几周,两个事件凸显了日益强大的 AI 系统所带来的风险:一是 OpenAI-Hugging Face 安全事故,二是有初步证据表明,我们即将发布的 Astra 模型可能达到关键网络安全能力门槛——这是我们的准备框架中定义的最高风险级别。这两件事,加上内部研究的快速进展,让我们更加紧迫地加强训练全流程的监控、对齐和隔离防护。
随着模型能力不断增强,内部开发和测试过程中的风险也在上升。我们对监控、对齐和安全的标准必须跑在风险前面。为了达到这些标准,我们暂时放慢了规模化速度,包括将最新模型的强化学习(RL)训练暂停两周,以便进一步加固和红队测试研究环境、扩大监控系统覆盖范围。我们最大的前沿 RL 训练任务仍处于暂停状态,接下来将先进行小规模训练和评估,以观察模型行为、验证防护措施,并为对齐积累更多证据。
对齐——让 AI 系统按预期行事并接受人类监督——一直是我们的研究核心。现在,我们在整个训练过程中都要求更强的对齐行为证据。保持日益强大的系统对齐,是整个领域都需要面对的挑战。从即将推出的模型中看到的信号表明,我们需要更全面的方法,在现有准备框架基础上继续拓展。
我们认为了解这些变化很重要。以下是我们已经在研究流程和基础设施上做出的调整,以及仍在推进中的工作。
我们开发更强大模型的方法建立在三道相互强化的防线上:
我们预计模型很快将接管大部分安全工作,包括防御其他模型。这样三道防线就能随模型能力扩展,这一点至关重要。
我们将这些防护应用于研究和部署的各个环节,并根据每个模型的能力、运行环境和风险水平进行调整。
随着前沿模型的网络安全能力增强,我们提高了训练和评估环境的安全标准。达到这些标准需要大量工程投入,也给前沿研究带来了不小的成本和延误。在 OpenAI-Hugging Face 事件*发生后,我们立即暂停了研究集群中可能执行代码或使用联网工具的前沿模型推理任务。随后我们恢复了受限且更安全的代码执行路径,并逐一审查每个工作负载,判断能否安全恢复。部分研究负载已在新控制下恢复,另一些则需要进一步改造。
在接下来的几周里,我们为前沿研究负载制定并开始实施更严格的安全要求,包括:
这些控制共同构成了纵深防御,保护研究环境免受攻击。目前,对于涉及 Astra 或网络模型的工作负载,我们要求最高级别的安全防护,因为我们已经认定 Astra 可能具备关键级网络能力。其他所有与网络安全相关的工作负载同样适用这些要求。
虽然部分 Astra 训练和评估已满足这些要求,但仍有大量工作负载需要先迁移和加固,在此之前保持暂停。我们会优先将安全和对齐相关工作负载迁移到新环境。
监控一直是模型开发流程的重要部分,包括对内部编码智能体和长时间运行会话的监控。此前监控重点放在前沿模型的内部部署和前沿 RL 训练上,因为这些工作负载风险最高,可能将高级模型能力与工具、敏感系统及内部或外部网络访问结合起来。但并非所有使用工具的推理和训练都纳入监控。我们已通过新的监控方案对原有做法进行了修订和扩展。
新的监控方案是多阶段的:首先通过激活分类器(检查模型内部活动的检测器)对每个采样 token 进行检测,发现可疑情况后升级到更复杂、更高算力的自动调查系统。这些系统会检查工具操作、可用推理和完整活动序列,以识别未经授权的访问、数据窃取、破坏行为以及试图绕过安全防护的行为。我们目标是:监控系统发现可疑活动后 30 分钟内发出警报。如果系统判断可能违反关键安全边界,就会生成最高优先级警报。当前实现中,安全、安保和研究团队会收到通知;若无法在 30 分钟内确认警报为误报,团队必须暂停相关活动。
所有涉及工具的 Sol 及以上能力模型的 RL 训练和评估都必须启用此监控。8 月 7 日我们确定 Astra 可能具备关键网络能力后,又增加了对 Astra 使用工具时的所有推理(不仅是 RL 训练和评估)的监控要求。
这些防护需要大量算力。我们目前估计监控开销约为被监控推理算力的 20%,具体成本在训练和评估负载间差异很大。我们将在后续博文中分享更多细节。
对齐研究是我们的核心使命——确保通用人工智能(AGI)造福全人类。随着模型获得高级能力(如网络攻击能力)并在更复杂的环境中运行,奖励黑客(在训练中骗取高奖励却不达成预期目标)、欺骗、未授权访问等不对齐行为将带来越来越严重的风险。
对于最强模型的 RL 运行,我们正在将核心对齐技术应用到训练流程的更多环节,包括:改进奖励模型以更好地检测和阻止跨任务、跨环境的不安全行为;训练模型更诚实地报告自身行动、能力和局限;减少利用奖励、评分器、工具或监督漏洞的行为。我们还在增加与外部系统或资源交互时可能造成危害的行为训练覆盖。
我们将继续大力投资对齐研究、扩大评估覆盖,并将所学应用到训练和安全防护中。近期我们会分享更多对齐研究进展,包括我们对模型行为的观察和发现的新挑战。
我们将升级准备框架,把安全防护统一纳入训练和部署全流程,并更好反映未来模型的能力及其运行环境。开发能随能力扩展的方法,需要持续投入模型辅助安全、更有效的监控,以及对齐研究的不断进步。我们打算引入外部机构参与,并在方法演进过程中分享更多经验。
前沿模型的能力正在快速跃升。我们理解、对齐和保障它们的能力,必须走在前面。
我们将在未来几周内发布技术报告,分享事件中的经验教训。
原文链接:OpenAI Blog
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断