OpenAI 表示,由于 AI 系统网络安全能力快速提升及内部安全事件,公司已暂停部分前沿模型训练,并强化监控、对齐与隔离措施。此举旨在应对即将推出的 Astra 模型可能具备的关键网络能力风险,确保安全标准领先于模型能力增长。
过去几周,两起事件凸显了日益强大的 AI 系统所伴随的风险:一是 OpenAI-Hugging Face 事件,二是初步证据显示,OpenAI 即将推出的 Astra 模型可能达到其 预备框架 所定义的 关键网络安全能力 门槛。两者叠加内部研究的快速进展,让 OpenAI 更加紧迫地加强训练全流程中的监控、对齐与隔离防护。
随着模型能力提升,内部研发和测试的风险也在上升。为了确保相关标准跑在风险前面,OpenAI 暂时放慢了模型扩展的节奏——包括将最新部署模型的强化学习(RL)训练暂停两周,以便加固和红队测试研究环境,并扩大监控系统的覆盖范围。目前,其最大的前沿 RL 训练仍处于暂停状态,等待通过小规模训练和评估来验证模型行为、检验保护措施,并积累更多对齐证据。
OpenAI 认为,开发更强大模型需要依靠三项相互加强的保障:监控(检测并响应异常行为)、对齐(降低有害或越权行为发生的概率)、安全措施(限制 AI 系统可访问或影响的范围)。对齐 一直是 OpenAI 研究的核心,这些保障贯穿研究和部署,并根据模型能力、运行环境和风险水平进行调整。
随着前沿模型获得更强的网络安全能力,OpenAI 正在提高训练和评估环境的安全标准。OpenAI-Hugging Face 事件发生后,OpenAI 立即暂停了研究集群中可能执行代码或访问互联网的前沿模型推理,随后恢复了受限且更安全的代码执行路径,并逐一审查工作负载能否安全恢复。部分工作负载在新控制措施下恢复,另一些则需要额外改造。
过去几周,OpenAI 为前沿研究工作负载定义并实施了更严格的安全要求,包括:
对于 Astra 或网络模型相关的工作负载,由于 Astra 可能具备关键网络能力,OpenAI 目前要求最高等级的安全防护,所有其他网络相关工作负载也适用同样要求。部分 Astra 训练和评估已满足这些要求,但仍有大量工作负载在完成迁移和加固前保持暂停。OpenAI 优先迁移安全和对齐相关工作负载。
监控一直是 OpenAI 模型开发的一部分,此前主要用于 内部编码智能体监控 和 长时运行会话。新的监控系统采用多阶段设计:先是激活分类器(检查模型内部活动的检测器),对每个采样 token 运行,将潜在问题升级给更复杂的自动化调查系统,后者检查工具操作、推理内容和完整活动序列,以发现未授权访问、数据窃取、破坏行为及对抗安全防护的尝试。OpenAI 的目标是在监控发现可疑行为后 30 分钟内发出警报;若系统判定可能违反关键安全边界,则生成最高优先级警报,并通知安全、安保和研究团队;若无法在 30 分钟内确认误报,相关活动将被暂停。
该监控系统已用于所有涉及工具的 Sol 及以上能力模型的 RL 训练与评估。8 月 7 日确定 Astra 可能具备关键网络能力后,OpenAI 进一步要求对 Astra 所有带工具的推理(不仅是 RL 训练和评估)进行监控。据估算,监控开销约为被监控推理算力的 20%,不同训练和评估工作负载差异较大。
对齐研究是 OpenAI 使命的核心。随着模型获得网络攻击等高级能力,奖励黑客、欺骗或未授权访问等不对齐行为将带来日益严重的风险。对于最强大模型的 RL 运行,OpenAI 现在将核心对齐技术应用于更多训练阶段:改进奖励模型以检测和阻止不安全行为;训练模型更诚实地说明自身行动、能力和局限;减少利用奖励、评分器、工具或监督漏洞的行为。同时,OpenAI 增加了模型与外部系统交互可能造成危害的行为训练覆盖,并持续加大对齐研究投入、扩大评估覆盖,利用研究成果指导训练和防护。
OpenAI 将改进其预备框架,将这些保障整合到训练和部署中,以更好地反映未来模型的能力和运行环境。这需要持续投资于模型辅助安全、更有效的监控和对齐研究。OpenAI 还计划引入外部组织,并分享更多经验。前沿模型能力正在快速加速,OpenAI 的理解、对齐和安全能力必须保持领先。OpenAI 将在未来几周发布相关技术报告。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断