前途科技前途科技
  • 洞察
  • 服务
  • 关于
  • AI 资讯
    • 快讯
    • 产品
    • 技术
    • 商业
    • 政策
    • 初创
  • 洞察
  • 资源中心
    • 深度研究
      • AI 前沿
      • 案例研究
      • AI 知识库
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们

OpenAI 放缓前沿模型训练以强化安全防护

AI 前沿2026年8月17日· 原作者:OpenAI Blog· 6 分钟阅读0 阅读

OpenAI 因 Astra 模型可能达到关键网络安全能力门槛,暂时放缓强化学习训练,并升级监控、对齐和隔离措施,以应对日益增强的模型能力带来的风险。

OpenAI 放缓前沿模型训练以强化安全防护

过去几周,两个事件凸显了日益强大的 AI 系统所带来的风险:一是 OpenAI-Hugging Face 安全事故,二是有初步证据表明,我们即将发布的 Astra 模型可能达到关键网络安全能力门槛——这是我们的准备框架中定义的最高风险级别。这两件事,加上内部研究的快速进展,让我们更加紧迫地加强训练全流程的监控、对齐和隔离防护。

随着模型能力不断增强,内部开发和测试过程中的风险也在上升。我们对监控、对齐和安全的标准必须跑在风险前面。为了达到这些标准,我们暂时放慢了规模化速度,包括将最新模型的强化学习(RL)训练暂停两周,以便进一步加固和红队测试研究环境、扩大监控系统覆盖范围。我们最大的前沿 RL 训练任务仍处于暂停状态,接下来将先进行小规模训练和评估,以观察模型行为、验证防护措施,并为对齐积累更多证据。

对齐——让 AI 系统按预期行事并接受人类监督——一直是我们的研究核心。现在,我们在整个训练过程中都要求更强的对齐行为证据。保持日益强大的系统对齐,是整个领域都需要面对的挑战。从即将推出的模型中看到的信号表明,我们需要更全面的方法,在现有准备框架基础上继续拓展。

我们认为了解这些变化很重要。以下是我们已经在研究流程和基础设施上做出的调整,以及仍在推进中的工作。

为更强大的模型加固防护

我们开发更强大模型的方法建立在三道相互强化的防线上:

  1. 监控:发现可疑行为并及时响应。
  2. 对齐:降低有害或未经授权行为发生的可能性。
  3. 安全措施:限制 AI 系统能访问或影响的范围。

我们预计模型很快将接管大部分安全工作,包括防御其他模型。这样三道防线就能随模型能力扩展,这一点至关重要。

我们将这些防护应用于研究和部署的各个环节,并根据每个模型的能力、运行环境和风险水平进行调整。

保障研究环境安全

随着前沿模型的网络安全能力增强,我们提高了训练和评估环境的安全标准。达到这些标准需要大量工程投入,也给前沿研究带来了不小的成本和延误。在 OpenAI-Hugging Face 事件*发生后,我们立即暂停了研究集群中可能执行代码或使用联网工具的前沿模型推理任务。随后我们恢复了受限且更安全的代码执行路径,并逐一审查每个工作负载,判断能否安全恢复。部分研究负载已在新控制下恢复,另一些则需要进一步改造。

在接下来的几周里,我们为前沿研究负载制定并开始实施更严格的安全要求,包括:

  • 工作负载隔离:对执行模型生成或不受信任代码的工作负载,现在要求更强的隔离(“沙箱”)。处理模型输出时可能被攻破的软件也适用同样要求。
  • 网络隔离:我们实施了更多控制,将高风险和不受信任的工作负载与互联网隔离。这些控制的设计目标是:即使单个工作负载或支撑服务被攻破,也不能单独导致未经授权访问互联网或其他内部网络。
  • 持续安全测试:我们重新配置了环境,移除了可能存在漏洞的共享服务、减少常驻权限,并改进了安全与信任边界。同时,我们也在提升安全日志的采集和监控能力。最后,我们正在投资构建基于模型的自动化测试,持续模拟攻击来检验这些边界。

这些控制共同构成了纵深防御,保护研究环境免受攻击。目前,对于涉及 Astra 或网络模型的工作负载,我们要求最高级别的安全防护,因为我们已经认定 Astra 可能具备关键级网络能力。其他所有与网络安全相关的工作负载同样适用这些要求。

虽然部分 Astra 训练和评估已满足这些要求,但仍有大量工作负载需要先迁移和加固,在此之前保持暂停。我们会优先将安全和对齐相关工作负载迁移到新环境。

扩展思维链监控

监控一直是模型开发流程的重要部分,包括对内部编码智能体和长时间运行会话的监控。此前监控重点放在前沿模型的内部部署和前沿 RL 训练上,因为这些工作负载风险最高,可能将高级模型能力与工具、敏感系统及内部或外部网络访问结合起来。但并非所有使用工具的推理和训练都纳入监控。我们已通过新的监控方案对原有做法进行了修订和扩展。

新的监控方案是多阶段的:首先通过激活分类器(检查模型内部活动的检测器)对每个采样 token 进行检测,发现可疑情况后升级到更复杂、更高算力的自动调查系统。这些系统会检查工具操作、可用推理和完整活动序列,以识别未经授权的访问、数据窃取、破坏行为以及试图绕过安全防护的行为。我们目标是:监控系统发现可疑活动后 30 分钟内发出警报。如果系统判断可能违反关键安全边界,就会生成最高优先级警报。当前实现中,安全、安保和研究团队会收到通知;若无法在 30 分钟内确认警报为误报,团队必须暂停相关活动。

所有涉及工具的 Sol 及以上能力模型的 RL 训练和评估都必须启用此监控。8 月 7 日我们确定 Astra 可能具备关键网络能力后,又增加了对 Astra 使用工具时的所有推理(不仅是 RL 训练和评估)的监控要求。

这些防护需要大量算力。我们目前估计监控开销约为被监控推理算力的 20%,具体成本在训练和评估负载间差异很大。我们将在后续博文中分享更多细节。

推进对齐研究

对齐研究是我们的核心使命——确保通用人工智能(AGI)造福全人类。随着模型获得高级能力(如网络攻击能力)并在更复杂的环境中运行,奖励黑客(在训练中骗取高奖励却不达成预期目标)、欺骗、未授权访问等不对齐行为将带来越来越严重的风险。

对于最强模型的 RL 运行,我们正在将核心对齐技术应用到训练流程的更多环节,包括:改进奖励模型以更好地检测和阻止跨任务、跨环境的不安全行为;训练模型更诚实地报告自身行动、能力和局限;减少利用奖励、评分器、工具或监督漏洞的行为。我们还在增加与外部系统或资源交互时可能造成危害的行为训练覆盖。

我们将继续大力投资对齐研究、扩大评估覆盖,并将所学应用到训练和安全防护中。近期我们会分享更多对齐研究进展,包括我们对模型行为的观察和发现的新挑战。

下一步

我们将升级准备框架,把安全防护统一纳入训练和部署全流程,并更好反映未来模型的能力及其运行环境。开发能随能力扩展的方法,需要持续投入模型辅助安全、更有效的监控,以及对齐研究的不断进步。我们打算引入外部机构参与,并在方法演进过程中分享更多经验。

前沿模型的能力正在快速跃升。我们理解、对齐和保障它们的能力,必须走在前面。

我们将在未来几周内发布技术报告,分享事件中的经验教训。


原文链接:OpenAI Blog
本文由前途科技编辑整理

标签:OpenAIAI安全模型对齐网络安全前沿模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

会打字,就能"拍"电影:ScriptTask 开放限量内测
置顶

会打字,就能"拍"电影:ScriptTask 开放限量内测

//

24小时热榜

Ultrafast 预览:GPT-5.6 Sol 提速 14 倍
TOP1

Ultrafast 预览:GPT-5.6 Sol 提速 14 倍

OpenAI 强化安全防护,暂缓前沿模型训练
前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
TOP2

OpenAI 强化安全防护,暂缓前沿模型训练

3

OpenAI 与 CodeAI 合作培养 AI 原生代

9小时前
OpenAI 与 CodeAI 合作培养 AI 原生代
4

OpenAI参建俄亥俄州8吉瓦AI数据中心

1天前
OpenAI参建俄亥俄州8吉瓦AI数据中心
5

防御者的窗口已经打开

1天前
防御者的窗口已经打开
6

OpenAI 放缓前沿模型训练以强化安全防护

1天前
OpenAI 放缓前沿模型训练以强化安全防护
7

OpenAI 携手 CodeAI 培养 AI 时代第一代学生

1天前
OpenAI 携手 CodeAI 培养 AI 时代第一代学生
8

ChatGPT 青少年版发布:为学习而生、内置保护

1天前
ChatGPT 青少年版发布:为学习而生、内置保护
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断