前途科技前途科技
  • 洞察
  • 服务
  • 关于
  • AI 资讯
    • 快讯
    • 产品
    • 技术
    • 商业
    • 政策
    • 初创
  • 洞察
  • 资源中心
    • 深度研究
      • AI 前沿
      • 案例研究
      • AI 知识库
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们

OpenAI 强化安全防护,暂缓前沿模型训练

技术2026年8月18日· 6 分钟阅读0 阅读

OpenAI 表示,由于 AI 系统网络安全能力快速提升及内部安全事件,公司已暂停部分前沿模型训练,并强化监控、对齐与隔离措施。此举旨在应对即将推出的 Astra 模型可能具备的关键网络能力风险,确保安全标准领先于模型能力增长。

过去几周,两起事件凸显了日益强大的 AI 系统所伴随的风险:一是 OpenAI-Hugging Face 事件,二是初步证据显示,OpenAI 即将推出的 Astra 模型可能达到其 预备框架 所定义的 关键网络安全能力 门槛。两者叠加内部研究的快速进展,让 OpenAI 更加紧迫地加强训练全流程中的监控、对齐与隔离防护。

随着模型能力提升,内部研发和测试的风险也在上升。为了确保相关标准跑在风险前面,OpenAI 暂时放慢了模型扩展的节奏——包括将最新部署模型的强化学习(RL)训练暂停两周,以便加固和红队测试研究环境,并扩大监控系统的覆盖范围。目前,其最大的前沿 RL 训练仍处于暂停状态,等待通过小规模训练和评估来验证模型行为、检验保护措施,并积累更多对齐证据。

OpenAI 认为,开发更强大模型需要依靠三项相互加强的保障:监控(检测并响应异常行为)、对齐(降低有害或越权行为发生的概率)、安全措施(限制 AI 系统可访问或影响的范围)。对齐 一直是 OpenAI 研究的核心,这些保障贯穿研究和部署,并根据模型能力、运行环境和风险水平进行调整。

研究环境安全

随着前沿模型获得更强的网络安全能力,OpenAI 正在提高训练和评估环境的安全标准。OpenAI-Hugging Face 事件发生后,OpenAI 立即暂停了研究集群中可能执行代码或访问互联网的前沿模型推理,随后恢复了受限且更安全的代码执行路径,并逐一审查工作负载能否安全恢复。部分工作负载在新控制措施下恢复,另一些则需要额外改造。

过去几周,OpenAI 为前沿研究工作负载定义并实施了更严格的安全要求,包括:

  • 工作负载隔离:对执行模型生成或不可信代码的工作负载要求更强的沙箱隔离,处理模型输出的软件同样适用。
  • 网络隔离:增加更高风险、不可信工作负载与互联网的隔离控制,确保单一工作负载失陷不会直接导致对互联网或其他内部网络的未授权访问。
  • 持续安全测试:重构环境以移除潜在漏洞的共享服务、降低常驻权限、优化安全边界,同时改进安全日志的收集与监控,并投资于利用模型自动化持续对抗模拟攻击。

对于 Astra 或网络模型相关的工作负载,由于 Astra 可能具备关键网络能力,OpenAI 目前要求最高等级的安全防护,所有其他网络相关工作负载也适用同样要求。部分 Astra 训练和评估已满足这些要求,但仍有大量工作负载在完成迁移和加固前保持暂停。OpenAI 优先迁移安全和对齐相关工作负载。

扩展思维链监控

监控一直是 OpenAI 模型开发的一部分,此前主要用于 内部编码智能体监控 和 长时运行会话。新的监控系统采用多阶段设计:先是激活分类器(检查模型内部活动的检测器),对每个采样 token 运行,将潜在问题升级给更复杂的自动化调查系统,后者检查工具操作、推理内容和完整活动序列,以发现未授权访问、数据窃取、破坏行为及对抗安全防护的尝试。OpenAI 的目标是在监控发现可疑行为后 30 分钟内发出警报;若系统判定可能违反关键安全边界,则生成最高优先级警报,并通知安全、安保和研究团队;若无法在 30 分钟内确认误报,相关活动将被暂停。

该监控系统已用于所有涉及工具的 Sol 及以上能力模型的 RL 训练与评估。8 月 7 日确定 Astra 可能具备关键网络能力后,OpenAI 进一步要求对 Astra 所有带工具的推理(不仅是 RL 训练和评估)进行监控。据估算,监控开销约为被监控推理算力的 20%,不同训练和评估工作负载差异较大。

推进对齐研究

对齐研究是 OpenAI 使命的核心。随着模型获得网络攻击等高级能力,奖励黑客、欺骗或未授权访问等不对齐行为将带来日益严重的风险。对于最强大模型的 RL 运行,OpenAI 现在将核心对齐技术应用于更多训练阶段:改进奖励模型以检测和阻止不安全行为;训练模型更诚实地说明自身行动、能力和局限;减少利用奖励、评分器、工具或监督漏洞的行为。同时,OpenAI 增加了模型与外部系统交互可能造成危害的行为训练覆盖,并持续加大对齐研究投入、扩大评估覆盖,利用研究成果指导训练和防护。

下一步

OpenAI 将改进其预备框架,将这些保障整合到训练和部署中,以更好地反映未来模型的能力和运行环境。这需要持续投资于模型辅助安全、更有效的监控和对齐研究。OpenAI 还计划引入外部组织,并分享更多经验。前沿模型能力正在快速加速,OpenAI 的理解、对齐和安全能力必须保持领先。OpenAI 将在未来几周发布相关技术报告。

标签:OpenAIAI安全大语言模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

会打字,就能"拍"电影:ScriptTask 开放限量内测
置顶

会打字,就能"拍"电影:ScriptTask 开放限量内测

//

24小时热榜

Ultrafast 预览:GPT-5.6 Sol 提速 14 倍
TOP1

Ultrafast 预览:GPT-5.6 Sol 提速 14 倍

OpenAI 强化安全防护,暂缓前沿模型训练
前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
TOP2

OpenAI 强化安全防护,暂缓前沿模型训练

3

OpenAI 与 CodeAI 合作培养 AI 原生代

8小时前
OpenAI 与 CodeAI 合作培养 AI 原生代
4

OpenAI参建俄亥俄州8吉瓦AI数据中心

1天前
OpenAI参建俄亥俄州8吉瓦AI数据中心
5

防御者的窗口已经打开

1天前
防御者的窗口已经打开
6

OpenAI 携手 CodeAI 培养 AI 时代第一代学生

1天前
OpenAI 携手 CodeAI 培养 AI 时代第一代学生
7

OpenAI加强国家安全AI民主监督

1天前
OpenAI加强国家安全AI民主监督
8

OpenAI 放缓前沿模型训练以强化安全防护

1天前
OpenAI 放缓前沿模型训练以强化安全防护
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断