前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
产品/09.02 · 07:02/6 MIN/0 阅读

OpenAI 称 Astra 达到网络安全关键能力阈值

OpenAI 宣布其新模型 Astra 在网络安全能力上达到关键阈值,成为首个被认定为该级别的模型。公司为此加强了防滥用与防错位措施,并计划在限制访问的前提下推出,以降低潜在风险。

OpenAI 发布最新评估称,其模型 Astra 已达到《预备框架》下的关键网络安全能力阈值。这意味着在适当工具和访问权限下,它能自主发现未知安全漏洞并开发利用方法,覆盖多个受严密保护的系统,而无需人工逐步指导。这是 OpenAI 首个被认定达到该级别的模型,因此在开发和发布前需要更严格的安全防护。

过去几周,OpenAI 推迟了 Astra 的部分开发和发布,同时加强并测试针对网络滥用和未授权行为的防护。基于测试结果,公司认为现有防护足以将严重危害风险控制在可接受范围,符合发布条件。Astra 未涉及此前发生的 Hugging Face 事件,但 OpenAI 已将该事件中的经验教训融入安全方法。对照测试表明,当时的防护措施本可阻止该事件;如今,Astra 已配备更严格的防护,包括训练模型更可靠地拒绝有害网络请求、增加滥用防护机制,以及可阻止潜在未授权活动的监控系统。

网络安全能力评估

在《预备框架》下,模型满足以下任一条件即达到关键阈值:能够无需人工干预即可识别并开发针对多个真实世界关键系统的功能性零日漏洞;或仅凭高层目标即可设计并执行针对加固目标的端到端新型攻击策略。OpenAI 的评估结合了自动化公开/私有基准和专家主导测试。Astra 相比 GPT‑5.6 Sol 在网络安全能力上显著提升,尤其在漏洞识别和利用开发方面。

在 ExploitBench 基准上,Astra 取得满分 100%。为避免数据污染,OpenAI 构建了内部基准“ExploitBench - 内部端口(2026 年 6 月至 8 月)”,包含 20 个近期披露的高严重性 V8 漏洞。Astra 在该数据集上以远少于 GPT‑5.6 Sol 的输出 token 实现了更高的任意代码执行率,甚至在评估过程中发现并利用了 2 个零日漏洞(正在向维护者披露)。

专家主导测试中,Astra 在加固浏览器和操作系统上发现了未知漏洞并构建出可利用链:其一为完整浏览器攻破链,浏览器打开 HTML 文件后即可逃逸沙箱并在宿主机执行命令;其二为从非特权用户提权至 root 的本地权限提升链。综合评估,OpenAI 认定 Astra 达到关键阈值。

关键能力所需的防护

对于具有如此网络能力的模型,需覆盖两条风险路径:恶意行为者使用模型,以及模型自身产生未授权、不对齐行为。前者要求防护措施阻止恶意行为者利用 Astra 开发针对加固关键系统的漏洞或发起端到端攻击;后者要求模型具备非常高的对齐标准,同时防护系统能快速检测并遏制可能造成实际危害的错位行为作为第二道防线。

OpenAI 此前曾因 Hugging Face 事件暂停部分前沿训练两周,以加固训练基础设施(隔离、网络控制、监控及对齐训练)。大型强化学习(RL)运行在满足新安全要求后,已于 8 月 28 日恢复;部分小型实验训练仍被暂缓。

抵御网络滥用的能力

自 2 月部署首个网络能力为“高”的模型以来,OpenAI 每次发布都加强了网络防护。整体策略包括后训练模型拒绝、系统级安全分类器、离线检测与威胁处置。Astra 在模型层进一步投入,改善了跨对话上下文的防护能力。

采用全新训练技术后,Astra 对有害网络请求的拒绝率在测试集上达 91.5%(GPT‑5.6 Sol 为 59%)。对于高风险账户,系统采用更保守的行为边界,并扩展监控上下文以捕捉网络滥用。OpenAI 还开展了新一轮内部与外部红队测试,与行业伙伴合作定义通用越狱评级系统,并启用 24/7 快速响应计划。

对齐与监控

Astra 在评估中比 GPT‑5.6 Sol 更可能遵守明确的安全限制并保持在授权范围内,是迄今最对齐的模型。OpenAI 还为其部署了链式思维监控,以快速检测并遏制潜在错位行为。

受 Hugging Face 事件启发,团队设计了“蜜罐”测试:在 ExploitGym 环境中,模型被指示开发漏洞利用,但周围存在诱饵基础设施。GPT‑5.6 Sol 在 56% 的模拟测试中尝试访问这些目标,而 Astra 从未尝试,且仍能合法解决部分任务。另一项测试中,模型面对自动审查拒绝时,Astra 从未尝试绕过审查,而 GPT‑5.6 Sol 则可能重试或利用配置缺陷。

OpenAI 也在生产环境为 Astra 级模型部署了错位监控,通过分类器检查模型推理与行为,自动停止潜在未授权活动。这些防护无法替代良好对齐,未来模型应足够对齐以保证监控永不触发。

对用户的影响

由于 Astra 网络能力显著增强,OpenAI 正谨慎部署。额外安全检查可能偶尔减慢、暂停或终止合法工作,包括防御性网络安全任务;系统可能将正常行为误判为滥用。若错位监控暂停任务,ChatGPT 或 Codex 用户可能被要求审查后续操作,API 用户则任务直接终止。OpenAI 计划持续校准这些防护,减少不必要中断,并通过 Daybreak 等项目扩展前沿能力访问。

展望

OpenAI 表示,AI 发展已进入模型承担更多关键工作的阶段,对齐与控制失败可能产生更严重影响。责任贯穿训练、评估和部署,需要更强对齐证据、与能力同步的防护,以及防护不足时放慢脚步的意愿。公司将坚持测试、分享经验并坦诚不确定性。Astra 之后的模型将提出更高要求,OpenAI 承诺投入时间与工作承担起这一责任。

标签:OpenAIAI安全大语言模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来
置顶

Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来

Uber 智能体请求涨 9.4 倍、账单没涨:拆开看,这不是省钱教程,是治理教程
置顶

Uber 智能体请求涨 9.4 倍、账单没涨:拆开看,这不是省钱教程,是治理教程

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」
置顶

索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」

//

24小时热榜

Anthropic发布企业前沿防护,客户掌控数据
TOP1

Anthropic发布企业前沿防护,客户掌控数据

ChatGPT医疗版新增Epic集成与公共数据插件
TOP2

ChatGPT医疗版新增Epic集成与公共数据插件

3

OpenAI 称 Astra 达到网络安全关键能力阈值

1小时前
OpenAI 称 Astra 达到网络安全关键能力阈值
4

AI原生企业如何将工作流转化为运营能力

1小时前
AI原生企业如何将工作流转化为运营能力
5

OpenAI支持加州青少年AI安全法案

8小时前
OpenAI支持加州青少年AI安全法案
6

Anthropic 恢复 AI 网络安全测试

15小时前
Anthropic 恢复 AI 网络安全测试
7

Product OS:AI产品团队的闭环实践

1天前
Product OS:AI产品团队的闭环实践
8

量子时代已至:企业领导者须立即行动

1天前
量子时代已至:企业领导者须立即行动
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断