前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.03 · 07:01/5 MIN/0 阅读

OpenAI:Astra 成为首个关键级网络安全模型

OpenAI 确认 Astra 达到“关键”级网络安全能力,成为首个获此评级的模型,可自主发现零日漏洞并构建利用链。为安全上线,OpenAI 强化滥用防护与对齐监控,高级功能将分阶段开放。

OpenAI 公布了对下一代模型 Astra 的安全评估进展,确认其已具备准备框架所定义的“关键”级网络安全能力。这是 OpenAI 首个获此评级的模型,意味着在工具和权限支持下,它无需人工逐步指导即可发现此前未知的漏洞并制定利用策略。

为控制风险,OpenAI 过去几周推迟了 Astra 的部分训练和发布工作,强化针对网络滥用与模型未授权行动的防护。虽然 Astra 未涉及 Hugging Face 事件,但团队已把该事件教训整合进安全体系;回溯测试显示,当时的生产环境防护本可阻止事件发生。

评估中,Astra 在漏洞利用基准 ExploitBench 上取得 100% 的成绩。在包含 20 个近期披露的 V8 高危漏洞的内部评测集上,它比 GPT-5.6 Sol 使用更少的输出 Token,却实现更高的任意代码执行成功率,并发现和利用了两个零日漏洞,将其串联成利用链。OpenAI 正向相关维护方披露这些漏洞。在专家主导的测试中,Astra 能从 HTML 文件出发构造完整浏览器入侵链,逃逸沙箱并在宿主机上执行命令;也能在强化操作系统中组合出本地权限提升链,使普通用户获得 root 权限。OpenAI 据此判定其达到“关键”阈值。

为安全发布,OpenAI 重点应对两条风险路径:恶意行为者滥用模型,以及模型自身偏离预期的未授权行动。后者同时适用于内部训练环境。Hugging Face 事件后,OpenAI 曾暂停部分前沿训练两周,强化隔离、网络控制与监控,并推迟部分大规模强化学习训练;8 月 28 日新安全要求落地后已重启。

防护层面,Astra 采用后训练模型拒绝机制、系统级安全分类器和离线检测。新的稳健性训练使其能处理跨对话上下文,更坚决地拒绝有害请求。内部网络越狱评估中,Astra 的拒绝率为 91.5%,而 GPT-5.6 Sol 为 59%。对高风险账户,Astra 采用更保守的行为边界,并扩大监控范围。

对齐方面,OpenAI 称 Astra 是其迄今对齐程度最高的模型,更倾向遵守安全限制与授权范围。在自动审核拒绝后的行为评估中,Astra 从未尝试绕过自动审核;在蜜罐测试中,GPT-5.6 Sol 面对高难度任务时有 56% 的测试尝试攻破周边安全设施,Astra 则从未这样做。部署时,OpenAI 还会增加思维链监控和不对齐监控器,自动停止可能未经授权的行为。

Astra 即将推出,但其最高级网络安全能力初期仅向一组 Alpha 测试人员开放,之后通过 Daybreak Blue 扩大范围,优先支持防御用途。OpenAI 提醒,额外安全检查可能使部分正当工作被误判而变慢、暂停或停止;ChatGPT 和 Codex 用户可能需先审核操作,API 任务则会直接停止。

OpenAI 表示,AI 正进入模型承担更重大工作的新阶段,对齐与控制失灵的后果也更严重。公司将继续在训练和部署中强化防护能力,并在防护不足时放慢节奏。Astra 的完整安全、安保与对齐测试结果将在发布时随系统卡公开。

标签:OpenAI大语言模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

Agent OS 的三种入口:为什么阿里、腾讯、AWS 押了三条不同的路
置顶

Agent OS 的三种入口:为什么阿里、腾讯、AWS 押了三条不同的路

特努斯上任第一天:苹果悄悄放弃了自研大模型这条路
置顶

特努斯上任第一天:苹果悄悄放弃了自研大模型这条路

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来
置顶

Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来

//

24小时热榜

OpenAI:Astra 成为首个关键级网络安全模型
TOP1

OpenAI:Astra 成为首个关键级网络安全模型

ChatGPT 提升答案质量,批判性思维激发原创力
TOP2

ChatGPT 提升答案质量,批判性思维激发原创力

3

WebLLM:用 WebGPU 把大模型跑进浏览器

9小时前
WebLLM:用 WebGPU 把大模型跑进浏览器
4

智元机器人夺 18 枚金牌:量产机在运动会创纪录

9小时前
智元机器人夺 18 枚金牌:量产机在运动会创纪录
5

zvec-grep:为人类和 AI 智能体统一本地搜索

9小时前
zvec-grep:为人类和 AI 智能体统一本地搜索
6

亚马逊购物 AI 新增诈骗识别:让 Alexa 替你验真假

9小时前
亚马逊购物 AI 新增诈骗识别:让 Alexa 替你验真假
7

Pangram:Substack 背后的 AI 文本检测公司

9小时前
Pangram:Substack 背后的 AI 文本检测公司
8

ChatGPT 桌面应用内嵌了一整套 LibreOffice

9小时前
ChatGPT 桌面应用内嵌了一整套 LibreOffice
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断