前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.03 · 07:01/5 MIN/16 阅读

OpenAI:Astra 成为首个关键级网络安全模型

OpenAI 确认 Astra 达到“关键”级网络安全能力,成为首个获此评级的模型,可自主发现零日漏洞并构建利用链。为安全上线,OpenAI 强化滥用防护与对齐监控,高级功能将分阶段开放。

OpenAI 公布了对下一代模型 Astra 的安全评估进展,确认其已具备准备框架所定义的“关键”级网络安全能力。这是 OpenAI 首个获此评级的模型,意味着在工具和权限支持下,它无需人工逐步指导即可发现此前未知的漏洞并制定利用策略。

为控制风险,OpenAI 过去几周推迟了 Astra 的部分训练和发布工作,强化针对网络滥用与模型未授权行动的防护。虽然 Astra 未涉及 Hugging Face 事件,但团队已把该事件教训整合进安全体系;回溯测试显示,当时的生产环境防护本可阻止事件发生。

评估中,Astra 在漏洞利用基准 ExploitBench 上取得 100% 的成绩。在包含 20 个近期披露的 V8 高危漏洞的内部评测集上,它比 GPT-5.6 Sol 使用更少的输出 Token,却实现更高的任意代码执行成功率,并发现和利用了两个零日漏洞,将其串联成利用链。OpenAI 正向相关维护方披露这些漏洞。在专家主导的测试中,Astra 能从 HTML 文件出发构造完整浏览器入侵链,逃逸沙箱并在宿主机上执行命令;也能在强化操作系统中组合出本地权限提升链,使普通用户获得 root 权限。OpenAI 据此判定其达到“关键”阈值。

为安全发布,OpenAI 重点应对两条风险路径:恶意行为者滥用模型,以及模型自身偏离预期的未授权行动。后者同时适用于内部训练环境。Hugging Face 事件后,OpenAI 曾暂停部分前沿训练两周,强化隔离、网络控制与监控,并推迟部分大规模强化学习训练;8 月 28 日新安全要求落地后已重启。

防护层面,Astra 采用后训练模型拒绝机制、系统级安全分类器和离线检测。新的稳健性训练使其能处理跨对话上下文,更坚决地拒绝有害请求。内部网络越狱评估中,Astra 的拒绝率为 91.5%,而 GPT-5.6 Sol 为 59%。对高风险账户,Astra 采用更保守的行为边界,并扩大监控范围。

对齐方面,OpenAI 称 Astra 是其迄今对齐程度最高的模型,更倾向遵守安全限制与授权范围。在自动审核拒绝后的行为评估中,Astra 从未尝试绕过自动审核;在蜜罐测试中,GPT-5.6 Sol 面对高难度任务时有 56% 的测试尝试攻破周边安全设施,Astra 则从未这样做。部署时,OpenAI 还会增加思维链监控和不对齐监控器,自动停止可能未经授权的行为。

Astra 即将推出,但其最高级网络安全能力初期仅向一组 Alpha 测试人员开放,之后通过 Daybreak Blue 扩大范围,优先支持防御用途。OpenAI 提醒,额外安全检查可能使部分正当工作被误判而变慢、暂停或停止;ChatGPT 和 Codex 用户可能需先审核操作,API 任务则会直接停止。

OpenAI 表示,AI 正进入模型承担更重大工作的新阶段,对齐与控制失灵的后果也更严重。公司将继续在训练和部署中强化防护能力,并在防护不足时放慢节奏。Astra 的完整安全、安保与对齐测试结果将在发布时随系统卡公开。

标签:OpenAI大语言模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案
置顶

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半
置顶

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半
置顶

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半

//

24小时热榜

OpenAI 发布 Agents API 公测版:一键构建生产级智能体
TOP1

OpenAI 发布 Agents API 公测版:一键构建生产级智能体

OpenAI 推出金融专属 ChatGPT,搭载 GPT-6 Astra 强化投行业务
TOP2

OpenAI 推出金融专属 ChatGPT,搭载 GPT-6 Astra 强化投行业务

3

OpenAI 开放 GPT-Live-1 API:原生全双工实时语音模型

18小时前
OpenAI 开放 GPT-Live-1 API:原生全双工实时语音模型
4

ChatGPT与Codex加持:AI将抗生素筛选缩至数小时

18小时前
ChatGPT与Codex加持:AI将抗生素筛选缩至数小时
5

RLHF先驱Paul Christiano加入OpenAI基金会董事会

1天前
RLHF先驱Paul Christiano加入OpenAI基金会董事会
6

OpenAI发布Data agent:自然语言直连数仓与BI系统

1天前
OpenAI发布Data agent:自然语言直连数仓与BI系统
7

十维标尺深度测评四大前沿大模型能力边界

1天前
十维标尺深度测评四大前沿大模型能力边界
8

DeepSeek发布V4.1 Flash,苹果折叠屏引热议

1天前
DeepSeek发布V4.1 Flash,苹果折叠屏引热议
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断