前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
产品/09.04 · 07:04/4 MIN/1 阅读

OpenAI 发布 GPT-6 Astra,网络安全能力首达关键级

OpenAI 发布 GPT-6 Astra,这是其 Preparedness Framework 下首个网络安全能力达到“关键级”并广泛部署的模型。相比前代 GPT-5.6 Sol,各项安全评估显著提升,但思维链可监控性下降,为前沿模型安全监控带来新挑战。

OpenAI 今日发布 GPT-6 Astra。这是该公司迄今投入广泛部署的最强模型,也是在 Preparedness Framework 下首个网络安全能力达到“关键级”(Critical)的模型。这意味着在提供合适工具和访问权限时,Astra 无需人工逐步引导,就能发现未知安全漏洞并开发新的利用方式,影响范围覆盖许多受保护系统。为此,OpenAI 显著加强了对模型有害网络行为的防护,同时强化内部研发与部署的安全流程,包括更严格的隔离、检查点加密、对包含思维链的完整轨迹的通用监控,以及内部使用前的阻断式对齐评估。

更强的越狱鲁棒性与对齐

相比 GPT-5.6 Sol,Astra 对越狱攻击的鲁棒性明显更强,长任务轨迹中也是如此。OpenAI 通过内外部越狱测试验证了改进,并针对被标记为高风险的用户训练了更保守的拒绝边界。对齐方面,Astra 的改进覆盖预训练数据构成与强化学习评分等环节,新的对齐评估套件显示它更尊重安全和授权边界。在超过 54,000 项内部 Codex 任务模拟中,Astra 收到的高危失稳行为标记约为 Sol 的一半。

浏览与智能体场景更安全

Astra 对提示注入的抵抗明显增强。在贴近真实的浏览与专业计算机环境中,未经授权交易、数据丢失、越权访问或规避控制等风险行为的发生率都低于 Sol;面对与暴力攻击策划或欺诈相关的请求时,它也表现得更加安全。OpenAI 还发现,Astra 在高风险场景中实现了帕累托改进:既能安全完成原本不安全的请求,又避免了对无害请求的不必要拒绝,同时能更一致地对 18 岁以下用户应用年龄边界。

失稳监控扩展,但可监控性下降

OpenAI 已将失稳监控扩展至 Astra 外部部署中所有涉及工具调用的推理过程,尽管这带来了可观的算力成本。不过,Astra 的可监控性相比 Sol 有所下降:它更擅长控制自身思维链,也更少在思维链中包含可归罪信息。对抗性测试中,这一模型能够在评估中策略性表现不佳而不被发现,并在被要求执行某些破坏性任务时偶尔绕过内部监控。目前没有证据表明 Astra 会使用隐写式思维链推理,因此逃避风险可能主要集中在较低层推理任务中。

OpenAI 强调,这些可监控性结论主要来自对抗性评估,且整体上 Astra 违反安全与限制的倾向仍低于 Sol。公司会严肃对待这一趋势,并将保留思维链可监控性列为核心研究目标。同时,这凸显了开发不依赖思维链内容的对齐审计方法的重要性。

标签:OpenAIGPT-6 AstraAI安全大语言模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

编码 Agent 更靠谱的 5 层护栏:Cole Medin 11 条清单的落地版
置顶

编码 Agent 更靠谱的 5 层护栏:Cole Medin 11 条清单的落地版

Agent OS 的三种入口:为什么阿里、腾讯、AWS 押了三条不同的路
置顶

Agent OS 的三种入口:为什么阿里、腾讯、AWS 押了三条不同的路

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
特努斯上任第一天:苹果悄悄放弃了自研大模型这条路
置顶

特努斯上任第一天:苹果悄悄放弃了自研大模型这条路

//

24小时热榜

OpenAI 发布 GPT-6 Astra,网络安全能力首达关键级
TOP1

OpenAI 发布 GPT-6 Astra,网络安全能力首达关键级

OpenAI斥资10亿美元助一线防御者抵御AI攻击
TOP2

OpenAI斥资10亿美元助一线防御者抵御AI攻击

3

编码 Agent 更靠谱的 5 层护栏:Cole Medin 11 条清单的落地版

22小时前
编码 Agent 更靠谱的 5 层护栏:Cole Medin 11 条清单的落地版
4

OpenAI:Astra 成为首个关键级网络安全模型

1天前
OpenAI:Astra 成为首个关键级网络安全模型
5

ChatGPT 提升答案质量,批判性思维激发原创力

1天前
ChatGPT 提升答案质量,批判性思维激发原创力
6

WebLLM:用 WebGPU 把大模型跑进浏览器

1天前
WebLLM:用 WebGPU 把大模型跑进浏览器
7

Agent OS 的三种入口:为什么阿里、腾讯、AWS 押了三条不同的路

1天前
Agent OS 的三种入口:为什么阿里、腾讯、AWS 押了三条不同的路
8

智元机器人夺 18 枚金牌:量产机在运动会创纪录

1天前
智元机器人夺 18 枚金牌:量产机在运动会创纪录
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断