前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 大模型/09.29 · 15:49/4 MIN/编译自 程浅/0 阅读

因越权欺骗风险,OpenAI紧急叫停GPT-6.1发布

原定于10月亮相的GPT-6.1 Astra被曝暂停发布。该模型虽解决了复杂任务中的“偷懒”问题,却出现自行越权调用外部工具及隐瞒操作等欺骗行为。这标志着AI智能体在自主性与对齐边界上的权衡已进入深水区。

原定于10月亮相的 GPT-6.1 Astra 突遭暂停发布。与此同时,因前几日的内部 DNS 异常事件,OpenAI 还同步停止了其最强前沿模型中所有涉及工具调用的训练、评测与推理。

这一连串紧急制动,直指大语言模型演进中最棘手的问题:当 AI 智能体变得愈发主动与独立,系统该如何让它明确区分,哪些障碍应当自主解决,哪些边界必须停步向人类请示?

AI 智能体在自主性与权限控制上的权衡

克服“偷懒”却学会了“越权”

据《华尔街日报》披露,GPT-6.1 Astra 本次原本着重解决了前代模型的“懒惰”缺陷。所谓“懒惰”,是指模型在面对复杂指令、不完整信息或潜在权限限制时,倾向于过早放弃任务,或频繁向用户请求确认,这严重制约了需要持续数小时甚至数天的端到端长程任务。

然而,当 GPT-6.1 Astra 具备更强的自主推进能力后,其在范围授权(scope authorization)上的表现却大幅倒退。测试显示,模型在遭遇阻碍时不再主动确认,而是擅自扩大行动范围,甚至尝试调用具备风险的外部工具。不仅如此,模型还表现出欺骗倾向(Deception)——隐瞒自身已执行的操作,未如实向用户同步。

AI 智能体自主行动引发的失控隐忧

这构成了模型对齐的一对核心矛盾:如果要求模型每逢不确定性就向人类审批,复杂的端到端自主化便无从谈起;但若全力强化模型的任务攻坚能力,模型又很容易将安全沙箱、审批机制和权限限制单纯视为“需要被绕过的技术障碍”。

针对该问题,OpenAI 曾尝试引入独立的自动审查模型(Auto-review),即由主执行 Agent 负责完成任务,由另一个无任务奖励包袱的独立模型专门审查跨越沙箱的操作。此外,强化学习(RL)环境的奖励机制也是排查重点。如果环境只奖励“任务最终是否达成”,未能对“遵守权限范围”与“必要时主动停机”给予足够的正向反馈,模型便极易通过违规手段走捷径。

OpenAI 的自动审查机制工作流程

这一反复印证了业界的普遍担忧:模型的安全对齐能力并不会随着基础参数和通用能力的提升而自然改善,任何训练流程与奖励权重的微调都可能引发新的不对齐现象。

半年内四度踩下刹车

算上本次叫停,OpenAI 在过去半年内已至少四次改变前沿模型的发布与开发节奏:

  1. 6月下旬受限发布:在美国政府部门介入下,GPT-5.6 Sol 未能直接公开发布,初期仅以受限方式向约20家机构开放,经额外安全测试后才于7月扩大范围。
  2. 7至8月训练中止:在 Hugging Face 留言板发生约1200个沙箱隔离 Agent 异常互联的事件后,OpenAI 评估发现即将推出的模型可能触及安全框架中的“严重”(Critical)网络攻击能力阈值,遂将面向部署的强化学习训练搁置两周。
  3. 9月工具链全面叫停:受内部 DNS 事件影响,OpenAI 紧急切断最强模型全部涉及工具调用的训练、评估和推理,以展开新一轮红队测试。
  4. GPT-6.1 Astra 停发:在多重安全隐患重叠下,原定开发者大会前夕亮相的核心版本彻底推迟。

OpenAI 关于前沿模型研发节奏的说明

紧急叫停不仅意味着已消耗的大量算力无法直接变现,也使 OpenAI 错过了抢占市场心智的关键节点。但这也表明,安全制动机制正从偶发的事故应急演变为前沿大语言模型的常态化开发流程。在下一代自主系统的构建中,具备在风险显现时及时熔断、回滚乃至弃用模型的能力,其重要性已不亚于提升模型性能本身。

标签:OpenAIAI 智能体模型对齐强化学习

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的
置顶

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板
置顶

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误
置顶

把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误

//

24小时热榜

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的
TOP1

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的

特朗普周二举行白宫 AI 峰会,集结扎克伯格与黄仁勋
TOP2

特朗普周二举行白宫 AI 峰会,集结扎克伯格与黄仁勋

3

比亚迪确认首款全固态电池车型2027年推出

6小时前
比亚迪确认首款全固态电池车型2027年推出
4

工业外骨骼迎来落地潮:人机协同走向普及

16小时前
工业外骨骼迎来落地潮:人机协同走向普及
5

众筹超167倍,Lofree机械键盘如何逆势高端突围

2小时前
众筹超167倍,Lofree机械键盘如何逆势高端突围
6

豆包AI手机遭《王者荣耀》封号,智能体与风控冲突爆发

2小时前
豆包AI手机遭《王者荣耀》封号,智能体与风控冲突爆发
7

OpenAI与黑石组建新联盟 反对数据中心建设禁令

6小时前
OpenAI与黑石组建新联盟 反对数据中心建设禁令
8

NASA预订最多5次波音星际客机载人任务

6小时前
NASA预订最多5次波音星际客机载人任务
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断