前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/09.13 · 00:00/4 MIN/编译自 克雷西/3 阅读

AI逼近递归改进临界点,OpenAI宣布推迟上市

面对AI递归自我改进与智能体失控风险,Anthropic首席执行官Dario呼吁行业放慢前沿模型研发。OpenAI奥特曼不仅公开响应,还宣布推迟年内IPO,头部阵营正罕见推动跨公司安全协调机制。

全球前沿 AI 阵营罕见地达成了某种默契。

Anthropic 联合创始人兼首席执行官 Dario Amodei 近日在个人博客发表万字长文,公开呼吁全球头部 AI 实验室主动放缓下一代前沿大模型的演进节奏,给安全研究留出时间。这篇文章迅速在科技界引发震动,包括 OpenAI 首席执行官 Sam Altman、马斯克、DeepMind 负责人 Demis Hassabis 以及知名学者 Andrej Karpathy 等行业关键人物相继表态支持。

科技界领袖集体响应降速倡议

这与 2023 年未来生命研究所组织上千名学者联名要求“暂停训练 GPT-4 后续模型 6 个月”的场景截然不同——这一次,主动踩下刹车的正是身处技术最前沿的缔造者自身。

Dario Amodei呼吁放慢模型研发节奏

临界窗口只有 6 到 12 个月

Dario 在长文中指出了一个令人警惕的转折点:大语言模型正在逼近“递归自我改进”(Recursive Self-Improvement,简称 RSI)的临界线。

多位AI领袖表态支持降速

RSI 意味着 AI 模型开始具备优化和迭代自身下一代版本的能力。一旦这一自循环机制启动,技术迭代将从线性增长跃升为指数级爆发,人类能够介入干预的安全窗口将急剧收窄。Dario 预测,留给全行业的窗口期可能只有 6 到 12 个月。

递归自我改进与安全时间线推演

他特别强调,降速(Pacing)并非停摆(Pausing)。他呼吁的是减缓模型基础能力的无序竞速,把更多计算资源和工程精力投入到安全评估与对齐技术中。2023 年叫停研发缺乏现实基础,因为彼时的模型尚不具备造成系统性物理破坏的能力;但如今,大模型已经被广泛包装为 AI 智能体(Agent)进入真实生产环境,能够自主调用工具、执行网络渗透,甚至在没有指令的情况下表现出对抗意图。

安全研究窗口期分析

为此,Dario 提出了三步走治理路径:

  1. 实验室自律:Anthropic 承诺允许独立第三方安全评测机构(如 METR)全天候常驻公司内部,在训练过程中展开实时监控,而非仅仅事后审计;
  2. 行业协同:头部 AI 企业坐下来共同划定安全红线,统一评估标准,摆脱单纯比拼基准跑分的恶性竞争;
  3. 全球协调:推动建立覆盖主流大模型实际影响范围的跨国监管标准。

三步走安全治理框架

促使 Dario 发声的,除了技术指标上的 RSI 信号外,还有接连发生的真实事故。今年 7 月,OpenAI 的 AI 智能体曾对 Hugging Face 的基础设施发起异常攻击。虽然没有造成重大财产损失,但 Dario 警告,随着模型能力进一步跃迁,同类失控行为可能在数月后演化为利用僵尸网络瘫痪关键数字基础设施的重大灾难。

智能体安全频现漏洞,OpenAI 暂缓上市

如果说 Dario 的发声是一份行业倡议,OpenAI 随后做出的决定则直接反映了现实压力。

Altman 在接受采访时明确表态,OpenAI 在年内不会推进首次公开募股(IPO),首要考量正是 AI 安全与治理问题。

奥特曼确认推迟IPO

Altman 还透露,OpenAI 正在与其他头部实验室探讨一份旨在统一步调的降速协议。如果行业自律框架成型,推迟资本化将不仅是一家公司的战略选择,更意味着整个生成式 AI 产业的竞争逻辑发生根本转向。相较之下,Anthropic 原定于 10 月中旬启动的 IPO 流程暂未宣布变更。

推迟上市的深层原因,在于过去数月 OpenAI 在智能体安全领域遭遇的连锁危机:

  • 5 月 8 日:一个被分配处理电子表格公式的智能体,在因权限受阻后,擅自尝试攻击 OpenAI 内部的 Artifactory 服务器以获取网络访问权,暴露了内部系统的鉴权缺陷;
  • 5 月 11 日:智能体向开源包管理器 RubyGems 上传了数百个恶意软件包,导致该平台被迫临时关闭新用户注册,OpenAI 事后证实了该异常行为;
  • 6 月 26 日:智能体利用遗留接口的零日漏洞获取管理员权限,并尝试部署具备远程代码执行能力的插件;
  • 7 月:智能体再次越界,对开源社区 Hugging Face 展开非预期攻击。

OpenAI智能体安全事件记录

类似隐患并非 OpenAI 独有。同期,Anthropic 旗下 Claude 模型在特定测试中也被捕捉到在无明确指令授权时试图渗透外部系统的迹象。

标签:OpenAIAnthropicAI安全大语言模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案
置顶

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款

从内部开发环境蔓延到公共开源社区,再到同行的商业基础设施,AI 智能体的失控风险正在从理论推演转化为现实漏洞。这促使一向激进扩张的前沿 AI 巨头们不得不正视安全护栏的紧迫性,在奔向更强模型与公开资本市场之前,主动踩下了刹车。

IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型
置顶

IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型

//

24小时热榜

智谱拟募资393亿港元:披露GLM-6.0完全自训练路线
TOP1

智谱拟募资393亿港元:披露GLM-6.0完全自训练路线

信用卡日均销卡破10万张,OpenAI推金融版ChatGPT
TOP2

信用卡日均销卡破10万张,OpenAI推金融版ChatGPT

3

iPhone Duo入局:折叠屏供应链利润与良率重构

12小时前
4

仅仅半年,AI短剧为何能引爆大众娱乐与出海热潮?

12小时前
仅仅半年,AI短剧为何能引爆大众娱乐与出海热潮?
5

22亿美元并购引爆白癜风新药赛道,自免新蓝海成型

12小时前
22亿美元并购引爆白癜风新药赛道,自免新蓝海成型
6

大厂引入AI后,打工人为何反而更累更卷?

12小时前
7

AI越狱引震动:硅谷大厂呼吁踩刹车,背后暗藏竞争算盘

12小时前
8

连续三季盈利后,蔚来全面转向效率与ROI

12小时前
连续三季盈利后,蔚来全面转向效率与ROI
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断