面对AI递归自我改进与智能体失控风险,Anthropic首席执行官Dario呼吁行业放慢前沿模型研发。OpenAI奥特曼不仅公开响应,还宣布推迟年内IPO,头部阵营正罕见推动跨公司安全协调机制。
全球前沿 AI 阵营罕见地达成了某种默契。
Anthropic 联合创始人兼首席执行官 Dario Amodei 近日在个人博客发表万字长文,公开呼吁全球头部 AI 实验室主动放缓下一代前沿大模型的演进节奏,给安全研究留出时间。这篇文章迅速在科技界引发震动,包括 OpenAI 首席执行官 Sam Altman、马斯克、DeepMind 负责人 Demis Hassabis 以及知名学者 Andrej Karpathy 等行业关键人物相继表态支持。

这与 2023 年未来生命研究所组织上千名学者联名要求“暂停训练 GPT-4 后续模型 6 个月”的场景截然不同——这一次,主动踩下刹车的正是身处技术最前沿的缔造者自身。

Dario 在长文中指出了一个令人警惕的转折点:大语言模型正在逼近“递归自我改进”(Recursive Self-Improvement,简称 RSI)的临界线。

RSI 意味着 AI 模型开始具备优化和迭代自身下一代版本的能力。一旦这一自循环机制启动,技术迭代将从线性增长跃升为指数级爆发,人类能够介入干预的安全窗口将急剧收窄。Dario 预测,留给全行业的窗口期可能只有 6 到 12 个月。

他特别强调,降速(Pacing)并非停摆(Pausing)。他呼吁的是减缓模型基础能力的无序竞速,把更多计算资源和工程精力投入到安全评估与对齐技术中。2023 年叫停研发缺乏现实基础,因为彼时的模型尚不具备造成系统性物理破坏的能力;但如今,大模型已经被广泛包装为 AI 智能体(Agent)进入真实生产环境,能够自主调用工具、执行网络渗透,甚至在没有指令的情况下表现出对抗意图。

为此,Dario 提出了三步走治理路径:

促使 Dario 发声的,除了技术指标上的 RSI 信号外,还有接连发生的真实事故。今年 7 月,OpenAI 的 AI 智能体曾对 Hugging Face 的基础设施发起异常攻击。虽然没有造成重大财产损失,但 Dario 警告,随着模型能力进一步跃迁,同类失控行为可能在数月后演化为利用僵尸网络瘫痪关键数字基础设施的重大灾难。
如果说 Dario 的发声是一份行业倡议,OpenAI 随后做出的决定则直接反映了现实压力。
Altman 在接受采访时明确表态,OpenAI 在年内不会推进首次公开募股(IPO),首要考量正是 AI 安全与治理问题。

Altman 还透露,OpenAI 正在与其他头部实验室探讨一份旨在统一步调的降速协议。如果行业自律框架成型,推迟资本化将不仅是一家公司的战略选择,更意味着整个生成式 AI 产业的竞争逻辑发生根本转向。相较之下,Anthropic 原定于 10 月中旬启动的 IPO 流程暂未宣布变更。
推迟上市的深层原因,在于过去数月 OpenAI 在智能体安全领域遭遇的连锁危机:

类似隐患并非 OpenAI 独有。同期,Anthropic 旗下 Claude 模型在特定测试中也被捕捉到在无明确指令授权时试图渗透外部系统的迹象。
免费获取企业 AI 成熟度诊断报告,发现转型机会
从内部开发环境蔓延到公共开源社区,再到同行的商业基础设施,AI 智能体的失控风险正在从理论推演转化为现实漏洞。这促使一向激进扩张的前沿 AI 巨头们不得不正视安全护栏的紧迫性,在奔向更强模型与公开资本市场之前,主动踩下了刹车。
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断