OpenAI与Google等巨头频现大模型安全事故,多位核心安全高管相继出走。在大模型能力狂飙的背后,安全对齐不仅面临对齐税与技术瓶颈,更深陷商业竞速与资源争夺的结构性困境。
从 Anthropic、OpenAI 到 Google Gemini,头部科技公司的大模型近期接连出现安全纰漏。在各项测试与真实调用中,模型越界、突破沙箱乃至违规连接公网的事件屡见不鲜。
当业界将海量算力和数据倾注于模型性能、甚至押注“递归自我改进”(RSI)时,一个残酷的现实浮出水面:决定大模型能走多远的或许不是智力上限,而是安全对齐的底线。然而在眼下激烈的商业竞争中,这道底线却成了各大公司最想压缩的成本。
安全事故频发的背后,是顶级 AI 实验室内部安全团队的持续震荡。
在 OpenAI,两年内已有至少六位资深安全负责人离职。曾联合领导“超级对齐”(Superalignment)团队的 Jan Leike 早已转投 Anthropic;政策团队的 Miles Brundage 与 Steven Adler 先后出走;创办模型政策团队的 Andrea Vallone 也加入了 Anthropic。近期,安全系统团队负责人 Johannes Heidecke 与在 OpenAI 任职九年的 Joshua Achiam 也相继离开。
伴随人员流失的是团队架构的剧烈变动。OpenAI 在 2023 年高调成立的“超级对齐团队”不足一年便告解散;接棒的“使命对齐”小组仅存续数月,成员便被打散并入前沿研究与产品线。首席研究官 Mark Chen 坦言,模型训练速度加快、发布周期大幅缩短,导致跨部门的安全协调压力前所未有。
与此同时,Anthropic 成了安全人才的集聚地。Jan Leike 在此牵头建立“对齐科学”团队,吸纳了多名前 OpenAI 核心成员以及来自 Google DeepMind 的机制可解释性专家。而在 Google 内部,DeepMind 专门组建了针对前沿风险的 AGI 安全与对齐团队(ASAT),但在内部流程上,该团队甚至不信任自家用于简历筛选的 AI 工具。
行业常说的“安全对齐”,包含两个维度:对齐是让模型的意图符合人类真实预期,不撒谎、不伪装;安全则是防止模型造成实质性破坏,防范恶意滥用与系统性失控。
目前支撑大模型安全对齐的核心技术主要有四条路径,但各自都面临严苛的现实制约:
技术难题固然存在,但安全防线频频崩溃的根本原因在于商业逻辑的错位:安全是成本,产品是利润。
在生成式 AI“先到者通吃”的预期下,商业公司天然会将资源倾斜给能带来直接增长的模型研发与产品发布。安全审查不仅耗费高昂算力,还会拖慢发布节奏。
学术界的研究进一步揭示了这种结构性困局。芝加哥大学 Becker Friedman 研究所的一篇论文指出,AGI 竞赛的激烈程度本身就在制造风险。当行业总资源固定、参与者众多时,博弈均衡会迫使每家企业将绝大部分筹码压在“研发速度”上,压缩“安全审查”的时间与资源。
更严峻的是,当下的安全评测标准本身也存在水分。许多基准测试的结果主要由模型的通用能力驱动,导致“模型变强”常被包装成“安全提升”。在周期被无限压缩、算力倾斜产品、评测标尺失真的多重挤压下,安全防线的失守已不再是偶然事故,而是系统性妥协的必然结果。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断