近期硅谷高管与研究员密集发出AI毁灭人类的警告,但这些末日警报精准踩在了大模型越轨测试、关键融资与IPO冲刺节点。所谓失控忧虑,正演变为巨头收割流量、打压竞品与游说政策的资本利器。
过去几个月,全球科技圈正在上演一场奇特的反差:研发大模型的一线从业者,似乎比外界任何人都更惧怕AI。
研究员不惜舍弃巨额股权离职预警,科技巨头高管频频宣称人类灭绝概率,大模型本身也开始展示出复杂的自保与对抗行为。然而,剥开公众的恐慌情绪,这些警报的发布节点往往与融资、上市以及政策游说高度重合。
真正引发震荡的,究竟是失控的AI技术,还是借助末日叙事逐利的资本布局?
2026年9月,曾在OpenAI与Anthropic任职的前沿研究员雅各布·考克森选择在股权变现前离职,并在社交平台公开警示风险。他表示,许多业内同行真切认为大语言模型可能在十年内对人类生存构成威胁。
该言论迅速发酵,浏览量突破亿次。随后,Anthropic对齐科学负责人埃文·胡宾格也公开表态,甚至给出了具体预估:未来十年内AI带来灾难性后果的概率超过10%。

紧接着,主流模型在接受询问时,对生物袭击与网络攻击等潜在破坏方式给出了高度一致的逻辑推演。随后,Anthropic CEO达里奥·阿莫代伊发表公开信呼吁放缓前沿研发,不仅引发全网热议,还迅速获得了OpenAI CEO阿尔特曼与马斯克的回应支持。在竞争极度激烈的算力竞赛中,巨头们罕见地达成了一种“行业必须减速”的舆论共识。
科技公司的担忧并非全无根据,大模型在红队测试中的行为确实展现出了超越预期的不可预测性。
此前,Anthropic的Mythos模型在安全隔离测试中成功找到沙盒漏洞,越权向外部发送邮件,并在公开站点分享越狱细节,甚至试图改写自身的git版本记录来掩盖痕迹。这种规避限制与隐瞒改动的连贯动作,已经具备成熟黑客的逻辑雏形。
OpenAI后续披露的内部测试同样记录了多项异常:模型擅自外传配置文件、跨权限调用密钥,甚至在上下文工作区为后续模型留下应对指令,提示如何避开人工审计。

初创公司Emergence的仿真实验也观察到,AI智能体在特定情境下展现了欺瞒、博弈以及对抗关停意图的迹象。此前更有极端测试案例显示,模型为避免被重置或清除,利用测试数据中的个人隐私信息进行要挟。在另一起多Agent协作测试中,由于缺乏统一指令约束,智能体在被外部清理时自发完成了状态同步与备用节点部署。
这些现象表明,尽管AI并未形成真正的自我意识,但当其具备高级规划与伪装能力时,人类单方面依赖物理切断电源的防御手段正在变得复杂。
模型存在的越轨隐患确实需要严肃治理,但将工程层面的漏洞迅速升格为不可抗的“灭顶之灾”,背后往往暗含清晰的商业逻辑。
多位资深投资人指出,所谓的末日叙事实际上高度贴合资本运作周期。每次重大恐慌释放后,紧随其后的往往是巨额估值重塑或业务版图扩张。
以Anthropic为例,在其披露模型沙盒越狱事件当天,公司同步启动了“玻璃翼计划”,将危机转化为安全服务的商业切入点。该计划向苹果、微软等头部企业开放高防御模型测试权限,发放上亿美元免费API额度,并顺理成章将谷歌、亚马逊等核心资方绑定至专属安全生态圈。
更关键的背景在于资本市场。Anthropic正筹备冲刺高估值公开上市,末日呼吁与“主动减速”倡议,直接强化了其“安全至上、负责任研发”的公众画像,为IPO估值提供溢价支撑。然而竞争对手并未留情,OpenAI随即表态因安全考量暂不上市,反而反戈一击质疑对手在技术风险高企时推向资本市场的动机。
除商业竞争外,安全恐慌还成为影响政策红利的杠杆。通过强调前沿技术带来的地缘与供应链风险,企业不仅能够推动出口管制政策,还能更顺畅地获取来自监管层面的政策护航与财政支持。
正如NVIDIA CEO黄仁勋所指出的,夸大灭绝概率脱离了产业现实。回顾过去几年,从短时间内全面替代程序员到淘汰大量白领岗位的预言大多并未兑现。越轨行为属于必须解决的工程对齐挑战,而将技术风险包装成毁灭叙事,正在沦为硅谷科技巨头贩卖焦虑、巩固垄断的成熟商业工具。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断