Anthropic 与 Google 近期未发公告便将下一代旗舰模型接入生产环境与盲测平台。灰度上线与静默路由正取代传统发布会,成为大模型厂商平衡算力成本、规避舆论与监管风险的新战术。
没有聚光灯,也没有发布会。但过去两周的硅谷 AI 圈,比以往任何一场发布会都要喧闹。

Anthropic 静悄悄地将两个未经命名的模型接入了生产环境;Google 为其下一代旗舰沿用旧版本号,低调投放到第三方盲测平台;OpenAI 在推出 Astra 后也选择保持沉默。三家科技巨头均未按惯例为下一代模型筹办发布会,多数用户甚至没有意识到,自己日常的交互请求已经在为这些未公开的旗舰模型提供测试样本。
9 月 17 日晚,Anthropic 突然切断了灰度测试通道,一批此前被路由至新模型的账号直接归零,在开发者社区引发热烈讨论。一天后通道重新恢复,覆盖范围更从 Claude Code 进一步扩大至 Chat 和 Cowork 模块。
与此同时,Google 也露出了蛛丝马迹。在第三方盲测平台 Arena 上,出现了一个代号为 gemini-3.8-flash 的不起眼模型。然而抽中该模型的开发者很快察觉到异常:它生成的复杂矢量图耗时整整十分钟并吐出数千行代码,搭建的三维体素宝塔甚至能在浏览器中实时渲染与旋转——这绝非轻量级 Flash 模型所具备的能力。社区迅速推断,这是 Google 代号为 Argon 的下一代旗舰 Gemini 4 Pro。被业内识破后,该模型的测试标签被紧急更改为 gemini-3.7-flash。
更早几天,开发者在抓取 Claude Code 接口时发现,前端界面虽标注调用 Opus 5,但后端模型标识已直接指向 5.2 版本。伴随 Fable 5.2 灰度测试的展开,原本发往 5.1 的请求被后台静默路由至新模型。没有模型文档,没有独立的 API 标识,也没有任何定价调整,官方自始至终未作说明。
面对激烈的竞争,各家打法各有侧重:Anthropic 偏好后端无感路由,前端维持旧称;Google 选择在竞技场盲测中套用旧型号马甲;OpenAI 则在 Astra 问世后转入观望。
这种策略带给厂商的收益非常务实:新模型无需正式定名,便能在真实的生产负载下跑出海量评估数据。一旦出现重大 Bug 或幻觉问题,工程团队可以迅速在服务端回滚,而不必背负公开发布失败的巨大舆论风险。
正式发布一款前沿模型,需要提前储备巨额算力来应对瞬间爆发的访问洪峰。以 GPT-6 Astra 为例,其调用了德州 Stargate 基地超过 10 万张 GPU 完成训练,上线初期 API 成本陡增。而采用动态灰度路由,算力分配更为平缓:厂商能精准把控流入新模型的请求配比,在验证稳定性与真实表现的过程中按需加码。
此外,合规容错也是核心考量。今年早些时候,Anthropic 曾在全量发布 Fable 5 与 Mythos 5 后遭遇监管政策突变,因无法及时核验用户身份而被迫紧急全球下架。这次经历让团队在后续发布中变得极其谨慎,更倾向于采用小步快跑、逐步释放的静默策略。口碑效益同样显著——即便官方不发一言,当社区里自发形成“模型能力变强了”的共识时,自然传播已然达成。
在 Opus 5.2 浮出水面的前两天,Anthropic 首席执行官 Dario Amodei 曾发表长文,呼吁全行业主动放慢前沿模型的迭代节奏,以便让安全对齐研究跟上技术扩张的步伐。马斯克与 OpenAI 首席执行官 Sam Altman 随后表态支持,Altman 甚至直言 OpenAI 年内不会寻求上市。消息传出后,市场对算力扩张节奏产生担忧,全球 AI 硬件产业链市值曾一度剧烈震荡。
但在放慢脚步的表象之下,暗流从未停息:
近期还有开发者声称高推理档位下的 Fable 5.2 全面压制了 GPT-6 Astra。但业内基准评测往往存在环境差异:此前 OpenAI 官方宣称 Astra 在 ARC-AGI-3 拿到 99.9% 的高分,换用行业标准测试框架后得分则降至 62.7%。这种测试标尺的摇摆,促使厂商更加依赖生产环境里的盲测与灰度反馈,而非单一的跑分榜单。
目前,Opus 5.2 与 Gemini 4 Pro 均未正式发布模型卡和独立定价。传统盛大的 AI 发布会正在退场,前沿大模型的竞争,已悄然转移至无声的生产流量分发与动态灰度博弈之中。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断