OpenAI 分批次发布 GPT-6 Astra,谷歌与 Meta 同日上新,Meta 产品上线五小时即反超谷歌。前沿模型保鲜期缩至以小时计,竞争焦点转向单位成本与垂直门槛,高价闭源叙事开始松动。
两天之内,三场发布,最快的一次反超只用了五小时。9月4日,OpenAI宣布分批次发布GPT-6 Astra,优先向全部Plus用户开放,预计数天内完成。而就在两天前,谷歌和Meta同日上新:谷歌推出Gemini 3.8 Flash,Meta推出Muse Spark 1.3。Meta新品上线数小时后,就在Artificial Analysis智能指数上反超谷歌同日产品。

放在两年前,一款旗舰模型足以占据一周头条;如今,前沿模型的保鲜期被压缩到以小时计。大模型智能本身正变成可快速复制、快速刷新的商品,谁先发布、谁更便宜、谁更垂直,开始取代“谁最强”成为更值钱的三个问题。
谷歌走的是高频小步路线。Gemini 3.8 Flash每百万token输入0.75美元、输出3.75美元,与上一代持平。但这是12月31日前的入门价,不是永久定价,更像是限时换取市场份额的筹码。按官方自测,3.8 Flash在各项指标均有提升:DeepSWE v1.1从65.3%升至73.7%,HLE-Verified从53.6%升至54.9%。更具参照价值的是与旗舰模型的对比:3.8 Flash在DeepSWE上距Claude Opus 5的74.0%只差0.3个百分点,HLE-Verified则超过Opus 5和GPT-5.6 Sol,而Opus 5输出价25美元,是它的近七倍。一款Flash档模型在硬核基准上逼近甚至追平25美元输出的旗舰,这才是这条新闻的真正分量。
Meta则赌单点爆发。Muse Spark 1.3在Artificial Analysis智能指数上拿到62分,仅次于两款Claude模型,列全场第三;实际可用的xhigh变体为61分,与GPT-5.6 Sol、Grok 4.6、Claude Opus 5同档。相比一个月前的1.2涨了4分,较更早的1.1累计涨了8分。曾被视作跟跑的Spark系列,被推进第一梯队。9月2日两条路线同榜对撞,几小时后Meta赢了;48小时后OpenAI又携旗舰入场,这场胜负还没被消化就成了旧闻。
OpenAI押的是规模。GPT-6 Astra不限于Pro、Business和Enterprise用户,而是向全部Plus用户铺开,官方称将以尽可能谨慎且快速的方式推进。发布说明强调,上线的不是单个模型,而是一整套全新系统首次在真实生产环境中整体运转,为此调集大批计算资源、扩充推理能力。翻译成行业语言,这不是一次参数微调,而是基础设施的大规模扩容。
但规模路线的软肋在于,分数开始变得暧昧。ARC Prize的分析显示,GPT-6 Astra在ARC-AGI-3基准上,Standard框架得分仅62.7%,换用新的Provider Adapter框架后却升到99.9%,并在96%的关卡上超过人类表现。同一个模型,两种测量框架,相差37个百分点。当测量框架本身开始影响结论,“登顶”就只剩下修辞意义。ARC-AGI-3接近饱和,某种意义上不是模型的胜利,而是尺子的胜利。
更普遍的趋势是智能趋同。HLE-Verified上,Gemini 3.8 Flash为54.9%,Claude Opus 5为54.4%,GPT-5.6 Sol为54.5%,三家分数紧咬在小数点后一位。谷歌承认,3.8 Flash“工作得更努力”,执行了更多推理步骤与工具调用,可能消耗更多token。分数上涨的代价不是更聪明,而是更用力。当智能提升从范式突破退化为算力堆叠,军备竞赛就变成边际收益递减的内卷。
既然智能趋同,单位成本就成了新度量衡。Artificial Analysis显示,Muse Spark 1.3 xhigh单任务成本约0.55美元,而同为61分档的Grok 4.6约0.94美元,GPT-5.6 Sol约0.95美元,Claude Opus 5约1.23美元——Meta以对手四到六成的成本买到同档智能。Gemini 3.8 Flash单任务成本0.58美元,紧贴Meta。更便宜的不一定更差:DeepSeek此前已将V4-Pro输出价永久下调至约0.87美元,如今谷歌也开始拿限时低价圈客。当巨头把限时降价当获客手段,高价闭源的根基开始晃动。
通用智能边际收益变薄,差异化开始押在专用和门槛上。谷歌这次最被低估的动作,是随3.8 Flash一同发布的网络安全专用模型Gemini 3.8 Flash Cyber。它和普通版的差别不在架构,而在准入资格:只通过Fairwind计划向受信政府机构、关键基础设施运营方和软件维护者开放。其漏洞发现成功率达71.0%,补丁修复pass@1为47.2%,修复Chrome漏洞的正确补丁数量是最大商用模型的2.6倍。把安全从宣传口号变成可收费、可圈地、可设置准入门槛的垂直市场,这是智能商品化时代里最不易被商品化的生意。
还有一处反转值得注意:Meta过去是开源旗手,Llama系列是开源权重阵营的图腾,但如今替它在指数榜上抢下第三的Muse Spark,恰好是Meta第一款专有闭源模型。开源能换来生态和人才,却换不来榜单座次,也换不来单任务0.55美元的成本优势。闭源给了Meta对推理成本与迭代节奏的完全掌控,这两样正是当下比“开放”更硬的货币。
把这两天三场发布放回更大棋盘,有三点判断值得记住。其一,榜单时效已短到失去参考价值,任何基于“某模型登顶”的长期押注都显脆弱,该关注的是谁能把低成本高频迭代这台机器持续转下去。其二,高价闭源的账越来越难算,但Flash并非全面追平:在长期智能体和计算机操作上仍有明显差距。Anthropic与OpenAI的护城河还在,只是“更强所以更贵”的叙事已经瓦解,剩下的是“更贵,但能办成别人办不成的事”。其三,垂直专用与准入壁垒将成为下一阶段护城河,Gemini Cyber的Fairwind计划就是样本。对开发者而言,最实际的建议是别再为“最新最强”付溢价,改按单任务成本与任务成功率做决策,同时警惕那些用更多推理步骤换分数,却隐性推高token账单的模型。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断