距离上代发布仅三周,谷歌再次上线 Gemini 3.8 Flash,连续推出三款 Flash 模型。新模型主打代码和智能体能力,价格与上代持平,试图用高频迭代与半价策略抢占智能体时代的企业工作流市场。
9月初,距离 Gemini 3.7 Flash 发布仅三周,谷歌又上线了 Gemini 3.8 Flash。这已经是短期内谷歌连续推出的第三款 Flash 系列模型,更新节奏也从过去的季度、半年,被压缩到了“周”的尺度。
Gemini 3.8 Flash 的成绩单相当漂亮:在 LMArena 榜单空降 Agent 榜第 14 名,险胜 DeepSeek-V4-Pro;在 HLE-Verified 等极端测试中拿到 54.9%,API 定价则与 3.7 版本保持一致,延续“半价”策略。DeepMind 内部甚至认为,这是快速顺序迭代(RSI)的一次巨大进步。
但这次更新更像是一次精准卡位。3.8 Flash 把技能点几乎全押在代码与智能体能力上。在 DeepSWE v1.1 测试中,它可以端到端完成复杂工程问题,分数超过了不少大参数模型。谷歌还准备了仅通过 Fairwind 计划向受信防御者开放的 Cyber 版——3.8 Flash Cyber,在内部代码库测试中漏洞挖掘成功率超过 70%,产出的正确补丁数量是竞品的 2.6 倍。输出速度更是目前市面上最快,几乎是第二名 Meta 的两倍。
高频迭代背后,Google DeepMind 刚刚完成一轮权力交接:偏科研的 Demis Hassabis 退居二线,负责商业落地与对外合作的 Koray Kavukcuoglu 走上前台,多位创始元老则相继离开。权力重心从“实验室”转向“商业场”。
这也直接改变了模型的评价标准。过去大家比 Token 单价、比智商跑分,现在则要回答一个更实际的问题:智能体能不能把任务做完、做完一个任务要花多少钱。有意思的是,谷歌选择了一条和 OpenAI、Anthropic 相反的路线:后两者追求尽可能少的步骤完成任务,Gemini 3.8 Flash 却选择在底层机制里增加更多循环,反复调用工具、增加多步规划,用步骤数量弥补单次推理的不足。
新帅 Koray Kavukcuoglu 算的是另一笔账:旗舰 3.5 Pro 还没有形成断层式领先,那就先用一个胜任多数生产任务的 Flash 模型配合更低的试错成本,让开发者大规模接入 Google Cloud、Workspace 等企业基础设施。一旦模型嵌进业务流程,重构带来的高成本就会成为谷歌的护城河。
这套“大力出奇迹”的打法并非没有隐忧。3.8 Flash 的单价没涨,但在高难度档位下,多轮循环试错意味着成倍的 Token 消耗。如果任务指令模糊,程序卡在工具调用死循环里,最终的单任务总成本可能比直接调用旗舰模型还要贵。
更麻烦的是底层能力的代差。有开发者指出,3.8 Flash 在刚更新的 Terminal-bench 4.0 等新测试中表现挣扎,过去的高分多少有些“刷榜”成分。一旦考题偏离训练时的套路,基础智能的短板就会被放大。
外围的围剿也没停。就在谷歌发布当天,Meta 拿出目标直指 Claude Opus 的高阶模型 Muse Spark 1.3,智能体与代码能力大幅提升,看起来颇有直接叫板的意思。谷歌当前的处境,也反映出一个更本质的问题:旗舰模型迟迟缺席,上层能力没有兜底,只能靠中低端产品频繁换挡维持存在感。
不管怎样,Flash 的密集发布把大模型推向了一个新阶段:分层路由(Model Routing)。单一大模型通吃所有任务的时代已经结束,未来的企业 AI 架构很可能呈现两极分化——GPT-5、Claude Opus 这类旗舰模型负责复杂决策与深层推理,而 Gemini Flash 这类轻量模型承担高频流水线作业。
对真正要用模型做事的企业来说,关键不是选一个跑分最高的模型,而是算清楚端到端的真实投入产出比。在享受低价红利的同时,也要对耗时、重试率做压力测试,保持架构弹性,避免和单一 API 深度绑死。大模型下半场,拼的并不是谁的实验室分数更高,而是谁能用更优的结构效率,真正把任务做完。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断