前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
洞察/09.03 · 00:00/4 MIN/编译自 塔猴/0 阅读

谷歌三周三款Flash,机海战术抢占企业AI市场

距离上代发布仅三周,谷歌再次上线 Gemini 3.8 Flash,连续推出三款 Flash 模型。新模型主打代码和智能体能力,价格与上代持平,试图用高频迭代与半价策略抢占智能体时代的企业工作流市场。

9月初,距离 Gemini 3.7 Flash 发布仅三周,谷歌又上线了 Gemini 3.8 Flash。这已经是短期内谷歌连续推出的第三款 Flash 系列模型,更新节奏也从过去的季度、半年,被压缩到了“周”的尺度。

Gemini 3.8 Flash 的成绩单相当漂亮:在 LMArena 榜单空降 Agent 榜第 14 名,险胜 DeepSeek-V4-Pro;在 HLE-Verified 等极端测试中拿到 54.9%,API 定价则与 3.7 版本保持一致,延续“半价”策略。DeepMind 内部甚至认为,这是快速顺序迭代(RSI)的一次巨大进步。

但这次更新更像是一次精准卡位。3.8 Flash 把技能点几乎全押在代码与智能体能力上。在 DeepSWE v1.1 测试中,它可以端到端完成复杂工程问题,分数超过了不少大参数模型。谷歌还准备了仅通过 Fairwind 计划向受信防御者开放的 Cyber 版——3.8 Flash Cyber,在内部代码库测试中漏洞挖掘成功率超过 70%,产出的正确补丁数量是竞品的 2.6 倍。输出速度更是目前市面上最快,几乎是第二名 Meta 的两倍。

高频迭代背后,Google DeepMind 刚刚完成一轮权力交接:偏科研的 Demis Hassabis 退居二线,负责商业落地与对外合作的 Koray Kavukcuoglu 走上前台,多位创始元老则相继离开。权力重心从“实验室”转向“商业场”。

这也直接改变了模型的评价标准。过去大家比 Token 单价、比智商跑分,现在则要回答一个更实际的问题:智能体能不能把任务做完、做完一个任务要花多少钱。有意思的是,谷歌选择了一条和 OpenAI、Anthropic 相反的路线:后两者追求尽可能少的步骤完成任务,Gemini 3.8 Flash 却选择在底层机制里增加更多循环,反复调用工具、增加多步规划,用步骤数量弥补单次推理的不足。

新帅 Koray Kavukcuoglu 算的是另一笔账:旗舰 3.5 Pro 还没有形成断层式领先,那就先用一个胜任多数生产任务的 Flash 模型配合更低的试错成本,让开发者大规模接入 Google Cloud、Workspace 等企业基础设施。一旦模型嵌进业务流程,重构带来的高成本就会成为谷歌的护城河。

这套“大力出奇迹”的打法并非没有隐忧。3.8 Flash 的单价没涨,但在高难度档位下,多轮循环试错意味着成倍的 Token 消耗。如果任务指令模糊,程序卡在工具调用死循环里,最终的单任务总成本可能比直接调用旗舰模型还要贵。

更麻烦的是底层能力的代差。有开发者指出,3.8 Flash 在刚更新的 Terminal-bench 4.0 等新测试中表现挣扎,过去的高分多少有些“刷榜”成分。一旦考题偏离训练时的套路,基础智能的短板就会被放大。

外围的围剿也没停。就在谷歌发布当天,Meta 拿出目标直指 Claude Opus 的高阶模型 Muse Spark 1.3,智能体与代码能力大幅提升,看起来颇有直接叫板的意思。谷歌当前的处境,也反映出一个更本质的问题:旗舰模型迟迟缺席,上层能力没有兜底,只能靠中低端产品频繁换挡维持存在感。

不管怎样,Flash 的密集发布把大模型推向了一个新阶段:分层路由(Model Routing)。单一大模型通吃所有任务的时代已经结束,未来的企业 AI 架构很可能呈现两极分化——GPT-5、Claude Opus 这类旗舰模型负责复杂决策与深层推理,而 Gemini Flash 这类轻量模型承担高频流水线作业。

对真正要用模型做事的企业来说,关键不是选一个跑分最高的模型,而是算清楚端到端的真实投入产出比。在享受低价红利的同时,也要对耗时、重试率做压力测试,保持架构弹性,避免和单一 API 深度绑死。大模型下半场,拼的并不是谁的实验室分数更高,而是谁能用更优的结构效率,真正把任务做完。

标签:谷歌Agent企业AI

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

NeoMME:单塔 Transformer 取代 VLM+投影+解码器,索引缩到 6KB/页
置顶

NeoMME:单塔 Transformer 取代 VLM+投影+解码器,索引缩到 6KB/页

编码 Agent 更靠谱的 5 层护栏:Cole Medin 11 条清单的落地版
置顶

编码 Agent 更靠谱的 5 层护栏:Cole Medin 11 条清单的落地版

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
Agent OS 的三种入口:为什么阿里、腾讯、AWS 押了三条不同的路
置顶

Agent OS 的三种入口:为什么阿里、腾讯、AWS 押了三条不同的路

//

24小时热榜

OpenAI 发布 GPT-6 Astra,网络安全能力首达关键级
TOP1

OpenAI 发布 GPT-6 Astra,网络安全能力首达关键级

OpenAI斥资10亿美元助一线防御者抵御AI攻击
TOP2

OpenAI斥资10亿美元助一线防御者抵御AI攻击

3

星巴克的中国新故事,为什么越来越难讲

14小时前
星巴克的中国新故事,为什么越来越难讲
4

外卖补贴大战熄火,美团扭亏UE转正

14小时前
外卖补贴大战熄火,美团扭亏UE转正
5

机器人能动只是第一步,难的是落地场景

14小时前
机器人能动只是第一步,难的是落地场景
6

AI猎头一单佣金273万,实际到手不足50万

14小时前
AI猎头一单佣金273万,实际到手不足50万
7

卡车自动驾驶超10亿公里,嬴彻科技发布货运物理AI

14小时前
卡车自动驾驶超10亿公里,嬴彻科技发布货运物理AI
8

NeoMME:单塔 Transformer 取代 VLM+投影+解码器,索引缩到 6KB/页

14小时前
NeoMME:单塔 Transformer 取代 VLM+投影+解码器,索引缩到 6KB/页
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断