Gemini 3.8 Flash 正式发布。新版本在保持与 3.7 Flash 相同速度和成本的同时,显著提升了编程与推理能力;面向网络安全的 Flash Cyber 版本漏洞发现成功率超过 70%,并通过 Fairwind Program 向受信防御者开放。
Google DeepMind 今日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。这是 Flash 系列六周内第三次更新,距离上一代 3.7 Flash 发布约三周。官方表示,新模型在保持与 3.7 Flash 相同速度和低成本的同时,带来了 Flash 系列迄今最强的编程与推理能力。
Gemini 3.8 包含两个版本:
两个版本面向不同部署场景设计,但共享同一基础智能,并借助旨在递归评估和优化底层模型的长时间运行智能体循环进一步加速。官方表示,显著的编程与推理收益来自多项创新,其中包括在要求极高的网络安全领域展开严格训练。
与 3.7 Flash 相比,3.8 Flash 的提升非常明显,性能往往接近成本更高的前沿模型。

在 DeepSWE v1.1(长周期软件工程)评测中,3.8 Flash 能以极低成本自主端到端解决复杂工程问题,表现超过多数规模更大的前沿模型。

在金融、法律等需要高级分析与报告的专业领域,3.8 Flash 也展现出关键企业场景所需的可靠性。它在 Vals Finance Agent V2 与 Harvey 法律智能体基准 上均超过 3.7 Flash 和其他前沿模型;在 HLE-Verified 上取得 54.9% 的得分,说明其多步推理能力覆盖 STEM、人文与专业领域。
性能提升源自一个核心设计选择:3.8 Flash 更愿意下功夫。面对复杂任务时,它会额外执行推理步骤、反复调用工具,处理过程更加细致;在较高强度档位下,模型有时会消耗更多 token 来换取更好表现。如果算力效率是主要约束,开发者可以调低强度档位以减少 token 开销,或继续使用仍受完整支持的 3.7 Flash 处理效率优先的工作负载。
Gemini 3.8 Flash Cyber 通过 Fairwind Program 向受信防御者提供,以 Flash 级别的速度与成本支持快速迭代,在复杂安全环境中形成决定性优势。
在行业标准漏洞发现基准 CyberGym 上,Gemini 3.8 Flash Cyber 的自主漏洞发现能力达到前沿水平,超过 3.5 Flash Cyber,也超过参数量大得多的前沿模型。

CyberGym 主要覆盖 C/C++ 代码,而真实防御需求远不止于此。Google 还用内部综合基准做了补充验证,要求模型在横跨 20 种编程语言的复杂代码库中发现多种漏洞。结果显示,Gemini 3.8 Flash Cyber 的成功率超过 70%,相比前代显著提升。

为了让防御者获得优于攻击者的能力,Google DeepMind 从研发之初就把漏洞修复放在优先位置,而不是强化漏洞利用等攻击性能力。在 Collinear 运营的 CWE-Bench 外部基准上,Gemini 3.8 Flash Cyber 处于帕累托前沿:Pass@1 达到 47.2%,而领先的前沿模型为 47.8%,但前者的成本明显更低。

Gemini 3.8 Flash Cyber 已经在保护 Google 的代码:
Gemini 3.8 Flash 遵循 ,针对化学、生物、放射与核(CBRN)及网络攻击等滥用场景内置防护,同时保留有益用例。Gemini 3.8 Flash Cyber 针对网络安全采用较宽松的缓解措施,因此只提供给需要更完整网络能力的受信防御者。
免费获取企业 AI 成熟度诊断报告,发现转型机会
以 Gray Swan 基准衡量,Gemini 3.8 系列还在提示词注入鲁棒性上实现明显飞跃,能帮助用户免受提示注入类攻击。

关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断