Google DeepMind 发布 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,专为快速发现、验证和修复软件漏洞设计。该模型成本低、速度快,已在 Google 内部代码库中应用,并通过有限访问试点计划向政府和合作伙伴开放。
Google 多年来持续投资网络安全,致力于自动化漏洞发现以保护全球代码库。其代码安全智能体 CodeMender 已能自动发现并修复关键软件漏洞。然而,当 AI 智能体发现漏洞的速度超过防御者修复的速度时,应对这一全球威胁就需要一种高能力、低成本且可扩展的方案。
今日,Google 扩展了其长期努力,推出 Gemini 3.5 Flash Cyber——一款基于 3.5 Flash 微调的轻量级网络安全模型。该模型专门用于高效发现、验证和修补漏洞,在这些任务上表现优于原版 3.5 Flash 模型。
Flash 的性能和效率使其成为网络安全模型理想的基座。基于 Flash 构建,3.5 Flash Cyber 提供了成本效益高且能力强的替代方案,取代了昂贵的大型网络安全模型。
鉴于该技术的双重用途性质,Google 采取审慎部署策略。作为有限访问试点计划的一部分,3.5 Flash Cyber 将首先通过 CodeMender 独家提供给政府和可信合作伙伴,并逐步扩大范围。这能让一线防御者率先发现和修复关键漏洞,同时降低被滥用的风险。
此外,Google 还通过 Gemini Enterprise Agent Platform 将 CodeMender 的基础能力直接提供给客户,支持通用 Gemini 模型。
发现深层缺陷需要探索巨大的执行搜索空间。依赖单次昂贵的巨大模型调用可能形成瓶颈。3.5 Flash Cyber 特别适合在智能体扫描大型代码库并分析大量代码路径时发现漏洞。
CodeMender 会多次调用 3.5 Flash Cyber,使智能体能够分析远更多的代码路径以发现和验证漏洞。子智能体随后生成一份高质量的最终报告。
凭借其速度和成本优势,3.5 Flash Cyber 可轻松集成到频繁扫描、时间敏感的发布流程或大规模提交扫描管线中。
我们在多个基准测试上评估了 3.5 Flash Cyber。在 CyberGym 基准测试中(该测试评估 AI 智能体应对数百个真实软件漏洞的能力),通过配置 CodeMender 调用 3.5 Flash Cyber 最多五次并生成一份最终报告,整体智能体取得了与显著更大模型相当的竞争性能。
注:竞争对手结果来自提供商自报分数。
我们还在去除安全护栏的情况下,对模型能力进行了压力测试。Google 的 Big Sleep 团队独立构建了一个评估,专注于在 Chrome、Safari 等复杂代码库中寻找关键且难以发现的漏洞。在此评估中,3.5 Flash Cyber 显著超越了主流的 3.5 Flash 和 3.6 Flash。
3.5 Flash Cyber 还在 Google Chrome 的生产提交扫描管线中接受了评估。这些漏洞未公开披露,确保基准测试对 Gemini 及竞品模型均无污染。
结果显示,3.5 Flash Cyber 相比 3.5 Flash 有显著提升。注意:Opus 4.6 之后较新的竞品模型版本因内置安全护栏而拒接执行任务,因此未显示。
此外,3.5 Flash Cyber 发现独特漏洞的数量始终高于主流的 3.5 Flash 和 Claude Opus 4.6。在高度复杂的 V8 JavaScript 引擎上,通过固定次数的调用测试,3.5 Flash Cyber 发现了 55 个经确认的独特问题,而主流 3.5 Flash 发现 47 个,Opus 4.6 发现 36 个——其中包括 10 个其他两个模型未检测到的问题。
基础网络安全模型容易陷入循环,反复发现同一问题而遗漏关键漏洞。而一个强大的模型能撒更广的网,发现更多独特问题。
随着调用次数的增加,3.5 Flash Cyber 持续发现新的代码路径和漏洞。
基准测试只是故事的一部分。搭载 3.5 Flash Cyber 的 CodeMender 已在 Google 内部代码库中用于发现并修复漏洞,包括 Chrome、Android、Cloud、Ads 和 YouTube。
轻量级模型带来的发现速度已产生可衡量的影响。
例如,Google Cloud 漏洞研究团队使用 3.5 Flash Cyber 在创纪录的时间内主动保护系统。仅用 2 小时,该模型就发现了公共 API 中的远程代码执行漏洞,以及敏感生产服务中的一个内存损坏漏洞。随后,它生成了 100% 可靠的远程代码执行漏洞利用代码,绕过了地址空间布局随机化(ASLR)和写异或执行(W^X)等标准缓解技术。
来自 Wiz 和 Cloud CISO 安全工程测试员的早期反馈证实,3.5 Flash Cyber 相比主流 3.5 Flash 模型有显著的能力提升。
Google 在软件安全领域的领导地位提供了独特优势。例如,OSV.dev(一个由 Google 运营的漏洞数据库,覆盖超过 70 万个开源漏洞)以及超过 10 年的 OSS-Fuzz 结果,帮助 Google 识别最高质量的漏洞。
这使得 Google 能够超越合成网络安全示例,教导模型学习真实安全专业人员的工作方式。模型学会操作行业标准工具,阅读 Chromium 等大型项目中的数百万行代码,并独立处理需要数小时持续深入分析的复杂安全任务。
通过以 3.5 Flash Cyber 驱动 CodeMender,Google 提供了一种高能力、可扩展且经济高效的架构,旨在帮助更多防御者保护软件安全。
原文链接:Google DeepMind
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断