Google DeepMind发布三款新Gemini模型:3.6 Flash提升编码和知识工作效率,减少17%输出token消耗;3.5 Flash-Lite速度最快,性价比出色;3.5 Flash Cyber专攻网络安全,结合CodeMender智能体。新模型旨在帮助开发者大规模构建AI智能体,同时降低成本和延迟。

开发者和客户在构建生产级AI智能体时,需要更高的token效率、更低的延迟和更可靠的性能。Flash系列模型正是为此而生,在效率与质量之间取得平衡,从而支持智能体工作流的规模化。在Gemini 3.5 Flash的基础上,Google DeepMind推出了三款新模型:
此外,Gemini 3.5 Pro目前正在与合作伙伴进行测试,一旦准备就绪将广泛提供。同时,团队已开始下一代模型Gemini 4的预训练,这是迄今为止最雄心勃勃的一次,进展令人振奋。
Gemini 3.6 Flash直接基于开发者和客户对3.5 Flash的反馈构建。它不仅在编码和知识工作方面实现质的飞跃,还显著提升了token效率。根据人工分析指数数据,3.6 Flash比3.5 Flash少消耗17%的输出token,完成多步骤工作流所需的推理步骤和工具调用也更少。
这种高效性还伴随着更低的价格:输入每百万token 1.50美元,输出每百万token 7.50美元,比3.5 Flash更便宜,降低了每项智能体任务的总成本,使智能体的构建和运行更具性价比。
即使效率更高,3.6 Flash在多个用例上仍保持了性能提升:
3.6 Flash配备了增强的前沿安全框架防护,涵盖化学、生物、放射性和核(CBRN)以及网络攻击领域,使模型更难被越狱,同时对有益用途的拒绝降至最低。更多信息请参见3.6 Flash模型卡。
3.5 Flash-Lite专为低延迟任务和高吞吐量任务(如智能体搜索和文档处理)而设计。它是3.5系列中速度最快的模型,根据Artificial Analysis测量,每秒可输出350个token。定价为输入每百万token 0.30美元,输出每百万token 2.50美元,质量远超3.1 Flash-Lite,为高吞吐量生产流量的开发者和客户提供了强大的性价比。
3.5 Flash-Lite能够以比3.5 Flash更低的延迟执行高容量任务,并能高效扩展智能体系统。在各个推理级别上,它显著优于3.1 Flash-Lite;开发者可根据工作负载配置模型,在低推理级别优先低延迟低成本,或使用高推理级别处理多步骤子智能体工作负载。该模型还内置了计算机使用工具,以可靠支持智能体任务。
在编码和智能体任务方面,Terminal-Bench 2.1得分从31%提升至54%;长上下文方面,GDM-MRCR v2从60.1%提升至72.2%;真实世界任务执行方面,GDPval-AA v2从642提升至1140。事实上,在许多评估中,3.5 Flash-Lite甚至超越了3 Flash,包括SWE-Bench Pro(54.2% vs 49.6%)和OSWorld-Verified(74.0% vs 65.1%),是替代2.5 Flash和3 Flash的更快、更优选择。
AI模型已能比当前系统修复漏洞更快地发现安全漏洞。应对这一威胁需要高效且能力强大的软件安全方法。Gemini 3.5 Flash Cyber基于3.5 Flash构建,经过微调,能以比大型模型更低的每token价格发现和修复网络安全漏洞。在CodeMender中,多个3.5 Flash Cyber智能体协同工作生成综合报告,在热门基准测试CyberGym上达到前沿竞争力。
鉴于该技术的双重用途性质,部署策略十分谨慎。该模型将很快通过CodeMender(CodeMender)以有限访问试点计划形式,独家提供给政府和受信任合作伙伴,使一线防御者在关键漏洞被利用之前发现并修复,同时降低误用风险。
3.6 Flash和3.5 Flash-Lite即日起可用:
欢迎开发者在使用3.6 Flash和3.5 Flash-Lite构建时提供反馈,以帮助改进未来Gemini模型。3.5 Pro也即将到来。
原文链接:Google DeepMind
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断