谷歌DeepMind发布Gemini 3.7 Flash,这是Flash系列中面向编程和AI智能体任务的最强主力模型。它较3.6 Flash在代码生成、Web开发和文档理解上显著提升,入门价格仅为前代一半,并同步升级Gemini Spark个人智能体。
今天,谷歌DeepMind发布 Gemini 3.7 Flash,这是 Flash 系列中最智能的主力模型,面向编程和 AI 智能体任务。距离 Gemini 3.6 Flash 发布仅三周,这次更新直接源自开发者反馈和算法创新。3.7 Flash 在软件工程、知识工作和 Web 开发工作流上带来显著提升,每百万 Token 的入门价格仅为 3.6 Flash 初始定价的一半。
3.7 Flash 在调试和问题解决等编程任务上较 3.6 Flash 大幅提升,首次通过代码准确率更高,生成生产级代码的能力也更出色。在 FrontierCode 1.1 Main 上得分 43.6%(前代 34.4%),在 DeepSWE v1.1 上得分 65.3%(前代 49.0%)。


Web 开发方面,3.7 Flash 能用更少的提示词生成更实用的布局和功能完整的应用。UI 生成时,它能以截图、图像或完整设计系统为参考,高度遵循设计并保持一致性。在 Arena.ai 的 WebDev Arena 排行榜上,Elo 评分从 1538 升至 1588。

在金融、法律、生物科学等知识密集型领域,3.7 Flash 的推理和准确性均有改善。在用于测试复杂文档处理能力的 GDP.pdf 基准上,得分从 22.0% 提升至 34.0%;在 AutomationBench 基准上,得分从 17.0% 提升至 30.4%,能更有效地完成真实业务流程。


3.7 Flash 相比 3.6 Flash 提供了更出色的开发者体验:它更适应障碍,必要时澄清意图,更严格地遵循指令,并在多步规划和工具调用上投入更多精力。更规范的执行意味着更少的人工监督和重试。
到今年年底,3.7 Flash 的入门价格为每百万输入 Token 0.75 美元、每百万输出 Token 3.75 美元,结合增强的性能,开发者可以低成本高效地扩展生产级智能体。

早期客户反馈突出了 3.7 Flash 的性能和精确度,以低成本实现了大幅优于 3.6 Flash 的结果。以下是部分合作伙伴的评价:












Gemini Spark 是谷歌在 I/O 大会上推出的个人 AI 智能体,可 7×24 小时运行,在用户指示下代为执行操作,现已面向 160多个国家的 Google AI Pro 和 Ultra 订阅者提供。本次模型升级让 Spark 在知识工作上更高效,对 Google Workspace 应用的工具调用能力更强,复杂多技能工作流的准确性和输出质量也得到提升。
借助 3.7 Flash,Gemini Spark 能通过整理文件、起草邮件和更新状态文档,更高效地将想法转化为行动。
谷歌持续改进前沿安全防护的覆盖范围和稳健性。Gemini 3.7 Flash 在化学、生物、放射性和核(CBRN)以及网络攻击领域更新了防滥用防护,同时支持有益用例,符合谷歌在生物韧性和网络安全项目方面的方针。
更多信息请参阅 3.7 Flash 模型卡。

原文链接:Google DeepMind
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断