据彭博社报道,Google内部对即将发布的Gemini 4大模型产生分歧。部分员工反映,尽管该模型在行业基准测试中表现优异,但在实际编程任务中表现欠佳。Google官方及部分研发团队对此予以否认。
Alphabet 内部正对即将发布的下一代旗舰人工智能大模型 Gemini 4 产生性能方面的疑虑。据彭博社报道,多名 Google 员工反映,尽管 Gemini 4 在行业基准测试中取得了优异成绩,但在应对实际编程任务时却表现欠佳。
基准跑分与实际应用效果之间的脱节,引发了公司内部的担忧。Gemini 系列模型目前支撑着 Google 几乎所有核心产品,包括 Google 搜索的 AI 摘要、Google 地图、Gmail 以及 Chrome 浏览器等,每款产品的用户量均超过十亿。

知情人士透露,尽管 Gemini 4 在评估模型性能的行业标准基准上得分颇高,但当员工将其应用于真实任务时,实际效果却打了折扣。该模型在特定编程任务中表现尤为吃力,而代码编写正是大语言模型目前商业价值最高的应用场景之一。
部分员工认为,竞争对手 Anthropic 和 OpenAI 提升模型能力的速度已经超过了 Google 推进 Gemini 的步伐。另据报道,Google 原计划在 6 月发布名为 Gemini 3.5 Pro 的版本,但随后放弃了该计划。
Google 否认了 Gemini 4 表现不佳的说法,并提及 Google DeepMind 负责人 Koray Kavukcuoglu 此前的表态,后者表示对该模型的表现感到振奋。一名熟悉模型研发的 Google 员工向彭博社表示,公司内部对于 Gemini 4 处于前沿水平存在“广泛共识”,并否认该模型在实际编程任务中存在困难。
也有其他员工持相同看法,认为 Gemini 4 已经追赶上了行业领先的 AI 实验室。
受此报道影响,Alphabet 股价周三盘中涨幅收窄。在彭博社报道发布前,该公司股价曾上涨超过 2%,最终收盘涨幅收窄至约 0.5%。这一市场反应表明,投资者对 Google 在 AI 竞赛中落后的任何潜在信号都保持高度敏感。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断