Google DeepMind推出多模态嵌入模型EmbeddingGemma 2,参数量7.4亿,采用Apache 2.0协议开源。该模型将文本、代码、图像、视频和音频统一映射至768维空间,支持端侧高效运行。
Google DeepMind 正式发布开源权重模型 EmbeddingGemma 2。该模型拥有 7.4 亿参数,基于 Gemma 4 架构构建,采用商业友好的 Apache 2.0 协议开源。它能将文本、代码、图像、视频和音频映射至统一的 768 维嵌入空间,体积小巧,可直接在手机和笔记本电脑上流畅运行。
这一发布将 Google 的端侧嵌入能力拓展至多模态领域。嵌入技术将各类内容转化为表征语义的数值向量,是搜索工具和检索增强生成(RAG)系统的核心基础。借助该模型,开发者可通过语音备忘录定位特定视频片段,或直接用文本检索数小时的音频记录。此前基于 Gemma 3 构建的纯文本初代模型参数为 3.08 亿,下载量已突破 2000 万次。

EmbeddingGemma 2 采用模块化设计,开发者无需加载完整模型:
所有模块组合生成的向量均处于同一空间内,纯文本编码的查询可直接与完整多模态模型生成的文档向量匹配。输入上下文窗口达到 8,192 token,是前代模型的 4 倍,单次可处理多达 29 张图片、58 帧视频或 5.5 分钟音频。
在海量文本嵌入基准(MTEB)的代码测试中,该模型获得 78.68 分,较上一代的 68.76 分提升了 9.92 分。得益于俄罗斯套娃表征学习(Matryoshka Representation Learning)技术,开发者可将向量维度压缩至最低 128 维,节省高达 6 倍的存储空间。官方指南显示,256 维向量可在图像、视频与语音检索中保留约 95% 的质量;降至 128 维时,多模态检索质量保持在 75% 左右。
需要注意的是,模型卡显示 EmbeddingGemma 2 未经过后训练安全微调,应用层安全保障需由开发者自行实现。
在 Pixel 11 Pro 上量化运行后,纯文本模型仅占用约 191 MB 运行内存,完整多模态模型内存占用约为 567 MB。Google AI Edge Gallery 应用将新增两款演示功能:
此外,Google 还推出了面向 Mac 的实验性应用 Google AI Edge Foresight,支持搜索本地会议纪要、笔记、图片和文档。
目前,模型权重已上线 Hugging Face 与 Kaggle。未来数周内将集成至 Android 平台的 ML Kit,支持硬件加速,并即将在 Gemini Enterprise Agent Platform Model Garden 中提供。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断