Google DeepMind 正式推出开源多模态嵌入模型 EmbeddingGemma 2,参数量仅 7.4 亿,原生支持文本、图像、音频与视频的统一向量映射,为端侧检索与多模态 RAG 带来高性能低功耗解决方案。

Google DeepMind 正式发布轻量级多模态向量嵌入模型 EmbeddingGemma 2。该模型基于 Gemma 4 架构开发,采用宽松的 Apache 2.0 开源许可协议,整体参数量仅 7.4 亿(740M),专为端侧设备高效推理而设计。
去年 Google 推出的第一代 EmbeddingGemma 在全球累计下载量超过 2000 万次。全新的 EmbeddingGemma 2 突破了纯文本局限,将代码、图像、音频与视频统一映射到同一个共享 Embedding 空间中。用户仅凭一条文本查询,即可检索数小时的音频录音,或通过一段语音备忘录准确定位特定视频片段。
EmbeddingGemma 2 在保持出色多语言能力的同时,代码检索能力实现大幅跨越:在 MTEB Code 基准测试中得分从 68.76 跃升至 78.68(提升 9.92 分),非常适合用于本地代码库索引、语义代码搜索与编程 Agent 检索。
在边缘端直接生成向量,不仅保障了用户数据隐私、降低了延迟,还能让开发者构建完全离线运行的跨模态检索系统。
当与 Gemma 4 等生成模型搭配时,EmbeddingGemma 2 能够构建起理解复杂多模态数据的端侧 RAG 流程。由于两者共享相同的分词器(Tokenizer)和音频编码器,联合部署时的综合内存占用得以进一步压降。
EmbeddingGemma 2 已与主流开源与端侧开发生态完成集成:
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断