跳到正文
Google DeepMind·· 2 天前精选AI 评分75

Google DeepMind 发布 EmbeddingGemma 2 开放轻量多模态嵌入模型

EmbeddingGemma 2: an open, lightweight multimodal embedding model

AI 导读

Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间。该模型基于 Gemma 4 架构,采用 Apache 2.0 许可,拥有 740 million 参数,支持 8K token 上下文窗口,并可通过 MRL 将输出向量从 768 维截断到 512、256 或 128 维。

推荐理由

原文给出参数规模、上下文窗口和端侧内存数据,可用于评估多模态嵌入在本地检索场景中的适配性。

正文 · AI 翻译

2026 年 10 月 06 日

|

EmbeddingGemma 2 是最强大的设备端多模态嵌入模型,可原生地将文本、图像、音频和视频的组合映射到统一的嵌入空间。


Sahil Dua

研究工程师,Google DeepMind

Henrique Schechter Vera

研究工程师,Google DeepMind


EmbeddingGemma 2

你的浏览器不支持音频元素。

收听文章

[[duration]] 分钟

此内容由 Google AI 生成。生成式 AI 仍处于实验阶段

去年,我们推出了 EmbeddingGemma,旨在为高质量文本嵌入提供一种轻量级选择,帮助你的应用直接在消费级硬件上组织、搜索和连接信息。开发者社区的反响远超我们的预期。下载量超过 2000 万次,开发者们已用它来支持更智能的设备端搜索工具和隐私优先的检索增强生成(RAG)流水线。

今天,我们推出 EmbeddingGemma 2,将能力从文本扩展到代码、图像、视频和音频,并将它们统一到共享的嵌入空间中。EmbeddingGemma 2 基于 Gemma 4 架构构建,并以商业友好的 Apache 2.0 许可发布,拥有 7.4 亿参数,非常适合设备端推理。它可以帮助从语音备忘录中找到特定视频片段,或根据文本查询搜索数小时的音频录音,所有处理都由单一的原生多模态模型完成。

EmbeddingGemma 2 与 Gemini Embedding 模型源自同一技术,它具备以下特点:

  • 同规模最佳: 在 MTEB(Massive Text Embedding Benchmark)Code 和 MAEB(Massive Audio Embedding Benchmark)等基准测试中,在同规模的 10 亿参数以下多模态嵌入模型中取得领先分数,同时在文本、视觉和音频任务上达到或超过许多更大模型的表现。
  • 模块化设计: 对于仅文本工作负载,仅需低至 2.7 亿参数,并可选配视觉(1.7 亿)和音频(3 亿)编码器以提供完整的多模态支持。
  • 存储高效: 借助 Matryoshka Representation Learning(MRL),开发者可以将输出向量从 768 维动态截断到 512、256 或 128 维。这可将本地向量数据库和内存使用的存储需求最多降低 6 倍。
  • 针对设备端性能优化: 可在严格的资源限制下高效运行。经过量化后,在 Google Pixel 11 Pro 上,EmbeddingGemma 2 的仅文本权重只需低至约 191MB 活跃 RAM,完整多模态模型则约需 567MB。
  • 支持扩展上下文: 配备 8K token 上下文窗口(比 EmbeddingGemma 1 大 4 倍),使其能够直接在本地硬件上处理长达 5.5 分钟的音频、29 张图像、58 帧视频,或它们的交错组合。

在代码、视觉和音频方面实现顶级质量

EmbeddingGemma 2 保持了 EmbeddingGemma 强大的多语言文本表现,同时在代码性能上显著提升 9.92 分(在 MTEB Code 中从 68.76 提升至 78.68),非常适合本地代码库索引、语义代码搜索和编程智能体检索。在图像、视频、文档和音频方面,它为 10 亿参数以下模型树立了新的单位参数质量标准,甚至超过了一些规模是其两倍以上的专用模型。

Massive Text Embedding Benchmark (Code)

Massive Image Embedding Benchmark (Lite)

Massive Audio Embedding Benchmark

完整评测指标和模型信息请参见 EmbeddingGemma 2 模型卡。

实现完全设备端的语义搜索、路由和检索

EmbeddingGemma 2 将强大的能力直接带到边缘硬件上。本地生成嵌入有助于确保数据隐私,降低流水线延迟,并使开发者能够构建完全离线运行的跨模态搜索和检索。

与 Gemma 4 等生成式模型配合使用时,EmbeddingGemma 2 可支持能够理解复杂多模态数据的设备端 RAG 流水线。由于 EmbeddingGemma 2 基于 Gemma 4 构建,并共享其文本分词器和音频编码器,开发者可以在统一流水线中同时运行这两个模型,并降低合计总内存占用。

要了解如何使用 LiteRT 构建设备端搜索和 RAG 系统,请阅读 Google AI Edge 博客文章。

开始使用 EmbeddingGemma 2

我们与以下合作伙伴紧密合作,确保 EmbeddingGemma 2 能在你的构建环境中立即运行:

  • 下载模型:在 Hugging Face 和 Kaggle 上查找模型权重,Gemini Enterprise Agent Platform Model Garden 也将很快提供。访问 Hugging Face 上的 LiteRT Community,获取针对设备端优化的模型。
  • 设备端部署:使用 Google AI Edge MediaPipe 开发跨平台应用,用于开箱即用的嵌入、检索和决策任务,或使用 LiteRT 进行自定义模型集成。使用 transformers.js 或 WebGPU 为浏览器构建。
  • 使用你喜欢的开发工具:使用 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio 高效地提供模型服务。使用 Qdrant 存储你的嵌入向量。
  • 微调:遵循 Unsloth 的指南,了解如何针对你的用例微调 EmbeddingGemma 2。

浏览我们的开发者指南、文档,以及推理和微调指南。

来源:Google DeepMind · deepmind.google