Google 开源 EmbeddingGemma 2,支持手机端多模态搜索

发布时间 2026-10-07 1 天前
来源 宝玉
字数 1,103 字
查看原文

智能总结

Google 开源了 EmbeddingGemma 2,这是一款面向检索任务的多模态嵌入模型,参数量为 7.4 亿,可在手机和电脑本地运行,将文字、图片、视频、音频和代码映射到同一套向量空间,支持用一句话跨格式搜索本地照片、视频和录音。

Google 发布 EmbeddingGemma 2:在手机上用一句话搜照片、视频和录音

Google 发布了 EmbeddingGemma 2,这是一组面向检索任务的嵌入模型。它支持使用一句话搜索照片、视频和录音,并针对移动设备进行了优化。

Google 开源了 EmbeddingGemma 2,这是一个能在手机和电脑本地运行的多模态嵌入模型。文字、图片、视频、音频和代码都能放进同一套“坐标系”,所以你可以用一句话找到一段视频,整个过程不用联网。

嵌入模型(embedding model)是搜索背后的一层技术:它把内容转成一串数字,意思相近的内容,数字也相近。上一代 EmbeddingGemma 只处理文字,这一代把几种格式统一了起来,可以跨格式找东西。比如对着手机说一句话,找出相册里对应的视频片段;或者输入一行字,在几个小时的录音里找到某段对话。

模型有 7.4 亿参数,运行时占用 191MB 到 567MB 内存,手机上跑得动。Google 说它在同体量模型里表现最好,还超过了一些比它大一倍多的模型。它一次能处理的内容是上一代的 4 倍(8K 上下文),相当于 5.5 分钟音频、29 张图片或 58 帧视频。

它可以和 Google 的开源大模型 Gemma 4 搭配,在设备上做 RAG(检索增强生成,先查资料再回答)。EmbeddingGemma 2 从你的本地文件里找出相关内容,Gemma 4 读完后给出答案。文件不离开设备,合同、病历这类不想上传到云端的资料也能这样处理。

它基于 Gemma 4 架构,用 Apache 2.0 协议开源,可以免费商用。现在能在 Hugging Face 和 Kaggle 下载,Google 企业 AI 平台的模型库稍后上线。

Sundar Pichai@sundarpichai

Introducing EmbeddingGemma 2, a new open multimodal model that sets the standard for on-device efficiency.

Introducing EmbeddingGemma 2,一款全新的开放多模态模型,为设备端(on-device)效率树立了新标准。

  • 我们的首个开放、 原生多模态(natively multimodal)嵌入模型
  • 以轻量级、模块化的 740M 参数规模,同时处理文本、代码、图像、视频和音频任务
  • 与 Gemma 4 搭配使用,非常适合离线、隐私优先(privacy-first)的检索增强生成(RAG)场景
  • 性能优于部分规模超过其两倍的专用模型

模型权重现已可在 Hugging Face 上获取。