手机数码

谷歌新推 EmbeddingGemma 2 模型:支持多模态,手机上跑只需 191MB 内存

IT之家 · 10月6日

去年谷歌发布的 EmbeddingGemma 主打轻量高质量文本嵌入,下载量已经突破 2000 万次,被大量用在端侧搜索工具和注重隐私的 RAG 管线里。如今它的继任者 EmbeddingGemma 2 正式登场,把能力边界从纯文本拓宽到代码、图像、视频和音频,能把这些不同模态的内容统一映射进同一个嵌入空间。新模型基于 Gemma 4 架构打造,采用商业友好的 Apache 2.0 协议开源,总参数 7.4 亿,天生适合端侧推理场景,技术上与 Gemini 的嵌入模型同源。

官方列出的核心优势有这么几条:性能上,它在 MTEB Code、MAEB 等基准测试里拿下子 1B 参数多模态嵌入模型的头名,表现足以叫板甚至压过不少体量更大的模型;设计上走模块化路线,纯文本任务只用 2.7 亿参数,需要时再挂上 1.7 亿参数的视觉编码器和 3 亿参数的音频编码器,就能补全多模态能力。存储层面借助 Matryoshka 表示学习(MRL),开发者可以把输出向量从 768 维动态压缩到 512、256 乃至 128 维,本地向量库的存储和内存开销最多能砍到六分之一。

端侧表现是这次的重点。量化之后,在 Pixel 11 Pro 上跑纯文本权重只占约 191MB 内存,完整多模态版本也不过 567MB 左右。上下文窗口给到 8K Token,是初代的 4 倍,本地硬件一次能处理最长 5.5 分钟的音频、29 张图片、58 个视频帧,或者它们的混搭组合。代码能力进步尤其明显:MTEB Code 得分从 68.76 涨到 78.68,一口气提升 9.92 分,做本地代码库索引、语义代码搜索和编程智能体检索都很对口;多语言文本性能则延续了前代的水准。

在图像、视频、文档和音频任务上,它给子 1B 参数模型立了个新的“单位参数质量”标杆,连一些两倍体量的专用模型都被它甩在身后。嵌入向量在本地生成,数据不用出设备,既保隐私又降延迟,开发者可以借此搭出完全离线的跨模态搜索系统。如果和 Gemma 4 这类生成模型搭配,还能组出理解复杂多模态数据的端侧 RAG 管线——两者架构同源、共用文本分词器和音频编码器,跑在同一管线里反而更省内存。模型权重已上架 Hugging Face 和 Kaggle,稍后还会登陆 Gemini Enterprise Agent Platform 的 Model Garden;开发方式上支持 Google AI Edge MediaPipe 做跨平台应用、LiteRT 做定制集成,也兼容 transformers.js、WebGPU 等浏览器方案,以及 transformers、Ollama、LMStudio 等主流工具链。

本文内容经编辑改写,原始来源:IT之家(阅读原文)
← 返回首页

相关阅读