# EmbeddingGemma 2: открытая мультимодальная эмбеддинг-модель на 740 млн параметров

> 2026-10-07 · AI Release · @ai_release1

> #Google #EmbeddingGemma #эмбеддинги #on-device #открытые

### ⚡ Главное за 5 секунд - Google DeepMind выпустила EmbeddingGemma 2 — открытую мультимодальную модель эмбеддингов на 740 млн параметров, объединяющую текст, код, изображения, видео и аудио в едином векторном пространстве. - Модель доступна на Hugging Face и Kaggle под лицензией Apache 2.0, оптимизирована для локального инференса на потребительских устройствах. - Ограничение: полная мультимодальность требует ~567MB активной RAM (с квантизацией на Pixel 11 Pro), текстовый режим — ~191MB. ### 🔍 Что обнаружено Google анонсировала EmbeddingGemma 2 — вторую версию семейства, представленного годом ранее как лёгкое решение для текстовых эмбеддингов. Первая модель набрала более 20 млн загрузок и использовалась для локального поиска и privacy-first RAG-пайплайнов. Новая версия построена на архитектуре Gemma 4 и расширяет возможности за пределы текста: единое эмбеддинг-пространство покрывает код, изображения, видео и аудио. Авторы — инженеры Google DeepMind Сахил Дуа и Энрике Шехтер Вера. Ключевые технические характеристики: модульная конструкция требует от 270M параметров для текстовых задач, опциональные энкодеры — vision (170M) и audio (300M). Благодаря Matryoshka Representation Learning векторы можно усекать с 768 до 512, 256 или 128 измерений, что даёт до 6-кратную экономию хранилища для локальных векторных баз. Контекстное окно — 8K токенов (в 4 раза больше первой версии), что позволяет обрабатывать до 5,5 минут аудио, 29 изображений или 58 видеокадров локально. По бенчмаркам MTEB Code и MAEB модель лидирует среди мультимодальных эмбеддеров до 1B параметров, показав прирост в коде на 9,92 балла (с 68,76 до 78,68) и обгоняя некоторые специализированные модели вдвое большего размера. ### 💡 Почему это важно Локальная генерация эмбеддингов обеспечивает приватность данных, снижает задержки и позволяет строить кросс-модальный поиск и RAG, работающие полностью офлайн. Поскольку модель построена на Gemma 4 и разделяет с ней токенизатор и аудиоэнкодер, обе модели можно запускать в едином пайплайне с меньшим суммарным потреблением памяти — например, EmbeddingGemma 2 для поиска файлов плюс Gemma 4 для контекстных рассуждений. Практические сценарии уже доступны в Google AI Edge Gallery: Instant Media Search для поиска по медиатеке, Video Moments Finder для поиска моментов в видео по текстовым или аудио-запросам, а также MediaPipe Decision Task API для классификации и маршрутизации в реальном времени. ### 🧩 Контекст Первая EmbeddingGemma появилась годом ранее как компактная модель для качественных текстовых эмбеддингов на потребительском железе — для организации, поиска и связывания информации напрямую на устройстве. Отклик разработчиков превзошёл ожидания Google: более 20 млн загрузок, применение в локальных поисковых инструментах и privacy-first RAG. EmbeddingGemma 2 развивает эту линию, добавляя мультимодальность и сохраняя ставку на edge-инференс. Модель совместима с широким стеком инструментов: transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio, Qdrant, transformers.js и WebGPU для браузера; гайды по файнтюнингу предоставлены партнёром Unsloth, а доступ через Gemini Enterprise Agent Platform Model Garden обещан позже.

[Источник](https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/)
