Игорь Градов
Игорь Градов
5 мин
ai

Google отдала бесплатно embedding модель на 740 млн параметров: работает на смартфоне без сервера

Почему это важно Google выпустила embedding модель (модель, которая превращает текст, код, изображения, видео и аудио в числовые векторы для поиска и…

Google отдала бесплатно embedding модель на 740 млн параметров: работает на смартфоне без сервера
Почему это важно

Google выпустила embedding модель (модель, которая превращает текст, код, изображения, видео и аудио в числовые векторы для поиска и сравнения), которая работает целиком на устройстве пользователя, без отправки данных на сервер, и при этом распространяется под свободной лицензией Apache 2.0.

Google запустила EmbeddingGemma 2, открытую мультимодальную embedding модель на 740 миллионов параметров, которая объединяет текст, код, изображения, видео и аудио в одном пространстве и работает прямо на смартфоне или ноутбуке.

Первая версия EmbeddingGemma вышла год назад и умела работать только с текстом. По данным Google, её скачали более 20 миллионов раз. Вторая версия построена на архитектуре Gemma 4 и сделана на той же технологии, что и закрытые модели Gemini Embedding. Лицензия Apache 2.0 разрешает коммерческое использование. Релиз примечателен тем, что Google фактически отдала в открытый доступ ту же технологию, которую продаёт в облаке.

Что Когда Кто выпустил Цена
EmbeddingGemma 2 Июнь 2025 Google Бесплатно, лицензия Apache 2.0

Что умеет EmbeddingGemma 2?

  • Мультимодальный поиск одной моделью. Можно найти конкретный видеоклип по голосовой заметке или прошерстить часы аудиозаписей по текстовому запросу. Раньше для каждого типа данных нужна была отдельная модель.
  • Модульная архитектура. Для работы только с текстом достаточно 270 миллионов параметров. Хотите добавить картинки, подключаете модуль зрения (170 миллионов параметров). Нужен звук, ещё 300 миллионов. Полная мультимодальная (способная понимать несколько типов данных) сборка: 740 миллионов.
  • Экономия памяти до 6 раз. Технология Matryoshka Representation Learning позволяет сжимать выходные векторы с 768 измерений до 512, 256 или 128. Для локальных баз данных на телефоне это критично.
  • Работает на телефоне. На Google Pixel 11 Pro текстовая версия занимает около 191 МБ оперативной памяти, полная мультимодальная, около 567 МБ. Для сравнения: у среднего смартфона сейчас от 6 до 12 ГБ оперативной памяти.
  • Контекстное окно 8 000 токенов (токен, единица текста, примерно три четверти слова). Это в четыре раза больше, чем у первой версии. Хватает на 5,5 минуты аудио, 29 изображений или 58 видеокадров.

Где EmbeddingGemma 2 показывает результат?

По данным Google, модель набирает лидирующие оценки среди embedding моделей размером до миллиарда параметров на бенчмарках MTEB Code (тест для кода) и MAEB (тест для аудио). В коде прирост составил 9,92 пункта по сравнению с первой версией: с 68,76 до 78,68 по MTEB Code.

Google заявляет, что модель не уступает, а местами превосходит специализированные embedding модели, которые вдвое крупнее. Многоязычные текстовые результаты сохранились на уровне первой версии, а значит, русскоязычные тексты модель понимает не хуже, чем прежде.

Как попробовать?

  1. Скачать веса модели. Они доступны на Hugging Face и Kaggle. Версии, оптимизированные для работы на устройстве, лежат в разделе LiteRT Community на Hugging Face.
  2. Запустить локально. Модель поддерживается в популярных инструментах: Ollama, LMStudio, vLLM, llama.cpp, SGLang, transformers и sentence-transformers. Для мобильных приложений есть Google AI Edge MediaPipe.
  3. Дообучить (fine-tuning, обучение модели на ваших примерах под узкую задачу). Руководство по дообучению опубликовано командой Unsloth.

Есть ли российский аналог?

Прямого аналога EmbeddingGemma 2 в российских сервисах пока нет. YandexGPT и GigaChat умеют генерировать текстовые эмбеддинги через свои API, но оба требуют отправки данных на сервер и не предлагают открытых весов для локального запуска. Мультимодальный поиск по коду, аудио и видео одной моделью ни один из них не поддерживает.

EmbeddingGemma 2 здесь выигрывает именно для тех, кому важна приватность: данные не покидают устройство. Для авторов и экспертов, работающих с чувствительным контентом или клиентскими данными, это существенно.

Мнение редакции dzen.guru

Я вижу главную ценность этой модели не в бенчмарках, а в том, что она реально запускается на обычном телефоне и при этом понимает русский. Для автора Дзена это означает: можно построить локальный поиск по своему архиву текстов, черновиков, голосовых заметок и скриншотов, и ничего из этого не утечёт в облако.

Оговорка: 20 миллионов скачиваний первой версии не означают 20 миллионов активных пользователей, это общее число загрузок. Качество работы с русским языком Google не выделяет отдельно, а пишет обобщённо про многоязычность. Придётся тестировать самим.

Что сделать сегодня: если вы пользуетесь Ollama или LMStudio, скачайте модель и попробуйте скормить ей десяток своих статей. Посмотрите, насколько точно она находит похожие тексты. Это самый быстрый способ понять, полезна ли embedding модель лично вам.

Что делать с этим прямо сейчас, по ролям

Автору Дзена. Соберите архив своих публикаций в папку. Через Ollama или LMStudio загоните их в EmbeddingGemma 2. Получите поиск по смыслу: «о чём я писал про нейросети в марте» вернёт конкретные тексты, а не просто совпадения по словам.

Маркетологу. Локальная embedding модель позволяет строить семантический поиск по клиентским отзывам и обращениям без облачных API. Данные клиентов не покидают корпоративный ноутбук.

Предпринимателю в РФ. Модель не требует VPN для скачивания (Hugging Face и Kaggle доступны), не зависит от облачных сервисов Google и работает офлайн. Лицензия Apache 2.0 разрешает коммерческое использование без ограничений.

Частые вопросы

Нужна ли видеокарта для запуска?

Для текстовой версии хватает обычного процессора и 270 МБ свободной оперативной памяти. Полная мультимодальная версия требует около 567 МБ. Видеокарта ускорит работу, но не обязательна.

Модель понимает русский язык?

Google заявляет, что многоязычные текстовые показатели сохранились на уровне первой версии, которая поддерживала множество языков. Отдельных бенчмарков по русскому языку компания не публиковала, поэтому качество стоит проверять на своих задачах.

Чем EmbeddingGemma 2 отличается от ChatGPT или YandexGPT?

Это не генеративная модель: она не пишет тексты и не отвечает на вопросы. Она превращает любой контент в числовой вектор, чтобы потом искать похожее по смыслу. ChatGPT и YandexGPT генерируют ответы, EmbeddingGemma 2 ищет и сравнивает.

Бесплатная мультимодальная embedding модель, которая помещается в телефон и не сливает данные в облако, год назад казалась фантастикой. Теперь она лежит на Hugging Face и ждёт команды ollama pull.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

OpenAI интеграция с Jira и Confluence: ChatGPT создаёт задачи и ищет баги без переключения окон

OpenAI и Atlassian объявили о расширении партнёрства 10 июня 2025 года, в день открытия конференции Team '25 Europe, и теперь ChatGPT сможет работать с…

4 мин
Ошибки искусственного интеллекта важнее рейтингов: Microsoft объяснила, почему тесты врут
ai

Ошибки искусственного интеллекта важнее рейтингов: Microsoft объяснила, почему тесты врут

Microsoft второго июня опубликовала разговор с Дженнифер Невилл, партнёром-руководителем исследований, о том, как оценка ИИ-систем выявляет неожиданные ошибки…

5 мин
Anthropic даёт стартапам год Claude AI Team бесплатно и $1 000 на API
ai

Anthropic даёт стартапам год Claude AI Team бесплатно и $1 000 на API

Anthropic расширила программу «Claude for Startups» 3 июня 2025 года, и теперь стартапы могут получить бесплатный год премиум-плана Claude Team с пятью…

4 мин