Умная лента · Россия и мир Новости
Смартфон на полу гостиной локально связывает нитями смысла фото, код, аудио-карточку и видеокадры в общий векторный куб без облака.

Google выкатила EmbeddingGemma 2: локальный поиск теперь цепляет текст, фото, аудио и видео

Google DeepMind выпустила EmbeddingGemma 2 — открытую embedding-модель, которая складывает текст, код, картинки, видео и аудио в одно общее смысловое пространство. Не болталка и не генератор «сейчас всё объясню». Это штука для поиска и маршрутизации: дал текстовый запрос — она ищет подходящий кусок видео, аудиозапись или файл не по имени, а по близости смысла.

Главная ставка тут на локальный запуск. У модели 740 million параметров, лицензия Apache 2.0, основа — Gemma 4. Для text-only сценариев Google отделяет 270M параметров, зрительный энкодер добавляет 170M, аудио — 300M. С квантованием на Pixel 11 Pro указаны примерно ~191MB активной RAM для текстовых весов и ~567MB для полной мультимодальной версии. То есть идея простая: не гонять каждую голосовую заметку и папку с медиа в облако, если железо рядом уже тянет.

От прошлой EmbeddingGemma отличие не косметическое: та была про текстовые embeddings, эта уже про смесь форматов. Контекстное окно — 8K токенов, в анонсе это переводят в 5.5 минуты аудио, 29 изображений или 58 видеокадров. Для кода тоже дали сухую, но полезную цифру: MTEB Code вырос с 68.76 до 78.68, плюс 9.92 пункта. Красиво, но benchmark — это не дворник, который сам разгребёт домашний архив из скринов, PDF и записей с диктофона.

Есть и экономия на хранении. Через Matryoshka Representation Learning векторы можно резать с 768 измерений до 512, 256 или 128; заявленная экономия — до 6x для локальных векторных баз и памяти. Для разработчика это разница между «демка на ноутбуке» и «можно попробовать встроить в нормальный продукт».

Практические входы уже названы: Instant Media Search и Video Moments Finder в Google AI Edge Gallery, связка локального поиска с Gemma 4 в Foresight, плюс MediaPipe Decision Task API для классификации и роутинга. Но границы тоже видны: все оценки и сценарии идут из одного первоисточника Google, независимой проверки в пакете нет. Так что новость не про магию, а про полезный кирпичик для локального поиска и RAG: меньше облака, больше работы на устройстве, а качество всё равно придётся мерить на своих данных.

Источник: Google DeepMind Blog

← Ко всем новостям