Google DeepMind выпустила EmbeddingGemma 2, новую открытую мультимодальную модель, которая объединяет текст, код, изображения, видео и аудио в одном 768-мерном пространстве. Модель содержит 740 миллионов параметров и поддерживает контекстное окно в 8K токенов, что делает её подходящей для задач поиска и классификации на устройствах с акцентом на конфиденциальность.
EmbeddingGemma 2 построена на архитектуре Gemma 4 и позволяет пользователям генерировать эмбеддинги локально, что сокращает задержки и обеспечивает возможность работы в оффлайн-режиме. Модель доступна для развертывания на Hugging Face и Kaggle, а также поддерживает различные сборки, такие как Ollama и llama.cpp.
Важность EmbeddingGemma 2 заключается в её способности улучшать взаимодействие с мультимедийными данными, позволяя извлекать информацию из различных форматов в одном векторном пространстве. Это открывает новые возможности для разработки приложений, которые требуют интеграции нескольких типов данных, что особенно актуально в условиях растущего интереса к мультимодальным ИИ-решениям.