H Company представила NeoMME, новую семью многомодальных энкодеров, включающую модели с 260M и 800M параметрами. Эти энкодеры не используют визуальную башню и причинный декодер, что позволяет снизить вычислительные затраты и упростить архитектуру. Вместо этого один трансформер обрабатывает многоязычные текстовые токены и необработанные 32×32 RGB-изображения через одни и те же слои, обученные с нуля.
Модель NeoMME-Retriever с 260M параметрами достигла 0.523 nDCG@10 на наборе данных ViDoRe v3, что подтверждает ее эффективность в задачах извлечения информации. Каждый контрольный пункт модели поставляется под лицензией Apache 2.0 и поддерживается в Hugging Face Transformers, что делает ее доступной для разработчиков.
Эти новшества могут значительно повлиять на область обработки мультимодальных данных, предлагая более эффективные решения для извлечения информации из текстов и изображений. С индексированием 51.3 страниц в секунду на одном NVIDIA L40S и временем кодирования запроса в 78.3 мс на CPU, NeoMME может быть полезна в различных приложениях, требующих быстрой обработки данных.