vestka

H Company представила NeoMME: новые многомодальные энкодеры

H Company представила NeoMME, новую семью многомодальных энкодеров, включающую модели с 260M и 800M параметрами. Эти энкодеры не используют визуальную башню и причинный декодер, что позволяет снизить вычислительные затраты и упростить архитектуру. Вместо этого один трансформер обрабатывает многоязычные текстовые токены и необработанные 32×32 RGB-изображения через одни и те же слои, обученные с нуля.

Модель NeoMME-Retriever с 260M параметрами достигла 0.523 nDCG@10 на наборе данных ViDoRe v3, что подтверждает ее эффективность в задачах извлечения информации. Каждый контрольный пункт модели поставляется под лицензией Apache 2.0 и поддерживается в Hugging Face Transformers, что делает ее доступной для разработчиков.

Эти новшества могут значительно повлиять на область обработки мультимодальных данных, предлагая более эффективные решения для извлечения информации из текстов и изображений. С индексированием 51.3 страниц в секунду на одном NVIDIA L40S и временем кодирования запроса в 78.3 мс на CPU, NeoMME может быть полезна в различных приложениях, требующих быстрой обработки данных.

Главное

  • H Company выпустила новую серию многомодальных энкодеров NeoMME с 260M и 800M параметрами.
  • Модель NeoMME-Retriever достигла 0.523 nDCG@10 на наборе данных ViDoRe v3.
  • Энкодеры могут индексировать 51.3 страниц в секунду на одном NVIDIA L40S.
  • Время кодирования запроса составляет 78.3 мс на CPU.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →