Компания Jina AI представила новый продукт — jina-ocr-v1, который является визуальным парсером документов. Эта модель с 3.4 миллиарда параметров может обрабатывать PDF-файлы, сканы, таблицы и счета, возвращая чистый Markdown за один проход. Она разработана для работы на недорогих графических процессорах, таких как NVIDIA L4, что делает её доступной для широкого круга пользователей.
Модель демонстрирует высокие показатели, достигая 91.14 на OmniDocBench v1.6 и 83.4 на olmOCR-Bench. В её состав входит механизм спекулятивного декодирования, который улучшает производительность обработки. Открытые веса модели составляют около 6.8 ГБ в формате BF16 и могут быть использованы на платформах Transformers или vLLM.
Важно отметить, что jina-ocr-v1 доступна для исследовательского и некоммерческого использования, однако коммерческое применение требует согласования с Jina AI. Это делает модель полезной для исследователей и разработчиков, работающих с документами и визуальными данными.