Perplexity Research и turbopuffer анонсировали релиз модели pplx-embed-v2-context-9b-preview, которая предназначена для улучшения работы с RAG (Retrieval-Augmented Generation) системами. Эта модель позволяет встраивать каждый фрагмент с полным документом на виду, что обеспечивает более точное извлечение информации. Основное отличие заключается в том, что модель обучается извлекать ответ вместе с контекстом, необходимым для его проверки, а не только один 'золотой фрагмент'.
Модель доступна для самостоятельного хостинга и размещена на платформе Hugging Face под лицензией MIT. Для загрузки модели требуется версия transformers не ниже 5.4.0 с установленным параметром trust_remote_code=True. На данный момент модель не интегрирована в API Perplexity, и в карточке модели указано, что веса и интерфейс могут изменяться без обратной совместимости.
Важность этой модели заключается в том, что она решает проблему, с которой сталкиваются RAG системы при работе с длинными документами, разбивая их на фрагменты. Контекстные модели, такие как pplx-embed-v2-context-9b-preview, позволяют учитывать зависимости между фрагментами, что значительно улучшает качество извлечения информации и делает систему более эффективной.