На этой неделе команда Perplexity Engineering опубликовала статью о своей инфраструктуре для обработки встраиваний на GPU, которая используется в продукте pplx-embed. В статье обсуждаются две ключевые составляющие: качество модели встраивания и эффективность её работы на индексах. Первая часть процесса включает в себя использование оборудования Hopper и Blackwell, что позволяет достичь высокой производительности.
Perplexity описывает два основных типа нагрузки: пакетная обработка встраиваний, которая происходит при создании или переиндексации векторной базы данных, и онлайн-обработка, которая происходит во время выполнения запросов. В пакетной обработке акцент делается на максимизацию пропускной способности для снижения затрат, тогда как онлайн-обработка требует быстрой реакции на короткие запросы.
Эти улучшения в инфраструктуре обработки встраиваний важны для повышения качества поиска и общей производительности продуктов Perplexity. Эффективное использование GPU и оптимизация процессов позволяют компании предлагать более быстрые и точные результаты для пользователей, что может существенно повысить конкурентоспособность на рынке AI.