Модель Qwen3.8, реализованная в рамках проекта llama.cpp, показывает значительные результаты в производительности, достигая 75 токенов в секунду на двух видеокартах RTX 3090. При этом плотная 27-миллиардная модель изначально выдает 32 токена в секунду, что указывает на потенциал для дальнейшей оптимизации.
Исследование узких мест в производительности выявило несколько факторов, влияющих на скорость обработки. Все узкие места можно устранить с помощью специальных флагов запуска, что позволяет достичь заявленных 75 токенов в секунду. В статье подробно описаны каждый флаг, его назначение и влияние на производительность модели.
Оптимизация работы Qwen3.8 имеет важное значение для разработчиков и исследователей в области искусственного интеллекта. Улучшение производительности моделей может привести к более эффективному использованию ресурсов и ускорению процессов обработки данных, что в свою очередь способствует развитию технологий на основе ИИ.