Модель Qwen3.8-27B, представленная в рамках Q4TP, показывает значительные достижения в управлении контекстом и KV-кэшем. С весом около 14,3 ГБ, модель сталкивается с ограничениями при использовании длинного контекста, что приводит к увеличению KV-кэша на 65 536 байт с каждым токеном, достигая около 4 ГиБ на 64K токенов.
Для решения этой проблемы в Qwen3.8-27B используется экспериментальный режим O(1) рантайма CMF, который заменяет растущий KV-кэш фиксированным состоянием. Это позволяет использовать четыре sink-токена и точное окно последних 128 токенов, а также 32 опорных представления для дальней части, что значительно оптимизирует работу модели.
Эти нововведения имеют важное значение для разработки моделей с длинным контекстом, так как они позволяют более эффективно использовать ресурсы GPU и улучшать производительность при обработке больших объемов данных. Такой подход может привести к новым возможностям в области обработки естественного языка и других задач, требующих работы с длинными последовательностями.