Компания Liquid AI представила новые модели LFM2.5-DSpark, которые обеспечивают значительное ускорение процесса декодирования. Модели LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B предлагают до 3.18 раз более быстрое декодирование на графических процессорах H100 и до 2.87 раз на MacBook Pro с M4 Max. При этом выходные данные остаются неизменными, что подтверждает стабильность и точность моделей.
Каждая из новых моделей добавляет спекулятивный путь декодирования к существующей целевой модели. Драфтер, состоящий примерно из 300 миллионов параметров, предлагает блок из девяти кандидатных токенов, который затем проверяется целевой моделью за один проход. Это решение позволяет достичь значительного увеличения скорости декодирования при небольшой увеличении потребляемой памяти.
Модели LFM2.5-DSpark уже поддерживаются такими инструментами, как llama.cpp и SGLang, что делает их доступными для разработчиков. Однако для их использования требуется самохостинг, так как веса поставляются в формате Safetensors и GGUF, а драфтеры не обслуживаются ни одним из хостинг-провайдеров на Hugging Face.