В ходе анализа топовых VRAM-калькуляторов для больших языковых моделей (LLM) было установлено, что большинство из них допускают ошибки в расчетах, что может привести к недооценке или переоценке необходимой памяти. Основная проблема заключается в том, что движки, такие как vLLM и TensorRT-LLM, резервируют почти всю доступную память для своих нужд еще до выполнения расчетов, что делает выводы о количестве запросов, которые могут быть обработаны, неточными.
Кроме того, вторая ошибка заключается в том, что на DeepSeek-V2-Lite стандартные формулы завышают значение ключевых векторов (KV) в 7–11 раз. Это может привести к неправильным решениям о том, стоит ли устанавливать модель, так как пользователи могут отказаться от ее использования, полагая, что она не поместится в доступную память.
Эти ошибки имеют значительные финансовые последствия, так как неверные расчеты могут привести к необходимости приобретения более мощного оборудования, чем это действительно требуется. Таким образом, важно учитывать эти аспекты при выборе и использовании VRAM-калькуляторов для LLM.