Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Ошибки в расчетах VRAM для LLM: анализ популярных калькуляторов

В ходе анализа топовых VRAM-калькуляторов для больших языковых моделей (LLM) было установлено, что большинство из них допускают ошибки в расчетах, что может привести к недооценке или переоценке необходимой памяти. Основная проблема заключается в том, что движки, такие как vLLM и TensorRT-LLM, резервируют почти всю доступную память для своих нужд еще до выполнения расчетов, что делает выводы о количестве запросов, которые могут быть обработаны, неточными.

Кроме того, вторая ошибка заключается в том, что на DeepSeek-V2-Lite стандартные формулы завышают значение ключевых векторов (KV) в 7–11 раз. Это может привести к неправильным решениям о том, стоит ли устанавливать модель, так как пользователи могут отказаться от ее использования, полагая, что она не поместится в доступную память.

Эти ошибки имеют значительные финансовые последствия, так как неверные расчеты могут привести к необходимости приобретения более мощного оборудования, чем это действительно требуется. Таким образом, важно учитывать эти аспекты при выборе и использовании VRAM-калькуляторов для LLM.

Главное

  • Движки резервируют почти всю память под свой пул до вычисления KV.
  • На DeepSeek-V2-Lite стандартные формулы завышают KV в 7–11 раз.

Важное из дайджеста

Открыть полный дайджест →