Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Развертывание LLM локально: опыт с vLLM и DGX Spark

В статье рассматривается процесс локального развертывания языковых моделей (LLM) с использованием платформы NVIDIA DGX Spark и других технологий. Автор делится своим опытом, включая установку двух моделей LLM и отдельной ASR-модели на AMD GPU, а также интеграцию с мультиагентной платформой.

Инженерный разбор включает в себя обсуждение различных аспектов, таких как конкуренция между длинным контекстом и KV-кэшем, а также влияние параллелизма на производительность. Автор также отмечает, что традиционные метрики, такие как количество токенов в секунду, не всегда отражают реальную задержку для пользователей.

Эта статья важна для разработчиков и исследователей в области искусственного интеллекта, так как она предоставляет практические рекомендации и освещает проблемы, с которыми можно столкнуться при локальном развертывании моделей. Понимание этих аспектов может значительно улучшить эффективность работы с LLM в различных приложениях.

Главное

  • Автор описывает развертывание двух LLM на NVIDIA DGX Spark.
  • Отдельная ASR-модель была развернута на AMD GPU.
  • Статья исследует влияние длинного контекста и KV-кэша на производительность.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →