Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Оптимизация производительности Qwen3.8 с использованием тензорного параллелизма

Модель Qwen3.8, реализованная в рамках проекта llama.cpp, показывает значительные результаты в производительности, достигая 75 токенов в секунду на двух видеокартах RTX 3090. При этом плотная 27-миллиардная модель изначально выдает 32 токена в секунду, что указывает на потенциал для дальнейшей оптимизации.

Исследование узких мест в производительности выявило несколько факторов, влияющих на скорость обработки. Все узкие места можно устранить с помощью специальных флагов запуска, что позволяет достичь заявленных 75 токенов в секунду. В статье подробно описаны каждый флаг, его назначение и влияние на производительность модели.

Оптимизация работы Qwen3.8 имеет важное значение для разработчиков и исследователей в области искусственного интеллекта. Улучшение производительности моделей может привести к более эффективному использованию ресурсов и ускорению процессов обработки данных, что в свою очередь способствует развитию технологий на основе ИИ.

Главное

  • Модель Qwen3.8 достигает 75 токенов в секунду на двух видеокартах RTX 3090.
  • Плотная 27-миллиардная модель изначально выдает 32 токена в секунду.
  • Оптимизация производительности осуществляется с помощью специальных флагов запуска.

Важное из дайджеста

Открыть полный дайджест →