Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

GTX 1080 Ti и новые MoE-модели для llama-server

В новой статье обсуждаются возможности графической карты GTX 1080 Ti в контексте работы с MoE-моделями для llama-server. Недавно проведённые эксперименты показали, что модель Qwen 3.8-27B успешно работает на двух RTX 5060 Ti с общей памятью 32 ГБ, что подтверждает её эффективность при использовании гибридной архитектуры DeltaNet + attention.

Эти результаты важны для разработчиков, работающих с длинными контекстами, так как они демонстрируют, что даже относительно устаревшие графические карты могут быть использованы для запуска современных моделей. В частности, модель в квантизации Q4_K_M показала производительность около 24 токенов, что является значительным достижением.

Данные эксперименты подчеркивают важность оптимизации моделей для работы на различных аппаратных платформах, что может расширить доступность технологий ИИ для более широкого круга пользователей. Это также может способствовать развитию новых приложений и улучшению существующих решений в области обработки данных.

Главное

  • Модель Qwen 3.8-27B успешно запущена на двух RTX 5060 Ti с 32 ГБ общей памяти.
  • Гибридная архитектура DeltaNet + attention показала высокую эффективность для работы с длинным контекстом.
  • Модель в квантизации Q4_K_M выдавала около 24 токенов.

Важное из дайджеста

Открыть полный дайджест →