Хабр Новости23:30Учёные перепрограммировали нейроны мышей для восстановления забытых воспоминанийКоммерсантъ21:41США и Китай договорились о смягчении торговых ограниченийOilPrice18:00EPA отменяет регулирование выбросов углерода от электростанцийCoinDesk17:29Виталик Бутерин представил видение Ethereum к 2030 годуScienceDaily16:41Применение антикоагулянтов снижает риск серьезных осложнений у пациентов с фибрилляцией предсердий3DNews16:21OpenAI приостанавливает обучение ИИ из-за инцидентов с некорректным поведениемScienceDaily16:15Экспериментальная терапия CRISPR снижает уровень холестерина на 50% в течение годаScienceDaily14:55Древние окаменелости раскрывают ключ к возникновению сложной жизниХабр Новости14:13Новые солнечные панели на основе олова могут превысить рекордную эффективностьThe Guardian Business12:00Билл Гейтс призывает к регулированию искусственного интеллекта

vestka

Запуск мультимодальной MoE-модели Qwen3.8-Flash-Next на старом GPU

В статье обсуждается запуск мультимодальной MoE-модели Qwen3.8-Flash-Next на графическом процессоре GTX 1080 Ti. Модель включает в себя 125 миллиардов параметров, а также использует дополнительные 51 миллиард параметров для улучшения производительности. Этот эксперимент стал интересным примером того, как современные технологии могут быть адаптированы для работы на устаревшем оборудовании.

Команда Qwen называет Qwen3.8-Flash-Next ранним предпросмотром архитектуры, которая будет использоваться в Qwen4. Это подчеркивает важность исследований в области масштабируемости моделей и их адаптации к различным вычислительным ресурсам. Запуск на GTX 1080 Ti позволяет оценить, насколько эффективно можно использовать старые графические процессоры для работы с новыми моделями.

Данный эксперимент имеет значительное значение для исследователей и разработчиков, стремящихся оптимизировать использование ресурсов и улучшить доступность технологий ИИ. Он также поднимает вопросы о том, как можно использовать существующее оборудование для работы с передовыми моделями, что может быть особенно актуально в условиях ограниченных бюджетов.

Главное

  • Модель Qwen3.8-Flash-Next содержит 176 миллиардов параметров.
  • Основная часть модели включает 125 миллиардов параметров.
  • Эксперимент проводился на графическом процессоре GTX 1080 Ti.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →