Команда Qwen компании Alibaba представила Qwen3.8-Flash-Next, новую мультимодальную модель Mixture-of-Experts с 125 миллиардами параметров. Эта модель включает в себя 51 миллиард N-граммных эмбеддингов и 4 миллиарда модулей предсказания многотокенов, активируя только 6 миллиардов параметров на токен. Релиз также демонстрирует изменения, такие как гибрид Gated DeltaNet и Qwen Sparse Attention, а также оптимизатор Muon.
Обучение Qwen3.8-Flash-Next обошлось в примерно одну девятую от стоимости обучения предыдущей модели Qwen3.7-Plus. При этом размер контрольной точки FP8 составляет 172.78 GiB, а BF16 — 335.28 GiB. Модель не предназначена для развертывания на рабочих станциях, но может быть использована на специализированных системах, таких как GB300.
Данная модель представляет собой важный шаг в развитии архитектуры Qwen, предвосхищая Qwen4. Снижение затрат на токены и улучшения в вычислительной эффективности делают Qwen3.8-Flash-Next значимым достижением для Alibaba в области искусственного интеллекта и могут способствовать дальнейшему развитию мультимодальных ИИ-решений.