На этой неделе две китайские лаборатории искусственного интеллекта представили свои новые модели: GLM-5.3-Flash от Z.ai и Qwen3.8-Flash-Next от Alibaba. GLM-5.3-Flash является мультимодальной моделью с 320 миллиардами параметров, из которых 18 миллиардов активны. В то же время Qwen3.8-Flash-Next имеет 125 миллиардов параметров с 6 миллиардами активных параметров и предваряет архитектуру Qwen4.
Несмотря на то, что обе модели были разработаны независимо, их конфигурации демонстрируют значительное сходство. Обе системы используют гибридное внимание в соотношении 3:1, выбирают контекст с помощью сжатого индексатора, ограниченного 2048 токенами, и расширяют остаточный поток на 4 управляемые ветви. Обе модели также обучаются с использованием оптимизатора Muon.
Эти релизы подчеркивают текущие тенденции в разработке ИИ, где лаборатории стремятся к созданию более мощных и эффективных архитектур. Сравнение моделей может помочь в дальнейшем развитии технологий и понимании, как различные подходы могут привести к схожим результатам в области искусственного интеллекта.