Сегодня было представлено архитектурное превью Qwen 4, которое обещает значительные изменения в обработке контекста и использовании памяти в трансформерных моделях. Главные новшества включают механизмы GDN + QSA и Gated Residual, а также 51B N-gram эмбеддинги, которые могут улучшить производительность модели.
В статье также проводится сравнение новой архитектуры с предыдущей моделью Qwen 3.8, обладающей 27B параметрами. Ожидается, что новые механизмы позволят улучшить эффективность обработки данных и снизить затраты на память, что является важным аспектом для разработчиков.
Разработка Qwen 4 может оказать значительное влияние на дальнейшие исследования в области искусственного интеллекта, особенно в контексте повышения производительности и оптимизации моделей. Успех этой платформы может открыть новые горизонты для применения трансформеров в различных задачах.