12 августа 2026 года команда Qwen от Alibaba анонсировала модель Qwen3.8-2.4T-A95B, которая впервые представлена с открытыми весами. Модель имеет 2.4 триллиона параметров и использует гибридную архитектуру, сочетающую линейное и полное внимание, что позволяет обрабатывать контекст до 262 тысяч токенов, с возможностью расширения до 1 миллиона токенов.
Qwen3.8 нацелена на выполнение наиболее требовательных задач, включая многопроцессорное кодирование и долгосрочное планирование. Открытые веса предоставляют пользователям полный контроль над данными и поведением вывода, что позволяет избежать дополнительных затрат на API при масштабировании. Однако для развертывания такой модели требуется специализированная инфраструктура GPU и оптимизированный стек обслуживания.
Данная модель будет развернута на Amazon SageMaker HyperPod с использованием vLLM на инстансе ml.p6-b300, который включает 8 графических процессоров NVIDIA B300 Blackwell Ultra. Это решение открывает новые возможности для разработчиков, стремящихся к созданию мощных AI-приложений с высокой степенью кастомизации.