Компания Z.ai представила новую модель GLM-5.3-Flash, которая включает в себя 320 миллиардов параметров и поддерживает нативную мультимодальность. Эта модель способна обрабатывать контекст длиной до 1 миллиона токенов, что значительно расширяет ее возможности в различных приложениях.
Главной особенностью GLM-5.3-Flash является использование гибридной архитектуры, которая сочетает sparse attention и linear attention. Это позволяет снизить объем вычислений attention в 3,01 раза по сравнению с предыдущей моделью GLM-5.3, а также уменьшить размер KV-cache в 4,44 раза, что делает модель более эффективной.
Запуск GLM-5.3-Flash может оказать значительное влияние на развитие технологий обработки естественного языка и мультимодальных систем. Увеличение параметров и улучшение архитектуры открывают новые возможности для разработчиков и исследователей, что может привести к созданию более сложных и мощных приложений в области AI.