vestka

Aleph Alpha представила модель Kolibri с 78,1 миллиарда параметров

Aleph Alpha представила новую языковую модель Kolibri, которая отличается архитектурой Mixture-of-Experts (MoE) и предназначена для работы с английским и немецким языками. Модель включает 78,1 миллиарда параметров, однако активирует лишь 3,46 миллиарда параметров, что составляет 4,4% от общего числа, для каждого токена. Kolibri поддерживает контекст до 1 048 576 токенов и позволяет пользователям настраивать уровень рассуждений для каждого запроса.

Модель Kolibri разрабатывалась с акцентом на применение в регулируемых секторах, таких как государственное управление, промышленность и аэрокосмическая отрасль. Она доступна под лицензией Apache 2.0 на платформе Hugging Face. Для ее развертывания требуется около 78 ГБ памяти и поддержка на специализированных графических процессорах, таких как B200, B300, H200 или 2 H100 SXM5.

Важность Kolibri заключается в ее потенциале для использования в критически важных областях, где требуется высокая степень надежности и соответствие нормативным требованиям. Полный контроль команды Aleph Alpha над процессом разработки и обучения модели, включая инфраструктуру и оценку, подчеркивает серьезный подход компании к созданию эффективных инструментов для обработки естественного языка.

Главное

  • Модель Kolibri имеет 78,1 миллиарда параметров.
  • Активируется только 3,46 миллиарда параметров при обработке токенов.
  • Kolibri поддерживает контекст до 1 048 576 токенов.
  • Модель доступна под лицензией Apache 2.0 на Hugging Face.
  • Разработка проводилась в Германии и Финляндии.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →