Выбор правильного GPU инстанса для выполнения задач больших языковых моделей (LLM) является критически важным при развертывании генеративного ИИ. В недавнем бенчмаркинге были протестированы две модели Mixture-of-Experts с 30 миллиардами параметров на трех семействе GPU инстансов Amazon SageMaker AI. Результаты показывают, что новые G7 инстансы обеспечивают значительные улучшения в производительности по сравнению с G5 и G6.
В процессе тестирования использовалась функция рекомендаций по производительности Amazon SageMaker, которая предоставляет данные о пропускной способности, стоимости и задержке. Бенчмаркинг включал такие метрики, как время до первого токена и общая задержка. Результаты показали, что инстансы G7, основанные на графических процессорах NVIDIA Blackwell, обеспечивают ощутимые преимущества в производительности, снижая стоимость за токен и время обработки.
Эти улучшения имеют важное значение для бизнеса, использующего генеративный ИИ, так как позволяют значительно повысить эффективность выполнения задач, таких как автоматизация кодирования. Оптимизация производительности LLM может привести к снижению затрат и улучшению пользовательского опыта в различных приложениях, от разработки программного обеспечения до обработки естественного языка.