Amazon представила SageMaker HyperPod Inference Gateway, который решает проблему неэффективного использования GPU при запуске больших языковых моделей. По данным компании, традиционные алгоритмы балансировки нагрузки в Kubernetes, такие как round-robin и least-connections, не учитывают состояние GPU, что приводит к неравномерному распределению запросов и увеличению задержки до 4 секунд в пиковые моменты.
Новый инструмент SageMaker HyperPod Inference Gateway позволяет установить один надстройку, не требуя изменений в приложениях. Он обеспечивает более эффективное распределение запросов, что позволяет избежать перегрузки загруженных подов и использовать неактивные ресурсы, тем самым снижая затраты на GPU.
Внедрение SageMaker HyperPod Inference Gateway может значительно повысить производительность и снизить расходы для компаний, работающих с большими языковыми моделями. Это решение может стать важным шагом для оптимизации инфраструктуры и повышения эффективности работы с AI-технологиями.