Компания Amazon представила новую функцию кэширования моделей для SageMaker HyperPod, которая призвана уменьшить время ожидания при развертывании крупных языковых моделей. Ранее пользователи сталкивались с задержками, связанными с последовательной загрузкой контейнеров и весов моделей, что могло занимать до 30 минут для крупных моделей, таких как DeepSeek-R1 объемом более 600 ГБ.
Теперь кэширование моделей позволяет предварительно загружать веса моделей и контейнерные образы на узлы кластера до того, как поды начнут обслуживать запросы. Это значительно ускоряет процесс, так как при старте пода пользователи могут избежать длительных загрузок, что особенно важно для приложений с высокой нагрузкой и динамическим масштабированием.
Введение этой функции может существенно повысить эффективность работы с крупными языковыми моделями, улучшая общую производительность Amazon SageMaker. Это решение также может способствовать более быстрому реагированию на изменения нагрузки и улучшению пользовательского опыта при работе с большими данными.