Компания Amazon представила новые возможности Ray на платформе SageMaker HyperPod, которые интегрируют Ray с инфраструктурой, предназначенной для обучения и обслуживания базовых моделей. Ray — это открытая платформа, используемая учеными-данными для масштабирования распределенных рабочих нагрузок на кластерах GPU, включая обучение моделей и их обслуживание.
С помощью KubeRay, открытого оператора, управление кластерами Ray на Kubernetes стало более удобным. Он позволяет управлять жизненным циклом кластера через пользовательские ресурсы, такие как RayCluster, RayJob и RayService. SageMaker HyperPod обеспечивает инфраструктуру для масштабного машинного обучения на Amazon Elastic Kubernetes Service (EKS) с встроенным мониторингом состояния узлов и автоматическим восстановлением.
Эти обновления значительно упрощают процесс работы с Ray, устраняя необходимость в написании YAML-манифестов и ручной настройке инструментов мониторинга, таких как Prometheus и Grafana. Это улучшение может повысить эффективность работы исследователей и разработчиков в области машинного обучения, позволяя им сосредоточиться на создании и оптимизации моделей.