Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Интеграция NVRx для повышения надежности распределенного обучения на Amazon EKS

Длительные распределенные тренировки на Amazon EKS сталкиваются с проблемами, связанными с прерываниями, такими как сетевые разрывы и ошибки памяти. Эти прерывания могут привести к значительным потерям времени и ресурсов, поскольку один сбой GPU может вызвать каскадные таймауты и сбои в работе других узлов кластера.

Для решения этих проблем в статье предлагается интеграция NVIDIA Resiliency Extension (NVRx) в процесс обучения с использованием PyTorch Fully Sharded Data Parallel (FSDP). Это решение включает асинхронное создание контрольных точек, которое позволяет параллельно выполнять ввод-вывод и обучение, а также перезапуск процессов внутри рабочего процесса, что значительно снижает время простоя.

Данная интеграция может существенно повысить эффективность распределенных тренировок, позволяя избежать значительных затрат на GPU в случае сбоев и улучшая общую производительность кластеров. Это особенно актуально для крупных проектов, требующих длительных вычислений и высоких затрат на ресурсы.

Главное

  • Синхронное создание контрольных точек может занимать до 40% общего времени выполнения.
  • NVIDIA Collective Communication Library (NCCL) используется для управления таймаутами.
  • Интеграция NVRx позволяет избежать каскадных сбоев в кластере.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →