Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Amazon представляет SageMaker HyperPod Inference Gateway для оптимизации использования GPU

Amazon представила SageMaker HyperPod Inference Gateway, который решает проблему неэффективного использования GPU при запуске больших языковых моделей. По данным компании, традиционные алгоритмы балансировки нагрузки в Kubernetes, такие как round-robin и least-connections, не учитывают состояние GPU, что приводит к неравномерному распределению запросов и увеличению задержки до 4 секунд в пиковые моменты.

Новый инструмент SageMaker HyperPod Inference Gateway позволяет установить один надстройку, не требуя изменений в приложениях. Он обеспечивает более эффективное распределение запросов, что позволяет избежать перегрузки загруженных подов и использовать неактивные ресурсы, тем самым снижая затраты на GPU.

Внедрение SageMaker HyperPod Inference Gateway может значительно повысить производительность и снизить расходы для компаний, работающих с большими языковыми моделями. Это решение может стать важным шагом для оптимизации инфраструктуры и повышения эффективности работы с AI-технологиями.

Главное

  • SageMaker HyperPod Inference Gateway снижает задержку первого токена до 82%.
  • Традиционные алгоритмы балансировки нагрузки могут увеличивать задержку до 4 секунд.
  • Новый инструмент требует установки всего одной надстройки без изменений в приложениях.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →