Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Оптимизация работы с большими языковыми моделями на Amazon SageMaker

Amazon SageMaker анонсировал новый метод оптимизации обработки запросов для больших языковых моделей (LLM), который включает использование маршрутизации с учетом префиксов. В этом подходе фиксированная часть запроса, содержащая инструкции и контекст, кэшируется, что позволяет повторно использовать уже вычисленные данные при последующих запросах. Это особенно полезно для приложений, таких как чат-боты, где одно и то же начало запроса может повторяться множество раз.

В традиционных системах обработки запросов каждая новая итерация требует повторного вычисления всей информации, что увеличивает время отклика. С помощью новых методов, таких как vLLM и TensorRT-LLM, Amazon SageMaker предлагает решение, которое значительно сокращает задержку, позволяя моделям обрабатывать запросы быстрее и эффективнее. Это достигается за счет хранения ключевых значений (KV) для префиксов запросов, что позволяет модели использовать уже вычисленные результаты.

Данная оптимизация имеет важное значение для разработки приложений, где скорость обработки запросов критична. Уменьшая время отклика, разработчики могут улучшить пользовательский опыт и повысить эффективность своих приложений. Это также открывает новые возможности для использования LLM в реальном времени, что может привести к более широкому внедрению технологий искусственного интеллекта в различных сферах.

Главное

  • Amazon SageMaker внедряет маршрутизацию с учетом префиксов для оптимизации работы с LLM.
  • Метод позволяет кэшировать ключевые значения для повторяющихся частей запросов.
  • Использование новых технологий, таких как vLLM и TensorRT-LLM, сокращает задержку обработки.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →