Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Оптимизация затрат и задержек с помощью кэширования запросов в Amazon Bedrock

Кэширование запросов в Amazon Bedrock представляет собой эффективный способ снижения затрат на токены, достигая экономии до 90% при повторной отправке идентичного контекста к основным моделям. Например, отправка контракта на 10,000 токенов вместе с 50 вопросами пользователей может привести к затратам в 500,000 токенов без кэширования, что значительно увеличивает расходы на обработку данных.

Существует несколько подходов для оптимизации затрат, включая сокращение длины запросов, уменьшение контекстных окон и применение кэширования на уровне приложения. Каждый из этих методов имеет свои недостатки: укороченные запросы могут ухудшить качество контекста, а меньшие контекстные окна снижают способность модели к анализу полной информации. Кэширование ответов эффективно для одинаковых запросов, но не приносит пользы, когда один и тот же контекст используется с различными вопросами.

Внедрение кэширования запросов в Amazon Bedrock помогает решить эту проблему на уровне инфраструктуры, позволяя сохранять части контекста беседы, такие как системные подсказки и документы. Это улучшает производительность и снижает затраты, что делает технологию привлекательной для разработчиков и компаний, работающих с большими объемами данных.

Главное

  • Кэширование запросов может снизить затраты на токены до 90%.
  • Без кэширования отправка 10,000 токенов вместе с 50 вопросами приводит к затратам в 500,000 токенов.
  • Существуют три основных метода оптимизации: сокращение длины запросов, уменьшение контекстных окон и кэширование на уровне приложения.

Упомянуто

Персоны

Важное из дайджеста

Открыть полный дайджест →