TensorRT-LLM
Последние новости и упоминания на vestka
- Оптимизация работы с большими языковыми моделями на Amazon SageMaker
Amazon SageMaker представил новый подход к снижению задержки обработки запросов в больших языковых моделях с помощью маршрутизации с учетом префиксов. Это позволяет значительно ускорить работу приложений, использующих LLM, за счет кэширования ранее вычисленных данных.