Компания Prime Intellect анонсировала запуск Prime Inference, платформы для обслуживания открытых моделей. Она предлагает серверные конечные точки и резервированные мощности на собственных GPU компании, расположенных в нескольких дата-центрах. Перед публичным релизом Prime Inference обрабатывала почти триллион токенов в день, что стало возможным благодаря внутренним процессам, таким как RL-роллоты и генерация синтетических данных.
Prime Inference представляет собой слой обслуживания в открытой обучающей системе Prime Intellect. Компания уже предлагает инструменты после обучения, такие как prime-rl, проверяющие механизмы и песочницы. Обслуживание завершает цикл: развернутые модели генерируют производственные данные, которые могут быть использованы для обратной связи в обучении. Prime сообщает, что их GLM-5.3 конечная точка занимает одно из первых мест по скорости на OpenRouter.
Запуск Prime Inference важен для разработчиков, так как платформа совместима с OpenAI SDK и предлагает два режима работы: серверные конечные точки для переменного спроса и резервированные мощности для устойчивых нагрузок. Это может значительно упростить интеграцию и использование открытых моделей в различных приложениях.