В статье Максим Чичев, руководитель разработки платформенных решений в Петрович-Тех, делится результатами тестирования трех языковых моделей (LLM) на едином харнесе. Модели были протестированы на агентных задачах длиной 2, 3 и 15 шагов, что позволило оценить их производительность в различных условиях.
Автор отмечает, что на коротких задачах все три модели показывали схожие результаты, однако на длинных цепочках тезис о том, что "харнесс важнее модели", перестает работать. Это подчеркивает важность выбора как харнеса, так и модели в зависимости от специфики задач.
Данное исследование может быть полезным для разработчиков и исследователей в области искусственного интеллекта, так как оно поднимает вопросы о том, как правильно оценивать и выбирать модели для различных приложений. Результаты тестирования могут способствовать более глубокому пониманию взаимодействия между харнесом и моделями в контексте их применения.