Phys.org00:00Исследование раскрывает механизм передачи малярийного паразита при стрессовых условияхBitcoin.com News22:20Fidelity способствует росту Bitcoin ETF на 433 миллиона долларовPhys.org22:20Двухцветный свет управляет электронами через временное топологическое состояние графенаOilPrice22:00Великобритания планирует обновление электросети на £150 миллиардов для поддержки возобновляемой энергетикиOilPrice20:00Международное агентство по атомной энергии утроило прогноз по ядерной энергетикеOilPrice18:00ООН предупреждает о необходимости подготовки к жизни при температуре выше 1.5°CVademecum11:17Российские вузы развивают новые подходы к диагностике и лечению ракаRenewEconomy08:18Возобновляемые источники энергии впервые обеспечили более 80% потребностей сетиThe Guardian Environment08:00Европа сталкивается с последствиями климатического кризиса после летнего сезонаMMA Mania02:37UFC 331: Ремatch за титул в легчайшем весе между Джошуа Ваном и Александром Пантожей

vestka

Сравнение моделей LLM на едином харнесе: результаты тестирования

В статье Максим Чичев, руководитель разработки платформенных решений в Петрович-Тех, делится результатами тестирования трех языковых моделей (LLM) на едином харнесе. Модели были протестированы на агентных задачах длиной 2, 3 и 15 шагов, что позволило оценить их производительность в различных условиях.

Автор отмечает, что на коротких задачах все три модели показывали схожие результаты, однако на длинных цепочках тезис о том, что "харнесс важнее модели", перестает работать. Это подчеркивает важность выбора как харнеса, так и модели в зависимости от специфики задач.

Данное исследование может быть полезным для разработчиков и исследователей в области искусственного интеллекта, так как оно поднимает вопросы о том, как правильно оценивать и выбирать модели для различных приложений. Результаты тестирования могут способствовать более глубокому пониманию взаимодействия между харнесом и моделями в контексте их применения.

Главное

  • Тестирование проводилось на трех LLM разных весовых категорий.
  • Задачи имели длину 2, 3 и 15 шагов.
  • На длинных задачах эффективность моделей различается.

Персоны

  • МЧ
    Максим Чичев

    Руководитель разработки платформенных решений, Петрович-Тех

    «Харнесс важнее модели»

Важное из дайджеста

Открыть полный дайджест →