В ходе тестирования ИИ-ассистентов Алисы и Гигачата были использованы пять бенчмарков: τ³, ПРАКТ-120, MultiChallenge, WildBench и Arena-Hard. Процесс тестирования занял около двух недель, в течение которых автор столкнулся с различными техническими трудностями, включая необходимость в доработках и ожидании завершения тестов.
Каждый из бенчмарков был выбран для оценки различных аспектов работы ИИ, таких как скорость обработки запросов и качество ответов. Результаты тестирования позволили выявить сильные и слабые стороны каждого из ассистентов, что может быть полезно для пользователей, выбирающих между ними.
Данное сравнение важно для понимания текущих возможностей ИИ-ассистентов на российском рынке. Оно также может помочь разработчикам улучшить свои продукты, основываясь на полученных данных и отзывах пользователей.