В области искусственного интеллекта был представлен новый бенчмарк PRACT-120, предназначенный для оценки ИИ-чатов. В отличие от существующих тестов, таких как MMLU и GPQA, PRACT-120 учитывает не только показатели модели, но и множество других факторов, влияющих на эффективность чата, включая инструменты, память и контекст.
Традиционные бенчмарки, такие как HumanEval и LMSYS Arena, предоставляют полезные цифры, но не дают полного представления о том, насколько хорошо чат справляется с задачами в реальных условиях. PRACT-120 призван устранить этот пробел, предлагая более комплексный подход к оценке ИИ-чатов.
Внедрение PRACT-120 может оказать значительное влияние на выбор ИИ-чатов для бизнеса и пользователей, так как он предоставляет более полное понимание возможностей и ограничений различных систем. Это может помочь разработчикам улучшить свои продукты, а пользователям — принимать более обоснованные решения.