Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Новый бенчмарк PRACT-120 для оценки ИИ-чатов

В области искусственного интеллекта был представлен новый бенчмарк PRACT-120, предназначенный для оценки ИИ-чатов. В отличие от существующих тестов, таких как MMLU и GPQA, PRACT-120 учитывает не только показатели модели, но и множество других факторов, влияющих на эффективность чата, включая инструменты, память и контекст.

Традиционные бенчмарки, такие как HumanEval и LMSYS Arena, предоставляют полезные цифры, но не дают полного представления о том, насколько хорошо чат справляется с задачами в реальных условиях. PRACT-120 призван устранить этот пробел, предлагая более комплексный подход к оценке ИИ-чатов.

Внедрение PRACT-120 может оказать значительное влияние на выбор ИИ-чатов для бизнеса и пользователей, так как он предоставляет более полное понимание возможностей и ограничений различных систем. Это может помочь разработчикам улучшить свои продукты, а пользователям — принимать более обоснованные решения.

Главное

  • PRACT-120 — новый бенчмарк для оценки ИИ-чатов.
  • Тесты, такие как MMLU и GPQA, не учитывают все аспекты чата.
  • PRACT-120 включает инструменты, память и контекст в свою оценку.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →