Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Настройка обвязки для модели GigaChat: достижения команды GigaChain

Команда GigaChain поделилась опытом настройки обвязки (harness) для модели GigaChat, предназначенной для Deep Agents. В процессе работы они внесли изменения в промпты и описания инструментов, а также интегрировали часть правил непосредственно в код. Это позволило создать открытый бенчмарк harness-bench-fast для измерения прогресса.

На тестовом наборе из 391 задачи подключение профиля GigaChat привело к увеличению доли решённых задач с 77,2% до 87,0%. Кроме того, команда отметила, что расход токенов сократился почти вдвое, что является значительным достижением для повышения эффективности модели.

Эти результаты подчеркивают важность итеративного подхода в разработке ИИ-моделей и могут стать основой для дальнейших исследований и улучшений в области обработки естественного языка. Открытый бенчмарк также может быть полезен другим исследователям и разработчикам, стремящимся оптимизировать свои модели.

Главное

  • Подключение профиля GigaChat увеличило долю решённых задач с 77,2% до 87,0%.
  • Расход токенов сократился практически вдвое.
  • В тестировании использовался набор из 391 задачи.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →