Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Anthropic представила новый плагин для оценки навыков Claude Code

Компания Anthropic представила новый плагин evals для Claude Code, который позволяет оценивать производительность плагинов. Этот инструмент запускает плагин против реалистичных запросов, оценивает результаты и сравнивает их с выполнением без загруженного плагина. Плагин отвечает на три ключевых вопроса, которые ранее не могли быть измерены: активируется ли навык, сохраняется ли он после редактирования или обновления модели, и превосходит ли он базовую модель.

Плагин evals доступен для использования с Claude Code версии 2.1.269 и выше. Он работает с любым каталогом, содержащим файл manifest plugin.json или .claude-plugin/plugin.json. Каждый запуск оценки и оценка являются реальными вызовами модели, которые учитываются в вашем плане или API-аккаунте. Структура оценочного набора включает подкаталог с запросами и папку с оценщиками.

Внедрение такого инструмента может значительно упростить процесс разработки и тестирования плагинов, предоставляя разработчикам необходимые метрики для улучшения их работы. Это также может способствовать более качественному взаимодействию с пользователями, так как позволяет оценивать и оптимизировать навыки в реальных условиях.

Главное

  • Новый плагин evals позволяет оценивать производительность плагинов Claude Code.
  • Плагин отвечает на три ключевых вопроса о навыках: активация, устойчивость к изменениям и сравнение с базовой моделью.
  • Плагин доступен для Claude Code версии 2.1.269 и выше.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →