Компания Anthropic представила новый плагин evals для Claude Code, который позволяет оценивать производительность плагинов. Этот инструмент запускает плагин против реалистичных запросов, оценивает результаты и сравнивает их с выполнением без загруженного плагина. Плагин отвечает на три ключевых вопроса, которые ранее не могли быть измерены: активируется ли навык, сохраняется ли он после редактирования или обновления модели, и превосходит ли он базовую модель.
Плагин evals доступен для использования с Claude Code версии 2.1.269 и выше. Он работает с любым каталогом, содержащим файл manifest plugin.json или .claude-plugin/plugin.json. Каждый запуск оценки и оценка являются реальными вызовами модели, которые учитываются в вашем плане или API-аккаунте. Структура оценочного набора включает подкаталог с запросами и папку с оценщиками.
Внедрение такого инструмента может значительно упростить процесс разработки и тестирования плагинов, предоставляя разработчикам необходимые метрики для улучшения их работы. Это также может способствовать более качественному взаимодействию с пользователями, так как позволяет оценивать и оптимизировать навыки в реальных условиях.