В ходе тестирования различных харнессов для модели DeepSeek V4 Flash было проведено сравнение четырех популярных моделей. Харнес Koda продемонстрировал наилучшие результаты, набрав 52,2%, что позволило ему опередить такие модели, как Kilocode, Claude Code и OpenCode.
Эксперимент был организован для выяснения причин, по которым одна и та же модель может показывать разные результаты в зависимости от используемого харнесса. В статье подробно рассматриваются методики замеров и факторы, влияющие на эффективность работы агентов, использующих различные харнессы.
Значимость данного тестирования заключается в том, что результаты могут помочь разработчикам и пользователям моделей DeepSeek V4 Flash выбрать наиболее эффективный харнес для решения реальных задач. Это, в свою очередь, может повысить производительность и качество работы системы в целом.