HarnessDev, инициатива исследовательской группы из ByteDance Seed, Сингапурского университета технологий и дизайна и других организаций, изучает, как языковые модели (LLM) могут создавать собственные агентские хранилища. В отличие от традиционных подходов, где фиксируется код, исследование фокусируется на создании исполняемого хранилища, которое модель генерирует сама. В рамках эксперимента было установлено, что GPT-5 решает 35,2% задач в Terminus 2 и 49,6% в Codex CLI при одинаковых весах.
Проект HarnessDev включает два этапа: создание и эволюция. На этапе создания каждый участник получает одинаковый начальный набор инструментов и задания, что позволяет изучить, как модели справляются с задачами без предварительной настройки. В результате, без модификаций, модель показывает нулевые результаты, однако после создания полного хранилища результаты могут улучшаться.
Это исследование имеет значение для дальнейшего развития технологий, связанных с языковыми моделями и их применением в различных областях. Понимание того, как LLM могут адаптироваться и создавать собственные инструменты, открывает новые горизонты для автоматизации и улучшения процессов разработки программного обеспечения.