Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Исследование HarnessDev: возможности LLM в создании собственных агентских хранилищ

HarnessDev, инициатива исследовательской группы из ByteDance Seed, Сингапурского университета технологий и дизайна и других организаций, изучает, как языковые модели (LLM) могут создавать собственные агентские хранилища. В отличие от традиционных подходов, где фиксируется код, исследование фокусируется на создании исполняемого хранилища, которое модель генерирует сама. В рамках эксперимента было установлено, что GPT-5 решает 35,2% задач в Terminus 2 и 49,6% в Codex CLI при одинаковых весах.

Проект HarnessDev включает два этапа: создание и эволюция. На этапе создания каждый участник получает одинаковый начальный набор инструментов и задания, что позволяет изучить, как модели справляются с задачами без предварительной настройки. В результате, без модификаций, модель показывает нулевые результаты, однако после создания полного хранилища результаты могут улучшаться.

Это исследование имеет значение для дальнейшего развития технологий, связанных с языковыми моделями и их применением в различных областях. Понимание того, как LLM могут адаптироваться и создавать собственные инструменты, открывает новые горизонты для автоматизации и улучшения процессов разработки программного обеспечения.

Главное

  • GPT-5 решает 35,2% задач в Terminus 2 и 49,6% в Codex CLI.
  • Исследование показало, что только 34 из 64 изменений могут обобщаться на новые задачи.
  • Проект HarnessDev включает два этапа: создание и эволюция.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →