Исследование, проведенное учеными из UC Berkeley и Arena, обнаружило, что одна и та же модель AI может стоить в пять раз дороже в зависимости от выбора харнесса. Анализ семи моделей, включая Claude Code и Codex CLI, показал, что на двух бенчмарках средняя успешность моделей оставалась почти неизменной, несмотря на изменения в стоимости.
Данные результаты подчеркивают, что простое сравнение coding-агентов по названиям моделей становится неэффективным. Это открытие может повлиять на выбор разработчиков и исследователей, которые стремятся оптимизировать затраты и повысить эффективность своих проектов.
Таким образом, исследование акцентирует внимание на необходимости более детального анализа моделей AI, что может привести к более обоснованным решениям в области разработки и внедрения технологий. Это также может способствовать лучшему пониманию рынка AI и его динамики.