Модель Claude Sonnet 5.5 успешно обыграла более старшие модели Opus 5.5 и Fable 5.1 в пошаговой стратегии, где игроки должны строить экономику, вести войны и принимать стратегические решения. Эксперимент проводился с конца августа по начало октября 2026 года, в ходе которого модели играли друг против друга, чтобы оценить их игровые навыки и соответствие общепризнанным бенчмаркам.
Разработчик «Стратегикона» организовал серию партий между LLM-агентами, чтобы проанализировать, как современные языковые модели справляются с комплексными игровыми задачами. Результаты показали, что Claude Sonnet 5.5 не только справилась с игровыми механиками, но и продемонстрировала стратегическое мышление, что может свидетельствовать о её высоком уровне развития.
Данное исследование имеет значение для дальнейшего развития искусственного интеллекта в области игр и может помочь в создании более совершенных моделей. Успех Claude Sonnet 5.5 также подчеркивает важность тестирования языковых моделей в различных контекстах, что может привести к улучшению их функциональности и применимости в реальных сценариях.