В ходе сорока раундов ревью кода skillmem два искусственных интеллекта, Claude и GPT, выявили множество ошибок, несмотря на то, что код ранее уже проходил проверку. Обе модели работали независимо, но их результаты показали, что каждая следующая правка кода порождала новые регрессии, которые фиксировались в последующих раундах ревью.
Основной вывод из проведенного анализа заключается в том, что даже код, который ранее считался чистым, может содержать скрытые проблемы, которые не были обнаружены в ходе первоначального ревью. Это подчеркивает важность многократной проверки кода, особенно в условиях, когда исправления могут привести к новым ошибкам.
Эти результаты поднимают вопросы о надежности текущих методов ревью кода и о том, как можно улучшить процессы проверки, чтобы минимизировать количество ошибок. Использование ИИ в таких процессах может стать важным шагом к повышению качества программного обеспечения и снижению числа регрессий.