В недавнем эксперименте была проведена оценка трех способов подключения языковой модели (LLM) к базе данных, состоящей из 253 таблиц. Участники споры о том, какой метод выбрать, сосредоточились на использовании MCP-инструментов или схемы в промте. Бенчмарк, основанный на 29 реальных вопросах аналитиков, позволил оценить выполнение задач по точности, затратам и латентности.
Неожиданно, победил метод, который не пользовался популярностью среди участников, а больше всего ошибок допустил составитель бенчмарка. В процессе эксперимента одна из моделей трижды исправила ошибки, допущенные человеком. Внутри исследования были представлены таблицы с цифрами и выявлены четыре дефекта харнесса, которые давали правдоподобные, но неверные результаты.
Это исследование подчеркивает важность тщательной проверки подходов к интеграции LLM в сложные базы данных. Полученные результаты могут оказать влияние на выбор методов подключения в будущих проектах, а также на подходы к тестированию и валидации в области искусственного интеллекта.