Технологическая компания Saturn провела исследование, в котором оценивались 18 моделей искусственного интеллекта на предмет их способности решать финансовые задачи. В среднем, чат-боты, такие как ChatGPT, Claude, Copilot, Grok и Gemini, давали неверные ответы на 57% запросов. На сложных задачах с несколькими расчетами эта доля ошибок возросла до 88%, а у некоторых моделей достигала 99%.
Лучшей моделью в исследовании оказалась Claude Opus 5, которая, несмотря на свои достижения, все равно ошибалась в 39% случаев. Исследователи протестировали модели на 121 вопросе, что дало более 10 000 ответов, что позволяет сделать вывод о значительных недостатках в способности ИИ решать сложные финансовые задачи.
Эти результаты подчеркивают важность критического подхода к использованию ИИ в финансовом секторе. Несмотря на прогресс в области искусственного интеллекта, его применение в сложных финансовых расчетах требует осторожности и дополнительной проверки, чтобы избежать серьезных ошибок.