Исследование, проведенное финтех-компанией Saturn, показало, что популярные модели ИИ, включая ChatGPT и Gemini, не справляются с вопросами по личным финансам. В ходе тестирования было задано 121 вопрос, на которые было получено более 10,000 ответов. В среднем, модели провалили 57% ответов, а на сложных многошаговых вопросах уровень ошибок достиг 88%.
В ходе исследования было протестировано 18 моделей, как бесплатных, так и платных. Бесплатные модели показали худшие результаты, провалив 63% ответов, в то время как платные версии допустили ошибки в 49% случаев. На самых сложных вопросах бесплатные модели ошибались в 93% случаев. Лидером среди моделей стал Claude Opus 5, который все равно не смог дать правильные ответы в 39% случаев.
Эти результаты подчеркивают необходимость осторожности при использовании чат-ботов для получения финансовых советов. Ошибки, такие как неверные расчеты и упущенные налоговые изменения, могут привести к серьезным последствиям для пользователей. В условиях растущей зависимости потребителей от технологий важно понимать ограничения этих инструментов.