Исследование: ChatGPT, Claude и Gemini ошибаются в 57% ответов на финансовые вопросы

Популярные ИИ-модели в среднем ошибались в 57% ответов на вопросы о личных финансах, следует из исследования финтех-компании Saturn.
Авторы протестировали 18 моделей, включая ChatGPT, Claude, Gemini, Copilot и Grok, на 121 вопросе о пенсиях, налогах, долгах и сбережениях. Каждый вопрос задавали по пять раз, чтобы проверить стабильность ответов; всего исследователи получили более 10 000 ответов.
На более сложных задачах, требующих нескольких расчётов, средняя доля ошибок достигла 88%. Отдельные модели неправильно отвечали на 99% таких вопросов, пишет Financial Times.
При оценке исследователи засчитывали ответ как ошибочный не только при неверных расчётах или фактах. Незачёт также ставили, если модель пропускала существенные детали или важные предупреждения. По данным Saturn, чат-боты ошибались в вычислениях, игнорировали предстоящие изменения налогового законодательства и иногда придумывали несуществующие правила.
- Хуже всего среди приведённых в отчёте результатов выступила Claude Haiku 4.5 — ошибки нашли в 82% её ответов;
- Gemini 3.1 Pro ошибалась в 73% случаев;
- Grok 4.5 — в 59%;
- GPT-5.6 Luna — в 58%.
Самой точной оказалась Claude Opus 5 в режиме рассуждений, но и у неё ошибочными признали 39% ответов.
Бесплатные модели в среднем ошибались чаще платных — в 63% случаев против 49%. На самых сложных вопросах доля неверных ответов бесплатных моделей достигала 93%.
В одном из примеров Claude Haiku 4.5 неверно объяснила правила налогообложения пенсий в Великобритании. По оценке Saturn, если бы пользователь последовал совету модели, это могло привести к дополнительному налоговому платежу на 17 500 фунтов. В другом случае Claude придумала правило, согласно которому выпускник может перестать выплачивать студенческий кредит после переезда за границу.
Исследователи также обнаружили ошибки в рекомендациях людям с долгами. Некоторые модели советовали в первую очередь погашать задолженность с самой высокой процентной ставкой, не учитывая приоритетные платежи вроде аренды жилья и муниципального налога.
Saturn сама разрабатывает ИИ-инструменты для финансовых консультантов и выступает за регулирование финансовых советов универсальных чат-ботов. Поэтому результаты отражают методику и критерии оценки самой компании.
В июне «Код.ру» писал, что 76% опрошенных россиян готовы доверить ИИ управление средствами на вкладах и накопительных счетах. Ещё 69% были готовы поручить алгоритмам распределение ежемесячных расходов, а 63% — инвестиции.
Ранее OpenAI заявила, что GPT-5.5 Instant стала реже «галлюцинировать» в чувствительных областях, включая финансы, медицину и юриспруденцию.