20 сентября 2026

btc = 80 545.00$ - 733.72 (-0.90 %)

usd = 84.20 -0.31 (-0.37 %)

eur = 96.67 -0.83 (-0.85 %)

cny = 12.57 -0.01 (-0.09 %)

moex = 2 262.13 пт. -15.93 (-0.70 %)

btc = 80 545.00$ - 733.72 (-0.90 %)

usd = 84.20 -0.31 (-0.37 %)

Исследование: ChatGPT, Claude и Gemini ошибаются в 57% ответов на финансовые вопросы

2 минуты на чтение
Исследование: ChatGPT, Claude и Gemini ошибаются в 57% ответов на финансовые вопросы

Читайте в Telegram

|

Популярные ИИ-модели в среднем ошибались в 57% ответов на вопросы о личных финансах, следует из исследования финтех-компании Saturn.

Авторы протестировали 18 моделей, включая ChatGPT, Claude, Gemini, Copilot и Grok, на 121 вопросе о пенсиях, налогах, долгах и сбережениях. Каждый вопрос задавали по пять раз, чтобы проверить стабильность ответов; всего исследователи получили более 10 000 ответов.

На более сложных задачах, требующих нескольких расчётов, средняя доля ошибок достигла 88%. Отдельные модели неправильно отвечали на 99% таких вопросов, пишет Financial Times.

При оценке исследователи засчитывали ответ как ошибочный не только при неверных расчётах или фактах. Незачёт также ставили, если модель пропускала существенные детали или важные предупреждения. По данным Saturn, чат-боты ошибались в вычислениях, игнорировали предстоящие изменения налогового законодательства и иногда придумывали несуществующие правила.

Исследование: ChatGPT, Claude и Gemini ошибаются в 57% ответов на финансовые вопросы
  • Хуже всего среди приведённых в отчёте результатов выступила Claude Haiku 4.5 — ошибки нашли в 82% её ответов;
  • Gemini 3.1 Pro ошибалась в 73% случаев;
  • Grok 4.5 — в 59%;
  • GPT-5.6 Luna — в 58%.

Самой точной оказалась Claude Opus 5 в режиме рассуждений, но и у неё ошибочными признали 39% ответов.

Бесплатные модели в среднем ошибались чаще платных — в 63% случаев против 49%. На самых сложных вопросах доля неверных ответов бесплатных моделей достигала 93%.

В одном из примеров Claude Haiku 4.5 неверно объяснила правила налогообложения пенсий в Великобритании. По оценке Saturn, если бы пользователь последовал совету модели, это могло привести к дополнительному налоговому платежу на 17 500 фунтов. В другом случае Claude придумала правило, согласно которому выпускник может перестать выплачивать студенческий кредит после переезда за границу.

Исследователи также обнаружили ошибки в рекомендациях людям с долгами. Некоторые модели советовали в первую очередь погашать задолженность с самой высокой процентной ставкой, не учитывая приоритетные платежи вроде аренды жилья и муниципального налога.

Saturn сама разрабатывает ИИ-инструменты для финансовых консультантов и выступает за регулирование финансовых советов универсальных чат-ботов. Поэтому результаты отражают методику и критерии оценки самой компании.


В июне «Код.ру» писал, что 76% опрошенных россиян готовы доверить ИИ управление средствами на вкладах и накопительных счетах. Ещё 69% были готовы поручить алгоритмам распределение ежемесячных расходов, а 63% — инвестиции.

Ранее OpenAI заявила, что GPT-5.5 Instant стала реже «галлюцинировать» в чувствительных областях, включая финансы, медицину и юриспруденцию.

Обсудить
Блоги 941
SpeShu.AI
Softline
OTP Bank
билайн
Слетать.ру
Т-Банк
StudyAI
VK
ВТБ
Газпромбанк

Кодик

Привет!

Я — Кодик, твой персональный ИИ-агент для поиска информации по «Код.ру» на базе Yandex AI Studio. Я могу быстро найти на сайте нужную тему, порекомендовать похожие материалы или объяснить сложный термин — и в целом поделиться знаниями о науке и технологиях. Задай вопрос или начни с одного из предложенных вариантов.