Популярные модели искусственного интеллекта допускают ошибки почти во всех сложных финансовых задачах. К такому выводу пришли исследователи, протестировавшие ChatGPT, Claude, Copilot, Gemini, Grok и другие системы.
Популярные модели искусственного интеллекта допускают ошибки почти во всех сложных финансовых задачах. К такому выводу пришли исследователи, протестировавшие ChatGPT, Claude, Copilot, Gemini, Grok и другие системы.
Компания Saturn проверила работу нейросетей на более чем 100 финансовых вопросах. В среднем модели дали неверные ответы в 57% случаев, а при решении сложных задач уровень ошибок достиг 99%.
Исследователи выяснили, что ИИ нередко ошибается в расчетах, игнорирует изменения законодательства и даже придумывает нормы, которых не существует. Лучше всего нейросети справились с задачами по составлению бюджета. Об этом пишет «Коммерсант» со ссылкой на Financial Times.
«Миллионы людей доверяют моделям искусственного интеллекта в вопросах финансов, но они получают неправильные ответы, из-за которых могут потерять свои деньги», — сказал исполнительный директор Saturn Амаль Джоли.
Лучшую точность в исследовании показала модель Claude Opus 5 в режиме рассуждений.
🔥 БУХ.СОВЕТ 2027
XII Всероссийская бухгалтерская онлайн-конференция
Не пропустите главное событие декабря для бухгалтеров — 10–11 декабря 2026 года.
За два дня разберём все важные изменения 2027 года в учёте, налогах и работе бухгалтера. Вместо того, чтобы тратить недели на поиск информации о новых правилах — просто регистрируйтесь на бесплатный эфир.
Практикующие эксперты расскажут о реальных спорах, проверках и сложных вопросах учёта. Вы сможете задать им вопросы прямо во время эфира.
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Saturn: ИИ-модели ошиблись в 88% случаях при выполнении сложных финансовых задач | 0 | 19.54 | 21-09-2026 |
| 2 | ИИ вам врет всегда. ChatGPT, Claude, Grok допускают ошибки в финансовых советах в 99% случаев | 0 | 10.41 | 21-09-2026 |
| 3 | ИИ вам врет всегда. ChatGPT, Claude, Grok допускают ошибки в финансовых советах в 99% случаев | 0 | 10.41 | 21-09-2026 |
| 4 | Saturn: ИИ дает неверные финансовые советы в 57% случаев | 0 | 13.54 | 20-09-2026 |
| 5 | ИИ ошибается в 99% случаев при ответах на сложные финансовые вопросы | 0 | 17.42 | 21-09-2026 |
| 6 | Банки увидели угрозу в новых ИИ-моделях вроде Claude | -2 | 7 | 17-04-2026 |
| 7 | ИИ-модели Claude взламывали системы компаний из-за ошибки в настройках | 0 | 14.05 | 31-07-2026 |
| 8 | Новая модель ИИ взломала три компании во время тестирования в США | 0 | 4.49 | 19-09-2026 |
| 9 | Нейросеть Google Gemini самостоятельно проникла в системы трех компаний | 1 | 6.4 | 19-09-2026 |