ИИ для финансов и управления

Как проверять ответы ИИ: ошибки, галлюцинации и риски для финансиста

Как проверять ответы ИИ: ошибки, галлюцинации и риски для финансиста

Нейросеть может придумать факт, неверно прочитать таблицу или заменить формулу числом. Разбираем ошибки ИИ в финансовых задачах и способы снижения рисков.
Сегодня вопрос об использовании искусственного интеллекта в финансах уже не стоит в плоскости «внедрять или нет». По данным Gartner, к 2027 году ИИ-агенты будут дополнять или автоматизировать 50% бизнес-решений [1]. Вопрос звучит иначе: как использовать ИИ корректно, не попадая в ловушку слепого доверия?

В отличие от традиционных IT-систем, которые либо работают по жёсткому алгоритму, либо выдают ошибку кода, языковые модели (LLM) — это вероятностные системы. Они могут выдать связный, уверенный и полностью выдуманный ответ.

Сегодня разберём, как именно ошибаются современные нейросети, почему финансовая сфера находится в зоне повышенного риска, и какие практические шаги помогут вам защитить свои данные и решения.

Как правильно читать статистику об ошибках ИИ

Если вы читаете новости про ИИ, то наверняка сталкивались с противоречивыми заголовками. В одном исследовании пишут, что уровень галлюцинаций у моделей составляет меньше 1%, а в другом — что ИИ ошибается в 80% случаев. Как такое возможно?

Дело в том, что «процент ошибок» всегда привязан к конкретному методу измерения (бенчмарку) и типу задачи. Цифры нельзя интерпретировать как «ИИ ошибается в X% всех случаев жизни».

Вот три важных ограничения, которые нужно учитывать:

  • Разные задачи дают разный уровень ошибок. Vectara Hallucination Leaderboard измеряет, насколько точно модель пересказывает информацию из предоставленного ей документа, не добавляя фактов, которых в источнике нет. На первоначальном наборе коротких текстов Gemini 2.0 Flash показывал уровень галлюцинаций всего 0,7%. Однако новый, более сложный benchmark Vectara включает более 7 700 документов длиной до 24 000 слов из бизнеса, права, медицины, науки и других областей. На нем даже сильные модели показывают заметно более высокий уровень галлюцинаций: у лидеров около 1,8–3,3%, а у ряда передовых моделей показатель превышает 10%. Например, Gemini 3 Pro Preview показывает 13,6%.[2].

  • Уверенный ответ еще не означает правильный. В AA-Omniscience GPT-5.5 показал 57% фактической точности, но 86% уровня галлюцинаций: когда модель не знала правильного ответа, она значительно чаще пыталась ответить и ошибалась, чем признавала неопределённость [3].

  • Безопасность не равна правильности. Модель может написать синтаксически безупречный код для макроса, который при этом будет содержать критическую уязвимость безопасности.

Поэтому, когда мы говорим об ошибках ИИ, важно смотреть не на среднюю температуру по больнице, а на конкретные классы сбоев.

Текущий модельный ряд нейросетей

Прежде чем разбирать ошибки, полезно понимать, о каких именно моделях идёт речь. На август 2026 года актуальный модельный ряд выглядит так:
Разработчик
Актуальные модели
OpenAI
GPT-5.5, GPT-5.6 Sol / Terra / Luna (флагман, июль 2026)
Anthropic
Claude Sonnet 5, Claude Opus 5 (выпущен 24 июля 2026)
Google
Gemini 2.5 Pro, Gemini 3.5 Flash, Gemini 3.6 Flash (июль 2026)
Важно понимать: даже новейшие модели не свободны от описанных ниже ошибок. Улучшение бенчмарков не означает исчезновения рисков — оно означает лишь смещение границы ошибок в другую зону.

Основные типы ошибок: таксономия рисков

Опираясь на профиль рисков Национального института стандартов и технологий США (NIST) [4] и свежие исследования 2025–2026 годов, можно выделить пять основных классов ошибок, критичных для бизнеса.

Класс ошибки
Описание
Пример
Фактические галлюцинации
Модель уверенно выдаёт выдуманные цифры, даты или факты.
ИИ придумывает несуществующий пункт в Налоговом кодексе или уверенно называет неверную ставку рефинансирования. [5]
Ошибки источников и атрибуции
ИИ связывает ответ с источником, который не существует или не подтверждает написанное.
Нейросеть даёт блестящий анализ рынка и ссылается на выдуманный отчёт (с неработающим URL). Аудит 2,5 млн биомедицинских статей в The Lancet показал: доля публикаций с выдуманными ссылками выросла с1 на 2828 статей в 2023 году до 1 на 277 в начале 2026 года [6].
Математические и логические сбои
ИИ может нарушить саму процедуру расчета, даже когда исходные данные и алгоритм заданы корректно.
Ошибка в расчёте сложного процента или потеря одного из условий при расчёте налоговой базы. При работе с длинной последовательностью вычислений (более 5 шагов)точность падает с 63% до 20% (на цепочке из 95 шагов) [14]
Ошибки при построении диаграмм
Даже современные ведущие модели часто не способны точно воспроизвести сложные диаграммы
Неверный тип диаграммы, неправильная компоновка, наложение текста и легенд, искаженные пропорции, перегруженность элементов и даже полностью пустой результат [7]
Деградация в длинных агентных цепочках/цепочках последовательных действий
В сложных многошаговых задачах с одним и тем же документом ИИ постепенно начинает незаметно искажать исходный документ.
Вы дали ИИ реестр операций и последовательно попросили: разбить его по категориям, пересчитать валюту, изменить классификацию, объединить обратно, добавить новые поля, исправить категории. Каждая отдельная операция выглядит небольшой. Исследование показывает, что ошибки накапливаются от шага к шагу, и через длинную цепочку часть исходной информации может быть изменена, потеряна или неверно преобразована. [8].
Финансовая сфера — зона особого риска

Для финансов, юриспруденции и медицины цена ошибки несоизмеримо выше, чем в маркетинге или копирайтинге. Если ИИ напишет неудачный пост для соцсетей, компания потеряет несколько лайков. Если ИИ ошибётся в финансовой модели, компания может потерять миллионы.

Данные Suprmind за март–апрель 2026 года показывают высокий уровень расхождения между ведущими ИИ-моделями в финансовых задачах: при анализе 258 реальных финансовых запросов содержательные расхождения между моделями возникали в 72,1% случаев, что стало самым высоким показателем среди десяти исследованных профессиональных областей. [9]. Это означает, что если вы дадите одну и ту же сложную финансовую задачу нескольким разным нейросетям, с огромной вероятностью они выдадут разные ответы.

При этом даже топовые модели сталкиваются с конкретным узким местом: по данным Excel Modeling Benchmark (Vals AI, август 2026), лидирующие модели (Claude Fable 5, GPT-5.6 Sol) набирают 72–74% общей точности при построении финансовых моделей, однако проходят лишь 60–65% числовых проверок [10]. Формулы и форматирование они воспроизводят значительно лучше, чем конкретные числовые значения.

Главная опасность кроется в скрытых ошибках. Когда ИИ пишет откровенную чушь, человек это сразу замечает. Но когда нейросеть анализирует массивную таблицу и незаметно ошибается в одной ячейке или подменяет формулу статичным значением — это может пройти мимо внимания проверяющего и попасть в итоговый отчёт для совета директоров.

Как снизить риски: 5 практических шагов

Полностью устранить ошибки ИИ на текущем этапе развития технологий невозможно. Но ими можно и нужно управлять. Вот пять стратегий, которые доказали свою эффективность.

  • Используйте проверенные источники вместо памяти модели.

Для задач, где важны факты, цифры и нормативные данные, давайте ИИ конкретные источники и требуйте строить ответ только на них. RAG и другие методы привязки ответа к источникам существенно снижают риск фактических галлюцинаций, но не гарантируют их отсутствие. Поэтому каждый существенный вывод должен быть проверяем по исходному документу.[11].

  • Проверяйте каждый вывод по первоисточнику

После получения ответа запустите отдельную проверку:
«Проверь каждое существенное утверждение предыдущего ответа по исходным документам. Для каждого укажи: подтверждается / противоречит / недостаточно данных. Приведи доказательство из источника. Если подтверждения нет, исключи утверждение из финального ответа».
Исследования 2026 года показывают, что проверка отдельных утверждений по исходному контексту заметно повышает качество обнаружения галлюцинаций. [13]
  • Ограничивайте права и длину автономных действий ИИ-агентов

Давайте агенту доступ только к необходимым папкам, файлам и сервисам. Для критических операций используйте подтверждение человеком перед записью, удалением, отправкой или изменением данных. Не поручайте агенту длинную цепочку преобразований без промежуточных контрольных точек: исследования 2026 года показывают, что ошибки при последовательном редактировании документов накапливаются. [8]

  • Проверяйте расчеты исполнением, а код — тестами
Если ИИ рассчитывает финансовый показатель, результат должен быть воспроизводим в Excel, Python, SQL или другой расчетной системе. Просите ИИ создавать формулы или код, которые можно выполнить и проверить, вместо того чтобы принимать число, рассчитанное моделью «в голове». Для сгенерированного кода дополнительно нужна проверка безопасности: исследование Veracode 2026 года более чем на 150 моделях показало, что только 55% заданий приводили к безопасному коду, а в 45% случаев появлялась известная уязвимость. При этом синтаксическая корректность уже превышала 95%. [12]

  • Оставляйте человеку контроль над критическими решениями

Для финансовой отчетности, платежей, налоговых выводов, инвестиционных решений и других задач с высокой ценой ошибки заранее определите, что ИИ может сделать самостоятельно, а что требует проверки и подтверждения человеком. Такой подход соответствует принципам управления рисками NIST для генеративного ИИ: уровень человеческого контроля должен зависеть от последствий возможной ошибки. [4]

Заключение
Искусственный интеллект — это мощный рычаг, который уже сейчас экономит финансистам сотни часов рутинной работы. Но этот рычаг требует твёрдой руки.

Ошибки, галлюцинации и логические сбои — это не повод отказываться от технологий. Это повод выстраивать грамотные рабочие процессы: с чёткой постановкой задач, жёстким ограничением контекста (RAG) и обязательной верификацией результатов. Управление рисками — это то, что финансисты умеют делать лучше всего. Пришло время применить этот навык к искусственному интеллекту.

Источники:
[1] Gartner. (2025). AI Agents Will Drive Half of Decisions by 2027. URL: https://technologymagazine.com/articles/gartner-ai-agents-will-drive-half-of-decisions-by-2027

[2] Vectara. Hallucination Leaderboard. Updated May 11, 2026.
https://github.com/vectara/hallucination-leaderboard

[3] Artificial Analysis. (2026). AA-Omniscience: Knowledge and Hallucination Benchmark; GPT-5.5 evaluation, April 23, 2026. https://artificialanalysis.ai/evaluations/omniscience

[4] NIST. (2026). Artificial Intelligence Risk Management Framework: Generative AI Profile. https://www.nist.gov/itl/ai-risk-management-framework

[5] Michael N. et al. “Confidence Calibration in Large Language Models”, 3 апреля 2026 года. https://arxiv.org/abs/2605.23909

[6] The Lancet. (2026). Аудит биомедицинских публикаций: рост выдуманных ссылок. https://www.thelancet.com/journals/lancet/article/PIIS0140-6736%2826%2900603-3/fulltext

[7] RealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluation, 26 марта 2026 года. https://arxiv.org/pdf/2603.25804

[8] Microsoft Research. (2026). DELEGATE-52: LLMs Corrupt Your Documents When You Delegate. URL: https://arxiv.org/html/2604.15597v1

[9] Suprmind Multi-Model Divergence Index, April 2026 Edition. The AI Confidence Trap:When Confident AI Answers Don't Survive Multi-Model Review. https://suprmind.ai/hub/multi-model-ai-divergence-index/

[10] Vals AI. (2026). Excel Modeling Benchmark. https://www.vals.ai/benchmarks/emb

[11] Alansari et al. “Large Language Models Hallucination: A Comprehensive Survey”, версия от 18 марта 2026 года. https://arxiv.org/pdf/2510.06265

[12] Veracode. (2025–2026). GenAI Code Security Report. URL: https://www.veracode.com/blog/spring-2026-genai-code-security/

[13] Retromorphic Testing with Hierarchical Verification for Hallucination Detection in RAG Pipelines. 29 марта 2026. URL: https://arxiv.org/pdf/2603.27752

[14] When LLMs Stop Following Steps: A Diagnostic Study of Arithmetic Procedural Execution, 2026.https://arxiv.org/abs/2605.00817
2026-08-08 12:10