Галлюцинации нейросети: почему она врёт уверенно и как это ловить


Галлюцинацией называют ответ, который выглядит правдоподобно и при этом неверен. Не «модель ошиблась в расчёте», а «модель сослалась на статью, которой не существует», причём с номером, годом и фамилиями авторов.
Разберём, откуда это берётся, где особенно опасно и что реально снижает риск.
Почему это происходит
Модель не хранит факты как справочник. Она предсказывает следующее слово, опираясь на то, как устроены тексты, на которых её учили.
Когда точных данных нет, предсказание всё равно происходит — просто оно опирается на форму, а не на содержание. Получается текст, похожий на правильный ответ: с той же структурой, тем же тоном и той же уверенностью.
Отсюда главное свойство галлюцинаций: они не выглядят как ошибка. У модели нет отдельного состояния «я не знаю», которое проявлялось бы в интонации.
Что чаще всего выдумывается
Ссылки и источники. Номера статей законов, судебные дела, научные публикации, страницы книг. Самая известная и самая дорогая категория.
Цифры. Проценты, даты, объёмы, цены. Особенно если вы попросили «примерно».
Цитаты. Приписанные реальным людям слова, которых они не говорили.
Названия функций и команд. При работе с кодом модель уверенно предлагает методы, которых в библиотеке нет.
Детали о малоизвестном. Чем реже тема встречалась в обучении, тем выше вероятность красивой выдумки.
Где это опаснее всего
Право и медицина. Цена ошибки максимальная, а формат ответа особенно располагает к доверию.
Финансы и отчётность. Выдуманная норма или ставка обнаруживается на проверке.
Всё, что уходит наружу без вычитки: рассылки, карточки товаров, тексты на сайте.
Наименее опасно там, где вы и так проверяете результат глазами: черновики, идеи, варианты формулировок.
Что снижает риск
Дайте свои данные. Модель, работающая с приложенным документом, выдумывает на порядок реже, чем отвечающая по памяти.
Спрашивайте, где посмотреть, а не «как правильно». Список того, что нужно проверить, полезнее готового ответа.
Требуйте указывать источник у каждого утверждения. Если источник не назван, считайте утверждение непроверенным.
Разрешите не знать. Прямая инструкция «если данных нет, напиши, что не знаешь» заметно уменьшает выдумки.
Задавайте вопрос дважды в разных формулировках. Расхождение в ответах — сигнал, что модель не уверена.
Сужайте задачу. Один конкретный вопрос надёжнее, чем «расскажи всё по теме».
Проверяйте цифры и имена всегда. Это не паранойя, а единственное, что не делегируется.
Помогает ли поиск в интернете
Заметно, но не полностью. С доступом к поиску модель опирается на найденные страницы, и число выдуманных фактов падает.
Появляется другая проблема: качество источника. Модель не всегда отличает справочник от чужого блога с ошибкой.
Поэтому ссылки, которые она приводит, всё равно стоит открыть. Иногда выясняется, что страница есть, а утверждения в ней нет.
Как это выглядит на практике
Попросите список литературы по узкой теме — и половина позиций окажется несуществующей, но оформленной безупречно.
Спросите про малоизвестный закон — получите номер статьи, который относится к другому вопросу.
Уточните характеристику редкого товара — увидите правдоподобные цифры, взятые у похожей модели.
Во всех трёх случаях ответ звучит одинаково уверенно с правильным.
Станет ли лучше
Постепенно да: новые модели ошибаются реже, а инструменты вроде поиска и работы с вашими документами снимают часть проблемы.
Полностью это не исчезнет, потому что вытекает из принципа работы: модель порождает правдоподобное продолжение, а не сверяется с базой фактов.
Практический вывод простой: относитесь к ответу как к черновику знающего, но невнимательного помощника. Идею берите, факты проверяйте.
Где это почти не мешает
В задачах, где вы сами эксперт и видите ошибку сразу.
В генерации вариантов: из двадцати заголовков вы всё равно выбираете руками.
В переписывании готового текста — там фактура ваша, и выдумывать нечего.
Именно поэтому в работе с текстами для соцсетей риск невысок: вы подставляете свои цифры и условия. Как выстроить это на потоке, мы разбирали в материале про то, что нейросеть умеет и где врёт при написании постов.


