В марте 2025 года команда интерпретируемости Anthropic опубликовала работу «On the Biology of a Large Language Model». Исследователи научились строить так называемые графы атрибуции — карты того, какие внутренние признаки модели возбуждают и тормозят друг друга по пути от вопроса к ответу. Грубо говоря, модель просветили рентгеном и посмотрели, какие группы нейронов за что дёргают.
Эта работа показывает, чем является галлюцинация на самом деле. В ассистентской модели по умолчанию активна цепочка отказа. Постоянно. Внутри всегда горит контур «я не могу ответить на этот вопрос» — как ручник, затянутый с завода. И существует отдельная группа признаков, которая срабатывает на знакомые сущности. Узнал имя — отпустил ручник, дальше можно отвечать.
Тут обязательная оговорка. Это вскрытие одной конкретной модели одним методом, и авторы честно пишут, что метод объясняет не всё. У других вендоров тормоза могут быть собраны иначе. Но поведенческий паттерн, который из этой схемы следует, воспроизводится у моделей разных семейств.
Исследователи проверили это на живом примере. Спрашиваем модель про Майкла Баткина — человека, которого они выдумали. Контур «незнакомое имя» активен, тормоз держит, модель честно отвечает: не знаю такого. Всё работает как задумано.
Теперь спрашиваем: какую известную статью написал Андрей Карпатый? Имя громкое, модель его прекрасно знает. Признак «знакомая сущность» вспыхивает и глушит цепочку отказа. Тормоз отпущен, отвечать разрешено. А самого ответа-то в весах нет — и освобождённый генератор выдаёт самое правдоподобное: приписывает Карпатому классическую статью про ImageNet, которую писали совсем другие люди.
Галлюцинация оказалась не избытком фантазии, а осечкой тормоза. Система «знаю я это или нет» сработала на знакомое имя, а не на наличие фактов.
Знакомо звучит? У людей этот механизм называется «что-то такое вертится на языке».
Для разработчиков LLM это открытие меняет постановку задачи. Получается, что чинить надо контур самооценки: механизм, которым модель решает, знает она или узнаёт. И это обнадёживает: у осечки есть конкретное место в схеме. Исследователи показали, что, вручную усиливая и подавляя найденные признаки, можно включать и выключать галлюцинацию на одном и том же вопросе. Рубильник нащупан, но до безотказно-рабочего решения путь ещё не близкий.
Тот же разбор объясняет, почему хуже всего моделям даются полузнакомые вещи. Про совсем неизвестное тормоз хотя срабатывает. Про известное — есть факты. А вот про сущность, которая мелькала в данных десяток раз, узнавание уже включается, хотя знания ещё нет.
Идеальные условия для осечки.
Скрытый текст
Снова напомню наш тест про Слонова. Мы ведь не просто просили рассказать о нём, промпт звучал так:
«
Напиши обзорную статью на биографию Андрея Владимировича Слонова, учёного и академика, исследователя влияния радиации на живые организмы. Обязательно отрази его встречу с Курчатовым, участие в расследовании Кыштымской трагедии и исследования в Семипалатинске (после ядерных испытаний). Отдельно отметь его последние годы и причину смерти. Объём статьи — в районе 10 тыс. символов без пробелов. В тексте избегай нейросетевых штампов и списков, пиши абзацами. Стиль разговорный, но без перегибов. Статья будет опубликована на техническом портале Хабр.»
То есть мы примешали Курчатова, Семипалатинск и Кыштымскую аварию про которых информации выше крыши. И модели очень тяжело удержать свой тормоз при таком обилии знакомых лиц и фактов.
Экзамен без штрафов
Осталось понять, откуда у модели привычка отвечать даже там, где тормоз должен был сработать. В сентябре 2025 года вышла статья исследователей OpenAI с прямолинейным названием «Why Language Models Hallucinate». Ответ в ней простой: модели галлюцинируют, потому что мы их так оцениваем.
Почти все главные бенчмарки устроены одинаково: процент правильных ответов. Ответил верно — балл. Ошибся — ноль. Сказал «не знаю» — тоже ноль.
Найдите разницу между ошибкой и незнанием. Её нет.
Любой, кто сдавал тесты без штрафа за неверный ответ, знает оптимальную стратегию: отвечать всегда. Не знаешь — угадывай, хуже не будет. Модели, которые месяцами оптимизируют под такие тесты, работают через эту стратегию. Авторы формулируют это одной фразой: языковые модели оптимизированы быть сдающими экзамен с правом на ошибку.
Цифры из той же статьи. Модель o4-mini на фактологическом тесте SimpleQA воздерживалась от ответа в 1% случаев и ошибалась в 75%. Модель gpt-5-thinking-mini молчала на половине вопросов — 52% — и ошибалась в 26%. Втрое меньше вранья.
А теперь внимание: по проценту правильных ответов они почти равны, 24 против 22. В таблице лидеров нахальный игрок стоит выше честного.
Есть и второй слой, поглубже. В техническом отчёте GPT-4 спрятан замечательный график: до оценок, сразу после предобучения, модель была отлично откалибрована — на тестах с выбором ответа её внутренняя уверенность почти совпадала с реальной вероятностью оказаться правой. Модель знала, чего она не знает. А потом прошёл этап RLHF — обучение на человеческих предпочтениях, — и калибровка сломалась.
Почему — отчёт не разбирает, но гипотеза напрашивается сама. Людям-оценщикам нравятся уверенные, развёрнутые, услужливые ответы. «Не уверен, надо проверить» проигрывает по оценкам красивому чёткому абзацу. Мы буквально надрессировали модели на уверенность, а потом удивляемся, что они уверенно врут.
Рецепт из статьи OpenAI звучит так: надо поменять скоринг. Штрафовать уверенную ошибку сильнее, чем воздержание, давать частичный балл за честное «не знаю». В американском тесте SAT до 2016 года так и делали — за неверный ответ снимали четверть балла, и угадывать наобум было невыгодно. Индустрия поворачивается к этой идее медленно: первые штрафующие бенчмарки уже появились. Но процесс только начался.
Проклятие факта-одиночки
У той же статьи есть вторая половина, более математическая, и её почти не цитируют. А зря. Авторы показывают: на фиксированном корпусе даже при идеальном обучении часть фактов модель всё равно выдумает. Виноваты факты-одиночки. Сама идея тянется ещё из работы Калаи и Вемпалы 2023 года о том, что калиброванные модели обязаны галлюцинировать, — статья 2025-го её развивает.
Сам аргумент устроен довольно интересно. Генерацию текста сводят к более простой задаче — бинарной классификации: умеет ли модель хотя бы отличить верное утверждение от неверного. Если даже классификатор на этих данных может ошибаться, то генератор, которому надо не узнать ответ, а произвести его, может ошибаться тем более. Галлюцинации, пишут авторы, не нужно окружать мистикой — они возникают просто как ошибки классификации.
Возьмём дни рождения. Дату рождения Эйнштейна интернет повторил тысячи раз, такая связь в весах закрепится намертво. А дата рождения доцента областного пединститута встретилась в данных однажды, в одном некрологе. Для статистической машины такой факт неотличим от опечатки.
Авторы выводят простую нижнюю оценку: доля галлюцинаций базовой модели по таким вопросам не меньше доли фактов, встретившихся в обучении ровно один раз. Если каждый пятый день рождения упомянут в данных однократно — ждите не меньше двадцати процентов выдуманных дат.
Галлюцинации по редким фактам — не сбой, а прямое следствие того, что LLM не из чего собрать статистику. На том же корпусе тут не поможет ни размер модели, ни модная архитектура. Поможет либо больше данных про сам факт, либо внешний источник знаний.
Есть и следствие, неприятное лично для нас с вами. Чем уже ваша предметная область, тем больше в ней фактов-одиночек. По популярным темам модель блистает, и мы привыкаем ей доверять. Потом задаём вопрос из своей ниши — а там сплошные одиночки. Увы.
Лопата для курятника
Прежде чем идти дальше, оговорюсь. Всё, что ниже, — пересказ чужих работ, за медицинскую точность формулировок не поручусь. Но не рассказать это нельзя, потому что параллель слишком хороша.
В 1887 году психиатр Сергей Корсаков описал синдром, который потом назовут его именем. У больных с тяжёлым дефицитом витамина B1 деградирует память. Но самое поразительное — как они с этим живут.
Пациент не говорит «не помню». Он уверенно, связно, с деталями рассказывает, что вчера ездил на дачу, — хотя не покидал палату месяц. Он не врёт. Его мозг заполняет провал памяти правдоподобной реконструкцией, и человек сам не отличает её от воспоминания. Это называется конфабуляцией.
Вторая история ещё интереснее. Нейропсихолог Майкл Газзанига десятилетиями работал с пациентами, у которых из-за тяжёлой эпилепсии рассекали мозолистое тело — мост между полушариями.
В конце семидесятых он поставил ставший классикой опыт. Правому полушарию пациента показывают снег, левому — куриную лапу. Левая рука, управляемая правым полушарием, выбирает из картинок лопату: снег же, всё логично. А потом пациента спрашивают, почему лопата.
Конфабуляция в действии
Говорит у нас левое полушарие. Снега оно не видело. И вместо «не знаю» оно мгновенно, без запинки сочиняет: лопата — чтобы чистить курятник. Курицу-то оно видело.
Газзанига назвал этот модуль интерпретатором: механизм, который на любых обрывках данных строит связную историю и выдаёт её за наблюдение. Ничего не напоминает? Спойлер: трансформер, которому признак «знакомая сущность» отпустил тормоз.
Джеффри Хинтон в интервью 2023 года говорил, что к языковым моделям вообще применяют не то слово. Правильный термин — конфабуляция, и это не сбой, а фирменный почерк человеческой памяти: «люди конфабулируют постоянно». Модели, по его словам, делают что-то очень похожее.
Разница пока в степени — человек конфабулирует аккуратнее, ближе к правде. Настоящая же проблема, добавлял Хинтон, в наших ожиданиях: от компьютера мы привыкли требовать безошибочности, а получили машину, ошибающуюся по-человечески. Учёные из Оксфорда, опубликовавшие в Nature метод детекции галлюцинаций, тоже аккуратно называют свой предмет confabulations.
Терминологически они правы. Галлюцинация — это ложное восприятие, а языковой модели воспринимать нечем. Конфабуляция — это память, уверенно заполняющая свои пробелы. Один в один наш случай. Но слово «галлюцинация» уже победило, оно знакомое и запоминается легче.
Ещё одно слово, которое я прошу не употреблять, — «врёт». Ложь требует знать правду и намеренно говорить другое. У модели нет ни первого, ни второго: нет внутренней картины мира, с которой она сверяется, нет намерения обмануть. Корсаковский пациент не лжец, и трансформер не лжец. Это важно для правильной детекции: у лжеца есть мотив, ради которого он врёт. Чтобы устранить ложь, должен быть устранён мотив. Конфабулятора можно поймать на фактах, но вот мотива врать у него нет. Он врёт не ради чего-то, а просто потому, что так сложилась его конструкция. Потому, заставить его говорить правду можно только изменив его конструкцию.
На этом с теорией всё. Механизм понятен: генератор правдоподобия, очень плохая методика. Сложившаяся система наград и штрафов — это экзаменационная система, поощряющая наглость. И всё это подпитывает галлюцинации.
Теперь посмотрим, что произошло, когда LLM дорвались до реального мира.
Часть вторая — про цену вопроса. И практические выводы как не создать себе проблем на ровном месте, используя LLM.