TL;DR
Исследователи заставили три модели (GPT-5-mini, DeepSeek, Llama) написать почти 1,3 миллиона энциклопедических статей — без единого обращения к интернету, только из «памяти» модели. Затем проверили выборку утверждений против Википедии и качественных источников, раскрасив каждое: подтверждено, ложно, невозможно проверить.
Главная находка простая и неожиданная: когда LLM пишет длинный текст про малоизвестную тему, она почти не врёт прямо — ложных утверждений всего 1,2%. Проблема в другом: 30,5% утверждений вообще нельзя ни подтвердить, ни опровергнуть — ни один источник об этом не пишет. Чем глубже тема уходит от «попсовых» фактов (модель уходит по цепочке ссылок дальше), тем резче падает доля проверяемой правды — с 94% на первом шаге до 56% на шестом, — а доля лжи остаётся стабильно низкой. То есть галлюцинация выглядит не как выдумка, а как правдоподобный шум, который стилистически неотличим от реального редкого факта.
Из этого вытекает практический приём: не верить длинному тексту от LLM целиком, а раскладывать его на отдельные утверждения и оценивать каждое по отдельности — именно так работает верификация в исследовании (decompose-retrieve-verify). Плюс отдельно найден любопытный факт про «редакционные персоны»: если попросить модель писать с разных идеологических позиций, факты не меняются, меняются только акценты и лексика.
Схема метода
Метод, который можно вынести из статьи — не готовая одноразовая техника, а связка из двух приёмов, применимых в обычном чате:
Приём 1 — факт-чек длинного ответа:
ШАГ 1: Попросить LLM разбить свой ответ на отдельные проверяемые утверждения → список
ШАГ 2: Для каждого утверждения спросить: "насколько ты уверена, что это подтверждается независимым источником?" → метка (уверена / не уверена / это может быть общеизвестным, но непроверяемым)
ШАГ 3 (опционально): проверить самые "неуверенные" пункты вручную в поиске
Приём 2 — проверка framing без потери фактов:
ШАГ 1: Попросить написать текст на тему от лица трёх разных персон (нейтральный аналитик / сторонник позиции А / сторонник позиции Б) → 3 версии
ШАГ 2: Сравнить — факты должны совпадать, различаться должны только слова и акценты
Пример применения
Задача: Вы просите ChatGPT рассказать подробно про малоизвестного российского предпринимателя или историческую фигуру для статьи, и хотите понять, каким деталям можно доверять.
Промпт:
Расскажи подробно про {персона/тема, не самая известная}.
После текста разбей все фактические утверждения на отдельный список.
Для каждого утверждения оцени:
- "общеизвестный факт"
- "вероятно верно, но нет способа проверить"
- "не уверен, могу ошибаться в деталях"
Результат: Модель сначала выдаст обычный связный текст, затем — маркированный список утверждений с честной самооценкой уверенности по каждому. Часть пунктов окажется помечена как непроверяемые — это и есть та самая «длинная тень» неверифицируемых деталей, о которой говорит исследование. Именно эти пункты стоит перепроверить самостоятельно, прежде чем использовать текст.
Почему это работает
Слабость LLM в том, что при генерации длинного текста про редкую тему у модели нет явного сигнала «я не знаю» — она продолжает писать гладко и правдоподобно, смешивая реальные редкие факты с придуманными деталями в одном и том же уверенном тоне. Со стороны они выглядят одинаково.
Сильная сторона LLM — она гораздо лучше оценивает отдельное короткое утверждение, чем весь текст целиком. Уверенность падает по кускам легче, чем по абзацам: спросить «это правда?» про одну фразу — задача, с которой модель справляется честнее, чем при генерации связного повествования.
Метод использует это: разбивая текст на атомы, вы снимаете с модели задачу «удержать целостность рассказа» и оставляете только задачу «оценить одно утверждение» — так проще выявить, где модель уверена, а где просто гладко пишет вокруг пустоты.
🔧 Техника: спросить про уверенность отдельно от текста → выявить швы Если попросить модель сразу писать «с оговорками» внутри текста, оговорки будут расставлены неровно и часто формально. Лучше сначала получить чистый текст, а потом отдельным запросом попросить разложить и оценить — так модель честнее.
Ограничения
⚠️ Судья тоже может ошибаться: проверка утверждений в исследовании делалась моделью-судьёй, а не человеком напрямую. Если вы просите ChatGPT оценить свою же уверенность — это самооценка, не независимая проверка. Для важных решений всё равно нужен поиск в интернете.
⚠️ "Не проверено" ≠ "ложь": модель может знать редкий, но реальный факт, которого просто нет в открытых источниках. Не выбрасывайте такие детали автоматически — просто относитесь к ним настороженно.
⚠️ Persona-эффект работает не на всех темах: на нейтральных темах (например, античная история) framing почти не проявляется — разные "редакционные позиции" сходятся к одному тексту. Приём полезен именно для спорных тем.
Как исследовали
Исследователи взяли одну стартовую сущность (например, изобретателя Вэннивара Буша) и попросили модель написать про неё энциклопедическую статью со ссылками — а потом рекурсивно, по каждой упомянутой ссылке, генерировали новую статью, и так далее, пока не получилось почти 1,3 миллиона страниц — без единого обращения к интернету, только из внутренней «памяти» трёх моделей.
Затем на случайной выборке из 2010 статей и 20092 отдельных утверждений каждое утверждение проверили против Википедии и набора из 133 качественных источников. Оказалось, что модель почти не выдаёт прямую ложь (1,2%), но почти треть утверждений (30,5%) невозможно проверить вообще — и это число растёт по мере того, как модель уходит дальше от популярных тем по цепочке ссылок (доля подтверждённой правды падает с 94% до 56%).
Отдельно проверили эффект «редакционных персон» — попросили модель писать один и тот же текст с позиции левых, консервативных и нейтрально-научных взглядов. Оказалось, что персона резко меняет лексику (например, счёт совпадений с «левой» лексикой был 13 против 2 у нейтральной версии на одну и ту же тему), но почти не меняет точность фактов — расхождение в пределах 3-4 процентных пунктов. Вывод для практики: идеологическая рамка красит текст, но не искажает факты — если, конечно, модель не начинает откровенно врать в угоду позиции, чего в этом исследовании не зафиксировали.
Ресурсы
LLMPEDIA (Saeed & Razniewski, 2026), ScaDS.AI Dresden/Leipzig & TU Dresden. Живой сайт: https://llmpedia.net. Связанные работы: GPTKB (Hu et al., 2025), FActScore (Min et al., 2023), STORM (Shao et al., 2024).
