TL;DR
Когда просишь LLM написать историю о реальном человеке или компании — дав только шаблон и пару примеров, без полного фактического материала — модель не выдумывает случайный бред. Она берёт реальные факты (имя работодателя, город, конкретного человека) и вплетает их в придуманную сцену, которой никогда не было.
Автор — писательница — попросила LLM сгенерировать 366 дневных заметок о своей собственной жизни для книги-подарка. Потом проверила каждый день по документам: мемуарам, транскриптам выступлений, архивам. Результат: 97% дней не подтвердились. При этом самый частый тип ошибки — не полная выдумка, а именно "правдоподобная ложь на реальной основе": модель помнит, что человек работал в компании X, и придумывает конкретный диалог или эпизод там, которого не было. Это опаснее прямой лжи — звучит достоверно, потому что частично правда.
Решение из исследования: подкреплять генерацию реальным корпусом фактов (документы, тексты, транскрипты), а не шаблоном с парой примеров. Это заметно снижает долю ошибок, но не убирает их полностью — даже с полным корпусом остаётся 83% непроверяемых деталей.
Схема метода (как это работает и как исправлять)
ПРОБЛЕМА: LLM пишет "автобиографию" → шаблон + 2 примера + факт (без корпуса)
→ 97% сцен не подтверждаются документально
→ доминирующая ошибка: реальный факт + придуманная сцена вокруг него (WEAK)
РЕШЕНИЕ: LLM пишет то же самое → шаблон + РЕАЛЬНЫЙ КОРПУС (мемуары, тексты, транскрипты)
→ доля непроверяемых сцен падает, но остаётся высокой (83%)
Пример применения
Задача: Основатель стартапа просит ChatGPT написать пост для соцсетей "История нашей компании" или биографию для сайта, дав только пару фактов вроде "основали в 2019, работали в гараже, первый клиент — региональный банк".
Промпт (плохой вариант, воспроизводит проблему из исследования):
Напиши историю нашей компании в разговорном стиле от первого лица.
Основали в 2019 году, начинали в гараже, первым клиентом был региональный банк.
Сделай текст живым, с деталями и диалогами.
Результат: Модель добьётся живости текста именно тем способом, который в исследовании назвали "grounded drift" — придумает конкретный диалог с "банком", имя менеджера, дату встречи, эмоциональную деталь ("мы сидели до трёх ночи"). Всё это будет звучать правдоподобно именно потому, что базовые факты (гараж, банк, 2019) реальны — а конкретика вокруг них выдумана.
Промпт (исправленный, по принципу grounding из исследования):
Вот весь материал, который у меня есть о компании: [вставь реальные заметки,
переписку, посты, интервью, любые документы — чем больше, тем лучше].
Напиши историю компании от первого лица, используя ТОЛЬКО факты из этого материала.
Если для связности текста тебе не хватает детали (имя, дата, диалог) —
не выдумывай её. Вместо этого вставь пометку [ПРОВЕРИТЬ: какая деталь нужна].
Результат: Текст будет менее гладким — местами с пометками вместо красивых деталей. Но именно эти пометки — сигнал, где модель начала бы придумывать. Их нужно закрыть реальными фактами вручную, а не давать модели "дофантазировать".
Почему это работает
LLM обучена писать связный, живой текст, а связность требует деталей: имён, дат, диалогов, эмоций. Если в промпте этих деталей нет — модель их создаёт сама, потому что "недостаточно конкретно" воспринимается как плохой текст. Это не сбой, а побочный эффект её главной сильной стороны — умения писать бегло и убедительно.
Слабость: у модели нет встроенного "счётчика уверенности" по каждой детали. Она не отличает "я это точно знаю" от "это звучит уместно здесь". Именно поэтому выдуманные детали получаются такими правдоподобными — они генерируются тем же механизмом, что и правильные.
Метод-обход: если явно запретить достраивать факты и попросить помечать пробелы, модель переключается в режим "заполни только то, что дано" — и хотя итоговый текст менее гладкий, он честнее. А если дать ей действительно много реального материала (не два примера, а весь доступный корпус текстов о человеке/компании), у неё физически меньше пустых мест, которые нужно заполнять выдумкой.
Рычаг управления: чем больше реального текста в контексте (переписка, посты, интервью, документы) — тем меньше "grounded drift". Два примера в промпте — это разрешение придумывать, полный корпус — это сужение пространства для фантазии.
Шаблон промпта
Вот весь материал, который у меня есть о {человек/компания/событие}:
{вставь все доступные тексты — заметки, переписку, интервью, посты, документы}
Напиши {тип текста: биографию/историю/пост} от первого лица, используя ТОЛЬКО
факты из этого материала.
Правила:
1. Если для связности не хватает конкретной детали (имя, дата, место, диалог) —
не придумывай её. Вставь пометку [ПРОВЕРИТЬ: что именно нужно уточнить].
2. Особое внимание — сценам, где ты упоминаешь реального человека, компанию
или место: если конкретный эпизод с ними не описан в материале выше,
помечай его, а не сочиняй.
3. В конце выведи список всех пометок [ПРОВЕРИТЬ] отдельно, чтобы я мог
закрыть их вручную.
🚀 Быстрый старт — вставь в чат:
Вот принцип из исследования про то, как LLM выдумывает правдоподобные детали
при написании биографий и историй о реальных людях. Адаптируй под мою задачу:
{твоя задача}. Задавай вопросы, чтобы собрать нужный материал.
[вставить шаблон выше]
LLM спросит, какой фактический материал у тебя есть и какие детали особенно важно не выдумывать — потому что без этого шаблон не сработает: принцип строится на замене "воображения" реальными данными.
Ограничения
⚠️ Grounding не решает проблему полностью: даже когда модели дали реальный корпус фактов о человеке, 83% сцен всё равно не прошли проверку. Полагаться только на "дай больше данных" недостаточно — нужна ручная проверка ключевых деталей.
⚠️ Граница размыта даже для людей: проверяющие расходились именно в том, считать ли сцену "реальный сеттинг + придуманная деталь" или "вообще без опоры на факты" — эта грань субъективна, и универсального правила пока нет.
⚠️ Метод изучен на одном кейсе: это аудит одной книги про одного человека, а не системный тест на множестве биографий — выводы вероятны, но не гарантированно универсальны для всех типов текстов о реальных людях.
Как исследовали
Автор — профессиональная писательница — попросила LLM написать 366 дневных заметок о собственной жизни для книги-подарка, дав только шаблон, два примера дня и цитату на каждый день — без доступа к архивам её реальной биографии. Потом она сама проверила каждый день по независимым документам: мемуарам, транскриптам выступлений, музыкальному каталогу с привязкой к годам жизни. Получилось: 12 дней подтвердились, 227 содержали реальные декорации с придуманной сценой, 108 были полностью без опоры на факты, 19 прямо противоречили документам.
Чтобы убедиться, что оценка не была смещена (ведь автор — и объект, и судья одновременно), исследование прогнали через двух независимых проверяющих на других моделях — они подтвердили даже более высокий процент ошибок, то есть оригинальная оценка была скорее мягче реальности, а не наоборот. Отдельно исследователи повторили генерацию тех же дней на современных моделях без доступа к архиву — результат идентичный: 100% ошибок. Когда же модели дали реальный корпус текстов о человеке — доля ошибок упала, но осталась высокой (83%). Главный неожиданный вывод: спор между проверяющими концентрировался почти целиком вокруг одной грани — "реальный сеттинг с придуманной деталью" против "вообще без опоры" — то есть сама формулировка правил проверки была нечёткой, а не сами эксперты некомпетентны.
Ресурсы
Heather Renze, Serenze Global. "Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes", август 2026.
