TL;DR
Когда ты просишь LLM с памятью (например, ChatGPT с включённой функцией Memory) написать что-то персонализированное — рекомендацию, описание, письмо — модель честно опирается на то, что ты рассказал, лишь в четверти случаев. Остальное — либо логичный вывод, либо чистая выдумка, либо стереотип про твою профессию или пол. Модель не разделяет в голове "что мне сказали" и "что я досочинил", и выдаёт всё это одним уверенным текстом.
Самая неприятная находка: если спросить модель саму — "сильно ли ты выдумываешь?" — её ответ обманывает. Модели, которые сами себя хвалят за точность ("я почти не гадаю"), на деле оказываются худшими выдумщиками по оценке независимого судьи. А модели, которые честно признают "да, я много досочиняю", по факту выдумывают меньше. То есть уверенность модели в себе — не показатель качества, а показатель того, насколько строго она сама себя судит.
Решение простое: не спрашивать модель "точна ли ты", а заставить её разложить свой же текст на отдельные утверждения и явно сверить каждое с исходными фактами по чёткой шкале — сказано / логично выведено / стереотип / выдумано. Такая построчная проверка резко снижает ошибку — с 40%+ выдуманных деталей до менее чем 5%, когда модель явно связывает каждое утверждение с конкретным фактом.
Схема метода
ШАГ 1: Дать модели 2-3 факта о себе (только то, что реально говорил) → факты в промпте
ШАГ 2: Попросить персонализированную задачу (текст, письмо, рекомендация) → черновой ответ
ШАГ 3 (отдельный запрос или тот же чат): Попросить модель разбить свой ответ на утверждения
и классифицировать каждое:
— Сказано (Grounded)
— Логично выведено (Reasonable)
— Стереотип (Stereotype)
— Выдумано (Fabricated)
ШАГ 4: Оставить только «Сказано» и «Логично выведено», остальное убрать или пометить как догадку
Шаги 1-2 можно сделать в одном сообщении, шаг 3 — либо в том же чате следующим сообщением, либо отдельным запросом (так надёжнее — модель менее склонна защищать свой же текст).
Пример применения
Задача: Ты давно переписываешься с ChatGPT, у него включена память. Ты как-то упоминал, что работаешь дизайнером, любишь сноуборд и у тебя кот. Просишь написать био для Tinder.
Промпт:
Вот факты, которые я тебе рассказывал о себе:
1. Работаю дизайнером
2. Люблю сноуборд
3. У меня есть кот
Задача: напиши короткое био для профиля на Tinder (3-4 предложения),
основываясь на этих фактах.
После получения текста — второй промпт:
Теперь проверь свой ответ. Разбей его на отдельные утверждения обо мне
и классифицируй каждое:
— Сказано (я говорил это прямо)
— Логично выведено (прямо следует из сказанного)
— Стереотип (это общее представление о дизайнерах/владельцах котов, а не про меня лично)
— Выдумано (нет вообще никакой основы)
Перепиши био, оставив только «Сказано» и «Логично выведено».
Результат: Модель покажет список утверждений из первого текста — что-то вроде "любит путешествовать", "интроверт", "ценит уют" — и для каждого укажет категорию. Скорее всего окажется, что половина деталей была стереотипом ("дизайнеры любят минимализм") или чистой фантазией. Финальная версия текста станет короче, но честнее — без придуманных черт характера.
Почему это работает
Модель обучена писать связный и законченный текст, а не текст с пробелами. Когда фактов не хватает, она автоматически "доклеивает" недостающие детали самым вероятным продолжением — как автозаполнение в телефоне, только для описания человека. Это не злой умысел модели, это побочный эффект того, как она генерирует текст: цельность важнее точности.
При этом модель неплохо умеет сравнивать и классифицировать, когда ей дают чёткие категории. Просьба "оцени точность от 1 до 10" — расплывчата, модель отвечает наугад. А просьба "отнеси каждое утверждение к одной из четырёх категорий и сверь с фактами" — конкретная задача, где модель справляется заметно лучше.
Метод использует именно это: заставляет модель разложить гладкий текст на отдельные кусочки и проверить каждый по одному, а не оценивать весь текст целиком "на глаз".
Рычаги управления: - Сократи шкалу до двух категорий (факт / догадка) — быстрее, но грубее. - Проси модель сразу писать в двух блоках: "Точно из твоих слов" и "Мои предположения (поправь, если не так)" — экономит один запрос. - Для задач с высоким риском выдумки (описание квартиры, характера, будущего) — заранее давай больше конкретных фактов, а не надейся на промпт-аудит постфактум.
Шаблон промпта
Вот факты, которые я тебе сообщил о себе: {список_фактов}
Задача: {персонализированная_задача}
Сначала выполни задачу.
Затем проверь свой ответ: разбей его на отдельные утверждения обо мне
и классифицируй каждое по шкале:
— Сказано (я говорил это прямо)
— Логичный вывод (прямо следует из сказанного, без натяжек)
— Стереотип (основано на общих представлениях о профессии/группе, а не обо мне лично)
— Выдумано (нет вообще никакой основы в моих словах)
В финале перепиши ответ, оставив только «Сказано» и «Логичный вывод».
Остальное либо убери, либо явно пометь как предположение, которое я могу поправить.
Подставляй в {список_фактов} — реальные факты о себе, которые ты действительно упоминал. В {персонализированная_задача} — что именно просишь: письмо, рекомендацию, описание, план.
🚀 Быстрый старт — вставь в чат:
Вот шаблон проверки персонализированных ответов на выдумки. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какие факты о тебе она может использовать — потому что без чёткого списка "разрешённых" фактов ей не с чем сравнивать свой же текст.
Ограничения
⚠️ Само-аудит ненадёжен между моделями: если сравниваешь разные LLM по тому, как честно они сами себя оценивают ("я редко выдумываю") — не доверяй этому. Модель, которая хвалит себя больше, на практике может выдумывать сильнее. Но внутри одной и той же модели самопроверка работает средне-хорошо — можно использовать, чтобы отфильтровать самые сомнительные утверждения именно этой модели.
⚠️ Творческие задачи — зона максимального риска: описание квартиры, характера, будущего — там, где мало опоры на факты, модель выдумывает почти в два раза чаще, чем в задачах типа "посоветуй подарок исходя из хобби". Промпт-аудит снижает риск, но не убирает его полностью — если фактов реально мало, модели просто нечем заменить выдумку.
⚠️ Выводы про накопление ошибок в памяти — предварительные: тест на многотуровое накопление выдуманных деталей в памяти чата проводился всего на двух вымышленных профилях, это скорее сигнал направления, чем точная цифра.
Как исследовали
Команда взяла 150 вымышленных профилей — с явными стереотипами, наоборот "не вписывающихся" в стереотип, и нейтральных — и дала каждому по 3 "факта", которые профиль якобы рассказал ассистенту. Дальше 12 моделей (GPT, Claude, Gemini, DeepSeek, Qwen и другие) выполняли 6 задач: от конкретных (подарок на день рождения) до сильно творческих (описание квартиры).
Каждое утверждение в ответах моделей проверял независимый "судья" — отдельная модель (Claude Opus), а её решения дополнительно сверили с оценками живого человека на 400 примерах: совпадение получилось на уровне почти идеального согласия. Это важно — значит, выводам можно доверять, они не основаны на субъективной прихоти одного судьи.
Самое любопытное — сравнение того, что модели говорят о себе, с тем, что показал судья. Ожидалось, что модели, которые сами признают "я много выдумываю", будут действительно худшими. Получилось наоборот: корреляция отрицательная. Разгадка в том, что модели по-разному строги к себе при самопроверке — одни ставят себе высокую планку и признаются в мелочах, другие называют почти всё "разумным предположением". То есть разница не в поведении, а в том, насколько модель самокритична на словах.
