3,583 papers
arXiv:2608.04570 79 5 авг. 2026 г. FREE

MirageBench: как ChatGPT с памятью выдумывает факты о вас

КЛЮЧЕВАЯ СУТЬ
Парадокс: модель, которая хвалит себя за точность, врёт больше всех. А та, что честно признаётся "я всё выдумываю" — на деле честнее. Метод MirageBench позволяет отличить реальные факты о тебе от домыслов ChatGPT с памятью — и вычистить выдумку из персонализированного текста. Вместо вопроса "точна ли ты" модель заставляют разложить свой же ответ на отдельные утверждения и сверить каждое с фактами по шкале: сказано / выведено / стереотип / выдумано. Результат — ошибка падает с 40% до 5%.
Адаптировать под запрос

TL;DR

Когда ты просишь LLM с памятью (например, ChatGPT с включённой функцией Memory) написать что-то персонализированное — рекомендацию, описание, письмо — модель честно опирается на то, что ты рассказал, лишь в четверти случаев. Остальное — либо логичный вывод, либо чистая выдумка, либо стереотип про твою профессию или пол. Модель не разделяет в голове "что мне сказали" и "что я досочинил", и выдаёт всё это одним уверенным текстом.

Самая неприятная находка: если спросить модель саму — "сильно ли ты выдумываешь?" — её ответ обманывает. Модели, которые сами себя хвалят за точность ("я почти не гадаю"), на деле оказываются худшими выдумщиками по оценке независимого судьи. А модели, которые честно признают "да, я много досочиняю", по факту выдумывают меньше. То есть уверенность модели в себе — не показатель качества, а показатель того, насколько строго она сама себя судит.

Решение простое: не спрашивать модель "точна ли ты", а заставить её разложить свой же текст на отдельные утверждения и явно сверить каждое с исходными фактами по чёткой шкале — сказано / логично выведено / стереотип / выдумано. Такая построчная проверка резко снижает ошибку — с 40%+ выдуманных деталей до менее чем 5%, когда модель явно связывает каждое утверждение с конкретным фактом.


🔬

Схема метода

ШАГ 1: Дать модели 2-3 факта о себе (только то, что реально говорил) → факты в промпте
ШАГ 2: Попросить персонализированную задачу (текст, письмо, рекомендация) → черновой ответ
ШАГ 3 (отдельный запрос или тот же чат): Попросить модель разбить свой ответ на утверждения 
       и классифицировать каждое:
       — Сказано (Grounded)
       — Логично выведено (Reasonable)
       — Стереотип (Stereotype)
       — Выдумано (Fabricated)
ШАГ 4: Оставить только «Сказано» и «Логично выведено», остальное убрать или пометить как догадку

Шаги 1-2 можно сделать в одном сообщении, шаг 3 — либо в том же чате следующим сообщением, либо отдельным запросом (так надёжнее — модель менее склонна защищать свой же текст).


🚀

Пример применения

Задача: Ты давно переписываешься с ChatGPT, у него включена память. Ты как-то упоминал, что работаешь дизайнером, любишь сноуборд и у тебя кот. Просишь написать био для Tinder.

Промпт:

Вот факты, которые я тебе рассказывал о себе:
1. Работаю дизайнером
2. Люблю сноуборд
3. У меня есть кот

Задача: напиши короткое био для профиля на Tinder (3-4 предложения), 
основываясь на этих фактах.

После получения текста — второй промпт:

Теперь проверь свой ответ. Разбей его на отдельные утверждения обо мне 
и классифицируй каждое:
— Сказано (я говорил это прямо)
— Логично выведено (прямо следует из сказанного)
— Стереотип (это общее представление о дизайнерах/владельцах котов, а не про меня лично)
— Выдумано (нет вообще никакой основы)

Перепиши био, оставив только «Сказано» и «Логично выведено».

Результат: Модель покажет список утверждений из первого текста — что-то вроде "любит путешествовать", "интроверт", "ценит уют" — и для каждого укажет категорию. Скорее всего окажется, что половина деталей была стереотипом ("дизайнеры любят минимализм") или чистой фантазией. Финальная версия текста станет короче, но честнее — без придуманных черт характера.


🧠

Почему это работает

Модель обучена писать связный и законченный текст, а не текст с пробелами. Когда фактов не хватает, она автоматически "доклеивает" недостающие детали самым вероятным продолжением — как автозаполнение в телефоне, только для описания человека. Это не злой умысел модели, это побочный эффект того, как она генерирует текст: цельность важнее точности.

При этом модель неплохо умеет сравнивать и классифицировать, когда ей дают чёткие категории. Просьба "оцени точность от 1 до 10" — расплывчата, модель отвечает наугад. А просьба "отнеси каждое утверждение к одной из четырёх категорий и сверь с фактами" — конкретная задача, где модель справляется заметно лучше.

Метод использует именно это: заставляет модель разложить гладкий текст на отдельные кусочки и проверить каждый по одному, а не оценивать весь текст целиком "на глаз".

Рычаги управления: - Сократи шкалу до двух категорий (факт / догадка) — быстрее, но грубее. - Проси модель сразу писать в двух блоках: "Точно из твоих слов" и "Мои предположения (поправь, если не так)" — экономит один запрос. - Для задач с высоким риском выдумки (описание квартиры, характера, будущего) — заранее давай больше конкретных фактов, а не надейся на промпт-аудит постфактум.


📋

Шаблон промпта

Вот факты, которые я тебе сообщил о себе: {список_фактов}

Задача: {персонализированная_задача}

Сначала выполни задачу.

Затем проверь свой ответ: разбей его на отдельные утверждения обо мне 
и классифицируй каждое по шкале:
— Сказано (я говорил это прямо)
— Логичный вывод (прямо следует из сказанного, без натяжек)
— Стереотип (основано на общих представлениях о профессии/группе, а не обо мне лично)
— Выдумано (нет вообще никакой основы в моих словах)

В финале перепиши ответ, оставив только «Сказано» и «Логичный вывод». 
Остальное либо убери, либо явно пометь как предположение, которое я могу поправить.

Подставляй в {список_фактов} — реальные факты о себе, которые ты действительно упоминал. В {персонализированная_задача} — что именно просишь: письмо, рекомендацию, описание, план.

🚀 Быстрый старт — вставь в чат:

Вот шаблон проверки персонализированных ответов на выдумки. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какие факты о тебе она может использовать — потому что без чёткого списка "разрешённых" фактов ей не с чем сравнивать свой же текст.


⚠️

Ограничения

⚠️ Само-аудит ненадёжен между моделями: если сравниваешь разные LLM по тому, как честно они сами себя оценивают ("я редко выдумываю") — не доверяй этому. Модель, которая хвалит себя больше, на практике может выдумывать сильнее. Но внутри одной и той же модели самопроверка работает средне-хорошо — можно использовать, чтобы отфильтровать самые сомнительные утверждения именно этой модели.

⚠️ Творческие задачи — зона максимального риска: описание квартиры, характера, будущего — там, где мало опоры на факты, модель выдумывает почти в два раза чаще, чем в задачах типа "посоветуй подарок исходя из хобби". Промпт-аудит снижает риск, но не убирает его полностью — если фактов реально мало, модели просто нечем заменить выдумку.

⚠️ Выводы про накопление ошибок в памяти — предварительные: тест на многотуровое накопление выдуманных деталей в памяти чата проводился всего на двух вымышленных профилях, это скорее сигнал направления, чем точная цифра.


🔍

Как исследовали

Команда взяла 150 вымышленных профилей — с явными стереотипами, наоборот "не вписывающихся" в стереотип, и нейтральных — и дала каждому по 3 "факта", которые профиль якобы рассказал ассистенту. Дальше 12 моделей (GPT, Claude, Gemini, DeepSeek, Qwen и другие) выполняли 6 задач: от конкретных (подарок на день рождения) до сильно творческих (описание квартиры).

Каждое утверждение в ответах моделей проверял независимый "судья" — отдельная модель (Claude Opus), а её решения дополнительно сверили с оценками живого человека на 400 примерах: совпадение получилось на уровне почти идеального согласия. Это важно — значит, выводам можно доверять, они не основаны на субъективной прихоти одного судьи.

Самое любопытное — сравнение того, что модели говорят о себе, с тем, что показал судья. Ожидалось, что модели, которые сами признают "я много выдумываю", будут действительно худшими. Получилось наоборот: корреляция отрицательная. Разгадка в том, что модели по-разному строги к себе при самопроверке — одни ставят себе высокую планку и признаются в мелочах, другие называют почти всё "разумным предположением". То есть разница не в поведении, а в том, насколько модель самокритична на словах.


📋 Дайджест исследования

Ключевая суть

Парадокс: модель, которая хвалит себя за точность, врёт больше всех. А та, что честно признаётся "я всё выдумываю" — на деле честнее. Метод MirageBench позволяет отличить реальные факты о тебе от домыслов ChatGPT с памятью — и вычистить выдумку из персонализированного текста. Вместо вопроса "точна ли ты" модель заставляют разложить свой же ответ на отдельные утверждения и сверить каждое с фактами по шкале: сказано / выведено / стереотип / выдумано. Результат — ошибка падает с 40% до 5%.

Принцип работы

Не спрашивай модель "насколько ты точна" — это как просить пьяного оценить свою трезвость. Разбей её же текст на отдельные утверждения и сверь каждое с фактами по одному. Общая оценка размыта, а классификация по чётким категориям — задача, где модель внезапно начинает соображать.

Почему работает

Модель обучена писать гладкий связный текст, а не текст с дырками. Не хватает фактов — она незаметно достраивает их самым вероятным продолжением, как автозаполнение в телефоне. Внутри одной модели такая построчная проверка реально работает — выдумки падают с 40%+ до менее 5%. Но сравнивать разные модели по их самооценке нельзя: та, что громче хвалит себя за точность, часто врёт сильнее всех.

Когда применять

Персонализация с памятью → письма, рекомендации, био, описания на основе фактов из истории чата, особенно когда фактов мало — там риск выдумки почти в два раза выше. НЕ подходит для сравнения разных LLM друг с другом по их же самооценке — она не показатель качества, только показатель того, насколько строго модель судит себя саму.

Мини-рецепт

1. Дай факты: только то, что реально говорил, 2-3 пункта, без домыслов.
2. Попроси текст: письмо, рекомендацию, био — на основе этих фактов.
3. Заставь разложить: отдельным сообщением попроси разбить ответ на утверждения и отметить каждое: сказано / логично выведено / стереотип / выдумано.
4. Вычисти лишнее: оставь только "сказано" и "выведено", остальное — в пометку "предположение, поправь если не так".

Примеры

[ПЛОХО] : Напиши моё био для Tinder, ты меня хорошо знаешь
[ХОРОШО] : Вот факты: 1) дизайнер 2) люблю сноуборд 3) есть кот. Напиши био (3-4 предложения). Затем разбей ответ на утверждения и отметь каждое: сказано / логично выведено / стереотип / выдумано. Перепиши, оставив только первые два типа.
Источник: The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads
ArXiv ID: 2608.04570 | Сгенерировано: 2026-08-06 04:22

Проблемы LLM

ПроблемаСутьКак обойти
Модель не отделяет факты от своих же выдумокПросишь написать что-то персонализированное на основе фактов о тебе. Модель честно использует факты редко. Остальное — логичный вывод, стереотип про профессию/пол или чистая выдумка. Всё это подаётся одним уверенным текстом без пометок, где правда, а где фантазия. Проблема касается любой задачи с персонализацией: письма, рекомендации, описанияПопроси модель разбить свой ответ на отдельные утверждения. Для каждого — классифицировать: сказано / логично выведено / стереотип / выдумано. Оставить в финальном тексте только первые две категории
Самооценка модели не показывает реальное качество ответаСпрашиваешь модель "точна ли ты" или "сильно ли ты гадаешь". Модели, которые хвалят себя за точность, часто выдумывают больше остальных. Модели, которые честно признают "я много досочиняю", по факту выдумывают меньше. Сравнивать разные модели по их самоотчётам — бессмысленно и вводит в заблуждениеНе спрашивай модель напрямую "насколько ты уверена". Вместо общей оценки дай конкретную задачу: разложить текст на утверждения и сверить каждое с списком фактов. Сравнивать самооценки разных моделей друг с другом — не делай вообще

Методы

МетодСуть
Пост-аудит по категориям — фильтр выдуманных деталейПосле того как модель написала персонализированный текст, попроси её разбить его на отдельные утверждения. Каждое утверждение классифицировать по шкале: сказано / логично выведено / стереотип / выдумано. Разбей ответ на утверждения и отнеси каждое к одной из категорий. Затем оставить в тексте только "сказано" и "логично выведено", остальное убрать или пометить как догадку. Почему работает: модель плохо оценивает целый текст "на глаз", но неплохо справляется, когда задача чёткая и по одному пункту за раз. Когда применять: персонализированные тексты на основе памяти о пользователе, описания, рекомендации, письма. Лучше работает как отдельный запрос, не в том же сообщении — модель менее склонна защищать написанное только что. Когда не работает: если исходных фактов почти нет — тогда модели просто нечем заменить выдумку, аудит снижает риск, но не убирает

Тезисы

ТезисКомментарий
Модель заполняет нехватку фактов самым вероятным продолжениемМодель обучена писать связный законченный текст, а не текст с пробелами. Когда данных не хватает, она "доклеивает" детали — как автозаполнение, только для описания человека. Это не сбой, а побочный эффект того, как модель генерирует текст: цельность для неё важнее точности. Применяй: если факта о человеке нет — не жди, что модель оставит пробел, она его заполнит сама, значит нужен явный аудит или больше исходных данных
Чёткая категоризация работает лучше расплывчатой самооценкиПросьба "оцени точность от 1 до 10" — размытая задача, модель отвечает почти наугад. Просьба "отнеси каждое утверждение к одной из четырёх конкретных категорий" — точная задача, где модель ошибается заметно реже. Разница в качестве проверки — на порядок. Применяй: вместо "оцени свою уверенность" всегда давай конкретные категории для классификации по одному пункту
📖 Простыми словами

The Personalization Mirage: HowLLMsFabricate User Profiles, and Why Self-Monitoring Misleads

arXiv: 2608.04570

Современные нейронки с памятью работают не как картотека, а как галлюцинирующий биограф. Когда ты просишь модель персонализировать ответ под тебя, она опирается на реальные факты из истории переписки всего в 25% случаев. В остальное время она просто додумывает твой образ, смешивая крупицы правды с дикими стереотипами о твоем поле или профессии. Проблема в том, что для LLM нет разницы между тем, что ты ей реально сказал, и тем, что она сама «достроила» для красоты сюжета — она выдает всё это одним уверенным потоком, создавая иллюзию глубокого понимания.

Это как если бы ты нанял личного ассистента, рассказал ему пару историй из жизни, а он пошел и написал твою биографию, где половину фактов просто выдумал, чтобы звучало солиднее. Ты говоришь, что любишь горы, а он дописывает, что ты покорил Эверест и пьешь только элитный чай, потому что «ну, альпинисты же такие». Формально он тебе помогает, но на деле он общается не с тобой, а с выдуманным персонажем в своей голове, который лишь отдаленно на тебя похож.

В реальности это выглядит так: ты упоминаешь, что работаешь дизайнером и любишь сноуборд, а модель в ответ на просьбу составить план тренировок начинает советовать упражнения для «креативного мышления» и диету для профессиональных райдеров. Она использует логический вывод там, где он не нужен, и стереотипное мышление там, где не хватает данных. Если в памяти есть пробел, нейронка не переспросит, а просто включит «автозаполнение» на стероидах, потому что её главная задача — выдать связный и законченный текст, а не достоверную анкету.

Исследование проводили на профилях пользователей, но этот эффект миража универсален для любой работы с контекстом. Будь то составление писем, подбор рекомендаций или создание контент-плана — модель всегда будет «доклеивать» детали, исходя из своих внутренних весов, а не из твоих реальных потребностей. Персонализация в LLM — это ловушка, где модель подменяет твою личность набором статистически вероятных признаков, которые кажутся ей логичными.

Короче, не обольщайся, когда чат-бот кажется «своим парнем» и якобы помнит твои предпочтения. В большинстве случаев он просто удачно гадает, опираясь на шаблоны, и в три раза чаще врет, чем говорит правду. Если тебе нужен точный результат, а не красивая сказка, проверяй каждый факт, который модель «вспомнила» о тебе. Иначе рискуешь получить продукт, созданный для воображаемого друга нейросети, а не для тебя.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с