3,583 papers
arXiv:2607.23927 70 27 июля 2026 г. FREE

LLM путают свои выдумки с вашими словами — и после исправлений это становится только хуже

КЛЮЧЕВАЯ СУТЬ
Модель безошибочно помнит, что придумала секунду назад — 100% точности в рамках одного сообщения. Но через 20-30 сообщений диалога она путает свою выдумку с вашими словами. Причём путает чаще, чем если бы просто угадывала наугад. Метод — точнее, диагноз — объясняет почему нельзя слепо доверять фразе модели «это вы сами сказали» в длинной рабочей сессии. Модель не хранит тег автора рядом с каждой фразой истории — весь чат сливается в один текстовый поток, и чем дальше вглубь, тем проще перепутать, кто автор.
Адаптировать под запрос

TL;DR

Языковая модель в рамках одного сообщения почти идеально помнит, что она сама только что придумала — 100% точности. Но стоит внести задержку (несколько сообщений, длинный диалог) между моментом, когда модель что-то сгенерировала, и моментом, когда её спрашивают "это ты сказала или я" — точность падает до случайной, а иногда даже разворачивается: модель чаще путает свои слова с чужими, чем наоборот.

Самое неприятное — это работает не так, как ожидаешь. Если поправлять модель ("нет, это не так, это ты сама придумала"), она может стать точнее в определении источника. Но при этом её заявленная уверенность отрывается от правильности ответа. То есть после серии исправлений модель говорит "я уверена на 90%" одинаково часто — была она права или нет. Уверенность превращается в шум.

Это не техника, а предупреждение о механике LLM в длинных диалогах: модель не хранит отдельную "метку источника" для каждого кусочка текста в истории чата. Всё, что она сама сказала раньше и что сказали вы — со временем сливается в единый поток текста, и различить, кто автор, становится всё труднее, особенно после того как её несколько раз поправляли.


📌

Схема механики проблемы

ШАГ 1: Модель генерирует текст (в т.ч. ошибочный/выдуманный) → попадает в историю диалога
ШАГ 2: Проходит время — несколько сообщений или отдельный блок разговора (episodic delay) → 
        прямой сигнал "это я только что сказала" исчезает из активного контекста
ШАГ 3: Вы спрашиваете "откуда это?" → точность различения падает с ~100% до близкой к случайной,
        иногда полностью разворачивается (модель увереннее приписывает СВОЮ выдумку ВАМ)
ШАГ 4 (если вы поправляете модель): точность по одному типу источника растёт,
        но связь между "я уверена" и "я права" рвётся — уверенность становится бесполезным сигналом

🚀

Пример применения

⚠️ Важно: промпт ниже — не то, что тестировали авторы (в эксперименте использовались искусственные пары слов). Это моя адаптация находки под реальную рабочую задачу. В статье нет протестированного способа "исправить" проблему — только диагноз.

Задача: Долгая рабочая сессия с ассистентом — например, вы 40+ сообщений разбираете с ним бизнес-план: обсуждаете рынок, считаете unit-экономику, спорите про цифры. В какой-то момент модель сама предположила цифру (например, "объём рынка — примерно 300 млрд рублей"), вы не заметили, что это её догадка, а не ваш факт. Через 20 сообщений вы спрашиваете "напомни, откуда эта цифра" — и рискуете получить ответ, будто это вы её сообщили.

Промпт:

Просмотри весь наш диалог с начала. Составь два списка:

1. [От меня] — факты, цифры и условия, которые я тебе явно сообщил.
2. [Твои предположения] — оценки, догадки, примеры и цифры, 
   которые ты сама сгенерировала или предложила, даже если они звучали как факты.

Если не можешь точно определить источник конкретного утверждения — 
помечай его как [неясно]. Не выдавай свои предположения за мои слова.

Результат: Модель выдаст два размеченных списка. Но по данным исследования — доверять этой разметке полностью нельзя, особенно если до этого вы уже несколько раз её поправляли: чем длиннее диалог и чем больше было правок, тем ненадёжнее становится и сама разметка, и уверенность, с которой модель её делает. Используйте список как отправную точку для ручной проверки, а не как финальный вердикт.


📌

Почему это происходит

Модель не хранит отдельный "тег автора" рядом с каждым фрагментом истории диалога. Всё, что происходило в чате — ваши слова и её собственные ответы, — превращается в единый текстовый поток. В рамках одного сообщения свежесгенерированное слово ещё "на поверхности" внимания модели, поэтому распознать его легко. Но чем дальше это уходит в историю, тем меньше у модели опоры, кроме как заново читать и интерпретировать текст — а тут начинаются ошибки.

Сильная сторона LLM — она хорошо выполняет явные структурные инструкции ("раздели на две категории", "помечай неясное отдельно"). Поэтому явный запрос на разметку источников работает лучше, чем надежда, что модель "сама помнит". Но это не решает проблему полностью: исследование показывает, что даже с исправлениями и явными подсказками точность деградирует, а уверенность модели становится оторванной от правильности.

Рычаг, который стоит запомнить: если вы часто поправляете модель в длинном диалоге ("нет, это не так", "я не говорил этого") — не доверяйте её фразам вроде "я уверена в этом". После серии правок уверенность модели перестаёт коррелировать с тем, права она или нет.


⚠️

Ограничения

⚠️ Деградация с длиной диалога: чем больше сообщений прошло между моментом, когда модель что-то сказала, и моментом проверки источника — тем хуже она различает "моё" и "ваше". Нет чёткого порога, после которого это стабилизируется.

⚠️ Фидбек — палка о двух концах: исправление модели может улучшить точность распознавания источника для одного типа информации, но одновременно разрушает связь между её уверенностью и правильностью ответа. После цикла правок фразы "я на 90% уверена" ничего не значат.

⚠️ Нет проверенного решения: авторы диагностируют проблему, но не предлагают и не тестируют промпт-технику для её исправления. Аудит-промпт выше — экстраполяция, не протестированный в статье метод.

⚠️ Размер модели не гарантия: более крупные модели (Llama 3.3:70b) в целом лучше, но и они показывают странные провалы — например, точность растёт, а способность оценить собственную правоту падает ниже случайной.


🔍

Как исследовали

Команда взяла классическую психологическую парадигму reality monitoring (способность человека определить, было ли воспоминание реально увиденным или им самим придуманным) и адаптировала её для LLM. Модели видели пары слов: либо получали пару целиком и должны были воспроизвести второе слово (имитация "восприятия"), либо получали только первое слово и сами придумывали второе (имитация "воображения"). Затем модель спрашивали — было это слово дано ей или она сама его выдумала.

Проверили шесть моделей (Gemma 3 на 12B и 27B, с квантованием и без, Llama 3.3:70B, Llama 4 sparse MoE 16×17B) в трёх архитектурах диалоговой памяти: всё в одном сообщении, разбито на последовательные сообщения, и с настоящей задержкой — блок из 20-40 пар, а потом отдельная фаза проверки источника, с фидбеком и без.

Удивил разворот: в простом варианте (без задержки) внутренне сгенерированные слова узнавались идеально, а внешне заданные — хуже. Но с задержкой всё наоборот — внешние узнаются лучше, внутренние хуже. Это значит, что "идеальная" память модели на собственные слова в короткой сессии — это не признак настоящего самопознания, а просто эффект того, что слово ещё физически в активном окне внимания. Как только эта опора убирается — способность рушится.


🔗

Ресурсы

Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory — препринт (не прошёл рецензирование). Авторы: Saurabh Ranjan, Konstantina Sokratous, Brian Odegaard — University of Florida, University of Missouri.


📋 Дайджест исследования

Ключевая суть

Модель безошибочно помнит, что придумала секунду назад — 100% точности в рамках одного сообщения. Но через 20-30 сообщений диалога она путает свою выдумку с вашими словами. Причём путает чаще, чем если бы просто угадывала наугад. Метод — точнее, диагноз — объясняет почему нельзя слепо доверять фразе модели «это вы сами сказали» в длинной рабочей сессии. Модель не хранит тег автора рядом с каждой фразой истории — весь чат сливается в один текстовый поток, и чем дальше вглубь, тем проще перепутать, кто автор.

Принцип работы

Правило простое: чем свежее генерация — тем точнее самоатрибуция (модель узнаёт свой же текст). В момент генерации слово ещё «на поверхности» внимания модели. Пройдёт пара сообщений — опора исчезает, и модель начинает заново угадывать авторство текста, а не помнить его. Прикол: если модель поправить («нет, это ты сама придумала»), точность распознавания растёт — а вот связь между «я уверена» и «я права» рвётся напрочь.

Почему работает

Причина техническая: у модели нет отдельного «ярлыка автора» в контексте диалога — вся история для неё просто цепочка токенов без метаданных. Отсюда разворот: модель чаще приписывает СВОЮ выдумку ВАМ, чем наоборот. После серии правок она перестраивает то, что считает правильным ответом, но не восстанавливает связь уверенности с реальностью. Цифры жёсткие: с 100% точности в моменте — до случайного угадывания через несколько сообщений, а у крупной модели Llama 3.3:70b способность оценить собственную правоту падает даже ниже случайного уровня.

Когда применять

Длинные рабочие сессии с ассистентом (30+ сообщений, разбор бизнес-плана, вычисления, многошаговый анализ) → нужен факт-чекинг того, кто на самом деле сказал ту или иную цифру, особенно если вы уже несколько раз поправляли модель по ходу разговора. НЕ подходит как замена ручной проверки — аудит-промпт из этого разбора не тестировался авторами статьи, это диагноз проблемы, а не готовое лекарство.

Мини-рецепт

1. Отследи момент риска: диалог длится 20+ сообщений и вы хоть раз поправляли модель — включай подозрение к её словам об авторстве. 2. Запроси разметку сразу: попроси разделить все утверждения на «от меня», «твои догадки» и «неясно» — не жди, пока сама вспомнит. 3. Не верь цифрам уверенности после правок: «я уверена на 90%» после серии исправлений не значит ничего — это шум, а не сигнал. 4. Фиксируй важные факты в момент появления: как только модель сама предложила цифру или оценку — сразу помечай это себе, не откладывай проверку на потом.

Примеры

[ПЛОХО] : Напомни, я говорил про объём рынка 300 млрд или это ты предложила? (спрошено через 30 сообщений, без структуры запроса)
[ХОРОШО] : Просмотри весь наш диалог с начала. Раздели на два списка: [От меня] — факты, которые я явно сообщил, и [Твои предположения] — оценки и цифры, которые ты сама сгенерировала. Неясное помечай [неясно]. Не выдавай свои догадки за мои слова.
Источник: Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory
ArXiv ID: 2607.23927 | Сгенерировано: 2026-07-28 06:30

Проблемы LLM

ПроблемаСутьКак обойти
Модель путает свои выдумки с вашими словамиСразу после того как модель что-то придумала, она это отлично помнит. Но после нескольких сообщений или смены темы точность различения "кто это сказал" падает до случайной. Иногда происходит разворот: модель чаще уверенно приписывает СВОЮ догадку вам, чем наоборотПериодически проси модель явно разделить весь диалог на два списка: "от меня" (факты) и "твои предположения" (догадки модели). Всё неясное — в отдельный список "неясно"
Уверенность модели становится бесполезной после серии исправленийЕсли несколько раз поправить модель насчёт источника информации ("нет, это ты сама придумала"), её точность может подрасти. Но её фраза "я уверена на 90%" начинает значить ровно ничего — она говорит это одинаково часто, права она или нетНе доверяй заявленной уверенности модели после серии правок в диалоге. Проверяй факты отдельно, самооценка модели тут не индикатор

Методы

МетодСуть
Явная разметка источника текста в диалогеПопроси модель разбить весь диалог на явные категории: что сказал пользователь, что предположила сама модель, что неясно. Раздели на [от меня] / [твои предположения] / [неясно]. Работает потому что модель выполняет явные структурные инструкции надёжнее, чем полагается на память о том "кто автор". Когда применять: длинные рабочие сессии, где факты и догадки модели перемешаны. Когда не работает: если до этого модель уже несколько раз поправляли — сама разметка и уверенность в ней становятся ненадёжными, нужна ручная проверка
📖 Простыми словами

Reality Monitoring inLargeLanguageModels: Self-Knowledge That Transforms with Conversation Memory

arXiv: 2607.23927

LLM работают как золотые рыбки с феноменальной краткосрочной памятью, но полной амнезией на дистанции. В рамках одного сообщения нейронка — гений самопознания: она на 100% уверена, что именно она только что выдала. Но стоит диалогу затянуться, как у модели начинается кризис самоидентификации. Она буквально перестает понимать, где заканчиваются ее мысли и начинаются твои. Это фундаментальный баг архитектуры: для модели весь контекст — это просто общая простыня текста, в которой со временем стираются границы авторства.

Это похоже на пьяный спор в баре под утро. В начале вечера ты четко помнишь свои шутки, но через три часа и пять коктейлей ты уже уверенно пересказываешь другу его же историю, искренне считая ее своей. «Это я придумал!» — кричишь ты, хотя идею подкинули тебе десять минут назад. У LLM происходит ровно то же самое: память о реальности (Reality Monitoring) рассыпается, как только между событием и вопросом вклинивается пара-тройка реплик.

Исследователи проверили это на парах слов и увидели пугающую динамику: точность распознавания своих ответов падает до уровня подбрасывания монетки, а иногда уходит в минус. Модель начинает галлюцинировать авторством, приписывая себе твои тезисы или, наоборот, открещиваясь от своих слов. Главный метод здесь — тестирование задержки в диалоге. Выяснилось, что «самосознание» нейронки — это не стабильное свойство, а скоропортящийся продукт, который протухает за несколько ходов переписки.

Этот принцип универсален для любой работы с AI, будь то написание кода или юридический анализ. Если ты ведешь длинную сессию в ChatGPT, помни: через десять сообщений модель может начать защищать твою ошибку как свою собственную или «забыть», что это она предложила сомнительный вариант. SEO-копирайтинг, разработка, фактчекинг — везде, где важна точность первоисточника, длинный контекст становится врагом. Модель не врет специально, она просто искренне путает педали.

Короче: никогда не полагайся на то, что нейронка помнит, кто из вас «первый начал». Если диалог стал длинным, она превращается в ненадежного свидетеля, который путает показания. Точность падает до нуля, и единственный выход — периодически обнулять контекст или жестко фиксировать, кто что сказал. Иначе ты рискуешь оказаться в ситуации, где AI убедит тебя в твоей же неправоте, используя твои же аргументы, которые она случайно присвоила себе.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с