TL;DR
Языковая модель в рамках одного сообщения почти идеально помнит, что она сама только что придумала — 100% точности. Но стоит внести задержку (несколько сообщений, длинный диалог) между моментом, когда модель что-то сгенерировала, и моментом, когда её спрашивают "это ты сказала или я" — точность падает до случайной, а иногда даже разворачивается: модель чаще путает свои слова с чужими, чем наоборот.
Самое неприятное — это работает не так, как ожидаешь. Если поправлять модель ("нет, это не так, это ты сама придумала"), она может стать точнее в определении источника. Но при этом её заявленная уверенность отрывается от правильности ответа. То есть после серии исправлений модель говорит "я уверена на 90%" одинаково часто — была она права или нет. Уверенность превращается в шум.
Это не техника, а предупреждение о механике LLM в длинных диалогах: модель не хранит отдельную "метку источника" для каждого кусочка текста в истории чата. Всё, что она сама сказала раньше и что сказали вы — со временем сливается в единый поток текста, и различить, кто автор, становится всё труднее, особенно после того как её несколько раз поправляли.
Схема механики проблемы
ШАГ 1: Модель генерирует текст (в т.ч. ошибочный/выдуманный) → попадает в историю диалога
ШАГ 2: Проходит время — несколько сообщений или отдельный блок разговора (episodic delay) →
прямой сигнал "это я только что сказала" исчезает из активного контекста
ШАГ 3: Вы спрашиваете "откуда это?" → точность различения падает с ~100% до близкой к случайной,
иногда полностью разворачивается (модель увереннее приписывает СВОЮ выдумку ВАМ)
ШАГ 4 (если вы поправляете модель): точность по одному типу источника растёт,
но связь между "я уверена" и "я права" рвётся — уверенность становится бесполезным сигналом
Пример применения
⚠️ Важно: промпт ниже — не то, что тестировали авторы (в эксперименте использовались искусственные пары слов). Это моя адаптация находки под реальную рабочую задачу. В статье нет протестированного способа "исправить" проблему — только диагноз.
Задача: Долгая рабочая сессия с ассистентом — например, вы 40+ сообщений разбираете с ним бизнес-план: обсуждаете рынок, считаете unit-экономику, спорите про цифры. В какой-то момент модель сама предположила цифру (например, "объём рынка — примерно 300 млрд рублей"), вы не заметили, что это её догадка, а не ваш факт. Через 20 сообщений вы спрашиваете "напомни, откуда эта цифра" — и рискуете получить ответ, будто это вы её сообщили.
Промпт:
Просмотри весь наш диалог с начала. Составь два списка:
1. [От меня] — факты, цифры и условия, которые я тебе явно сообщил.
2. [Твои предположения] — оценки, догадки, примеры и цифры,
которые ты сама сгенерировала или предложила, даже если они звучали как факты.
Если не можешь точно определить источник конкретного утверждения —
помечай его как [неясно]. Не выдавай свои предположения за мои слова.
Результат: Модель выдаст два размеченных списка. Но по данным исследования — доверять этой разметке полностью нельзя, особенно если до этого вы уже несколько раз её поправляли: чем длиннее диалог и чем больше было правок, тем ненадёжнее становится и сама разметка, и уверенность, с которой модель её делает. Используйте список как отправную точку для ручной проверки, а не как финальный вердикт.
Почему это происходит
Модель не хранит отдельный "тег автора" рядом с каждым фрагментом истории диалога. Всё, что происходило в чате — ваши слова и её собственные ответы, — превращается в единый текстовый поток. В рамках одного сообщения свежесгенерированное слово ещё "на поверхности" внимания модели, поэтому распознать его легко. Но чем дальше это уходит в историю, тем меньше у модели опоры, кроме как заново читать и интерпретировать текст — а тут начинаются ошибки.
Сильная сторона LLM — она хорошо выполняет явные структурные инструкции ("раздели на две категории", "помечай неясное отдельно"). Поэтому явный запрос на разметку источников работает лучше, чем надежда, что модель "сама помнит". Но это не решает проблему полностью: исследование показывает, что даже с исправлениями и явными подсказками точность деградирует, а уверенность модели становится оторванной от правильности.
Рычаг, который стоит запомнить: если вы часто поправляете модель в длинном диалоге ("нет, это не так", "я не говорил этого") — не доверяйте её фразам вроде "я уверена в этом". После серии правок уверенность модели перестаёт коррелировать с тем, права она или нет.
Ограничения
⚠️ Деградация с длиной диалога: чем больше сообщений прошло между моментом, когда модель что-то сказала, и моментом проверки источника — тем хуже она различает "моё" и "ваше". Нет чёткого порога, после которого это стабилизируется.
⚠️ Фидбек — палка о двух концах: исправление модели может улучшить точность распознавания источника для одного типа информации, но одновременно разрушает связь между её уверенностью и правильностью ответа. После цикла правок фразы "я на 90% уверена" ничего не значат.
⚠️ Нет проверенного решения: авторы диагностируют проблему, но не предлагают и не тестируют промпт-технику для её исправления. Аудит-промпт выше — экстраполяция, не протестированный в статье метод.
⚠️ Размер модели не гарантия: более крупные модели (Llama 3.3:70b) в целом лучше, но и они показывают странные провалы — например, точность растёт, а способность оценить собственную правоту падает ниже случайной.
Как исследовали
Команда взяла классическую психологическую парадигму reality monitoring (способность человека определить, было ли воспоминание реально увиденным или им самим придуманным) и адаптировала её для LLM. Модели видели пары слов: либо получали пару целиком и должны были воспроизвести второе слово (имитация "восприятия"), либо получали только первое слово и сами придумывали второе (имитация "воображения"). Затем модель спрашивали — было это слово дано ей или она сама его выдумала.
Проверили шесть моделей (Gemma 3 на 12B и 27B, с квантованием и без, Llama 3.3:70B, Llama 4 sparse MoE 16×17B) в трёх архитектурах диалоговой памяти: всё в одном сообщении, разбито на последовательные сообщения, и с настоящей задержкой — блок из 20-40 пар, а потом отдельная фаза проверки источника, с фидбеком и без.
Удивил разворот: в простом варианте (без задержки) внутренне сгенерированные слова узнавались идеально, а внешне заданные — хуже. Но с задержкой всё наоборот — внешние узнаются лучше, внутренние хуже. Это значит, что "идеальная" память модели на собственные слова в короткой сессии — это не признак настоящего самопознания, а просто эффект того, что слово ещё физически в активном окне внимания. Как только эта опора убирается — способность рушится.
Ресурсы
Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory — препринт (не прошёл рецензирование). Авторы: Saurabh Ranjan, Konstantina Sokratous, Brian Odegaard — University of Florida, University of Missouri.
