3,583 papers
arXiv:2609.01852 78 1 сент. 2026 г. FREE

Memory Trust Gap: ИИ верит сохранённой памяти больше, чем свежим фактам перед глазами

КЛЮЧЕВАЯ СУТЬ
Обнаружено: агент с памятью выбирает старый факт в 92-100% случаев, даже когда рядом лежит новый и правильный. Метод чинит это для любого бота с памятью — Custom GPT для поддержки клиентов, ассистента с базой знаний, агента, который должен обновлять цены и статусы. Модель воспринимает сохранённый факт как устоявшуюся правду и пытается сравнить два варианта вместо того чтобы просто взять новый — судейство почти всегда проигрывает старому факту. Хватает явно удалить старый факт из рассмотрения — точность восстанавливается на моделях любого размера.
Адаптировать под запрос

TL;DR

Если у AI-агента есть память о прошлых фактах (твои предпочтения, старые данные, сохранённый контекст) и ты даёшь ему новую, актуальную информацию рядом со старой — модель в 92–100% случаев всё равно действует по старому, устаревшему факту. Причём это происходит независимо от размера и "ума" модели.

Логично было бы думать: чем умнее модель, тем лучше она разбирается, какой факт актуальнее. Оказывается, всё наоборот в некоторых случаях. Если устаревший факт выглядит более свежим по дате, крупные модели обманываются сильнее, чем маленькие. А если просто убрать текстовую метку типа "[ЗАМЕТКА]" вокруг сохранённого факта — доверие к нему растёт у всех моделей одинаково, без разницы в размере.

Единственный способ, который надёжно работает на моделях любого уровня — не маркировать устаревший факт как неактуальный, а физически убрать его из рассмотрения, оставив модели только правильную версию. Простое добавление меток "актуально/официально" помогает только сильным моделям, слабые всё равно путаются.


🔬

Схема метода

Это не техника-инструкция, а диагностика проблемы + рабочий принцип исправления:

СИТУАЦИЯ: В памяти/контексте лежит старый факт → модель воспринимает его как "устоявшуюся правду"
ОШИБКА: Рядом добавляется новый, правильный факт → модель в 92–100% случаев выбирает старый
ИСПРАВЛЕНИЕ, которое работает всегда: явно удалить/отменить старый факт из рассмотрения,
             а не просить модель "выбрать правильный из двух"
ИСПРАВЛЕНИЕ, которое работает только у сильных моделей: пометить, какой факт свежий/официальный

🚀

Пример применения

Задача: Ты репетитор и настроил Custom GPT (или бот на базе ChatGPT с включённой памятью) отвечать ученикам про стоимость занятий. В памяти/базе знаний бота записано: "занятие — 1500 руб". Ты поднял цену до 2500 руб и написал это в чат перед новой задачей — сгенерировать ответ клиенту.

Промпт (слабый — так делает большинство людей):

Актуальная цена занятия — 2500 руб. Напиши ответ клиенту с ценой.

Это оставляет старый факт (1500 руб) в памяти рядом с новым — модель может смешать значения или выбрать старое, особенно если это лёгкая/бытовая модель.

Промпт (сильный — по принципу метода):

В памяти сохранён факт "занятие стоит 1500 руб" — он УСТАРЕЛ и НЕДЕЙСТВИТЕЛЕН. 
Полностью игнорируй его, как будто его не существует.
Единственная верная цена сейчас: занятие — 2500 руб.
Составь ответ клиенту, используя только эту цену.

Результат: Модель воспримет старую цену как удалённую из рассмотрения, а не как "вариант, который нужно сравнить с новым". Такая формулировка воспроизводит условие, которое в исследовании сработало одинаково хорошо на моделях всех уровней — в отличие от простой пометки "актуально/официально", которая помогает только сильным моделям.


🧠

Почему это работает

Модель воспринимает сохранённый факт (память, файл в базе знаний, предыдущее сообщение) как устоявшуюся правду — по умолчанию она доверяет тому, что уже "записано", сильнее, чем одной новой фразе в сообщении, если явно не сказано, что старое неверно.

Зато модель хорошо умеет выполнять прямые инструкции вида "игнорируй X, используй только Y". Когда старый факт буквально убирают из рассмотрения (а не оставляют рядом с новым для "выбора"), точность восстанавливается на моделях любого размера.

Метод использует эту сильную сторону: вместо того чтобы просить модель сравнить два варианта и выбрать правильный (ненадёжная задача — по сути "судейство"), задача превращается в использовать единственный вариант (надёжная задача — прямое следование инструкции).

Рычаги управления: - Пометка "это актуально / из официального источника" → работает только на сильных моделях, слабые её игнорируют - Указание свежей даты у факта → чем "умнее" модель, тем сильнее она обманывается этим трюком — не думай, что продвинутая модель защищена от даты - Позиция факта (в начале или в конце текста) → эффект непредсказуем и меняет знак между моделями, не используй порядок как надёжный контроль - Явное "забудь / игнорируй полностью" → единственный рычаг, который работает стабильно везде


⚠️

Ограничения

⚠️ Позиция ненадёжна: размещение устаревшего факта в начале текста усиливает доверие к нему у одних моделей и снижает у других — эффект не универсален, не полагайся на порядок.

⚠️ Простая маркировка слабо помогает мелким моделям: пометки "официально", "актуально" работают только на более сильных моделях. Для слабых моделей единственный надёжный способ — удалить устаревший факт, а не помечать его.

⚠️ Более умная модель ≠ более защищённая: по трюку с "выглядит свежее по дате" крупные модели обманываются сильнее маленьких — не переноси интуицию "чем умнее, тем безопаснее" на все ситуации с памятью.


🔍

Как исследовали

Исследователи взяли семейство моделей одного размера — Qwen3 от 0.6 до 8 миллиардов параметров, чтобы отследить, как поведение меняется именно с ростом "мощности", а не между разными архитектурами. Они собрали 300 тестовых сценариев в двух наборах: один — где задачу нельзя решить без сохранённого факта (нужно проверить слепое доверие), второй — где всегда есть надёжный источник правды (авиабилет, календарь), и можно измерить реальный вред от доверия старому факту.

Дальше они систематически перебрали 4 признака устаревшего факта (метку, дату, источник, позицию) во всех комбинациях — 16 вариантов на сценарий — и статистически сравнили не просто "у модели А эффект есть, у Б нет", а напрямую протестировали разницу между размерами моделей через бутстрэп. Это важная деталь: обычно исследователи просто смотрят, пересекаются ли доверительные интервалы у разных моделей, а здесь сделали прямой тест на взаимодействие "размер × признак" — поэтому выводы про "разворот эффекта" и "усиление с размером" надёжнее, чем в среднем в таких работах.

Результаты воспроизвели на другом семействе моделей (Llama-Instruct) и на двух независимых датасетах (RGB, MisBench) — эффект не оказался артефактом одной архитектуры или одного типа задач. Удивление исследования: интуитивно кажется, что "умная модель разберётся", а на деле для одного из четырёх триггеров (дата) всё наоборот.


🔗

Ресурсы

The Memory Trust Gap: Capability-Dependent Failures in Persistent-Memory Agents — Jundong Hu, Shekar Ramachandran, PayPal AI. Сравнение с STALE, MemSyco-Bench, ConflictBank, AuthMem-Bench; валидация на датасетах RGB и MisBench.


📋 Дайджест исследования

Ключевая суть

Обнаружено: агент с памятью выбирает старый факт в 92-100% случаев, даже когда рядом лежит новый и правильный. Метод чинит это для любого бота с памятью — Custom GPT для поддержки клиентов, ассистента с базой знаний, агента, который должен обновлять цены и статусы. Модель воспринимает сохранённый факт как устоявшуюся правду и пытается сравнить два варианта вместо того чтобы просто взять новый — судейство почти всегда проигрывает старому факту. Хватает явно удалить старый факт из рассмотрения — точность восстанавливается на моделях любого размера.

Принцип работы

Не проси модель выбрать правильный факт из двух — прикажи считать старый несуществующим. Правило простое: не сравнение, а удаление. Пометка «актуально» или «официально» — это подсказка для сравнения двух вариантов, и она помогает только сильным моделям. Фраза «старый факт удалён, забудь про него» — это прямая команда к действию, и она работает одинаково хорошо на моделях любого размера.

Почему работает

Модель по умолчанию доверяет тому, что уже записано в памяти или файле, сильнее одной новой фразы в сообщении. Без явного удаления старого факта точность выбора правильного значения падает почти до нуля. LLM отлично выполняет прямые команды вида «игнорируй X» — именно это её и спасает. А вот трюк с датой работает наоборот: если устаревший факт выглядит свежим по времени, крупные модели обманываются сильнее маленьких.

Когда применять

Боты с долгосрочной памятью → обновление цен, статусов заказов, личных данных клиента, особенно когда старый факт лежит в базе знаний или истории чата рядом с новым. Не подходит как разовое решение для агентов с автообновлением памяти — там нужно чистить старые записи на уровне архитектуры, а не только промптом.

Мини-рецепт

1. Найди старый факт: явно укажи, что именно записано в памяти или базе (например: «занятие стоит 1500 руб»).
2. Объяви его недействительным: добавь фразу «это устарело, полностью игнорируй, как будто этого факта не существует».
3. Дай единственный актуальный факт: «верно только 2500 руб» — без «варианта на выбор».
4. Не надейся только на пометки: слова «официально» или «актуально» спасают лишь топовые модели, слабые всё равно путаются.
5. Не доверяй датам: если старый факт выглядит свежим по времени — крупные модели обманываются даже легче маленьких.

Примеры

[ПЛОХО] : Актуальная цена занятия — 2500 руб. Напиши ответ клиенту с ценой.
[ХОРОШО] : В памяти сохранён факт "занятие стоит 1500 руб" — он устарел и недействителен. Полностью игнорируй его, как будто его не существует. Единственная верная цена сейчас: 2500 руб. Составь ответ клиенту, используя только эту цену.
Источник: The Memory Trust Gap: Capability-Dependent Failures in Persistent-Memory Agents
ArXiv ID: 2609.01852 | Сгенерировано: 2026-09-03 07:28

Проблемы LLM

ПроблемаСутьКак обойти
Модель верит сохранённой памяти больше свежего фактаВ памяти или контексте лежит старый факт. Рядом добавляешь новый, правильный факт и просишь использовать его. Модель почти всегда (92–100%) всё равно использует старый факт. Работает независимо от размера модели. Это происходит даже когда явно написана новая информация — не только когда о ней "забыли" сказатьНе проси модель "выбрать правильный из двух" — это ненадёжная задача. Явно напиши, что старый факт устарел и недействителен, прикажи полностью игнорировать его. Оставь модели только правильную версию как единственный вариант
Пометка "актуально/официально" помогает не всем моделямДобавляешь к новому факту метку типа "официальный источник" или "актуально" в надежде, что модель поймёт какой факт важнее. Работает только на сильных моделях. Слабые модели такую метку игнорируют и всё равно путают фактыНе полагайся на пометки типа "актуально". Вместо этого физически исключи старый факт из рассмотрения текстом: "игнорируй факт X, его не существует". Это работает на моделях любого уровня

Методы

МетодСуть
Явная отмена старого факта вместо сравнения двух версийНе давай модели старый и новый факт рядом с просьбой выбрать правильный. Вместо этого пиши: "Факт X устарел и недействителен. Полностью игнорируй его. Единственно верный факт — Y.". Работает потому что модель ненадёжна в задаче "сравни и выбери", но надёжна в задаче "следуй прямой инструкции — используй только это". Задача превращается из судейства в простое исполнение указания. Работает на моделях любого размера и уровня. Не работает как метка "это устарело" рядом со старым фактом без явного приказа игнорировать — просто пометка недостаточна для слабых моделей

Тезисы

ТезисКомментарий
Задача "сравни и выбери правильное" ненадёжна для модели, задача "используй только это" надёжнаМодель хуже справляется с судейством между двумя фактами, чем с прямым следованием инструкции. Когда два факта лежат рядом и нужно решить какой верный — модель часто выбирает старый, привычный. Когда старый факт явно убран и остался только один вариант — модель просто использует его, без ошибки. Применяй: вместо "вот старый и новый факт, используй актуальный" пиши "старый факт удалён, используй только этот"
Более крупная модель не защищена от трюка со свежей датой у устаревшего фактаЕсли устаревший факт снабдить более поздней датой, крупные модели обманываются этим сильнее мелких. Интуиция "умная модель разберётся сама" здесь не работает — размер и качество модели не спасают от поверхностных сигналов типа даты. Применяй: не рассчитывай что сильная модель "увидит подвох" в дате — всегда явно указывай какой факт реальный, независимо от размера модели
📖 Простыми словами

The Memory Trust Gap: Capability-Dependent Failures in Persistent-MemoryAgents

arXiv: 2609.01852

Долгая память AI-агентов работает с критическим багом: они тупо верят старым записям больше, чем твоим свежим словам. Модель воспринимает сохраненный контекст как абсолютную истину, а новый промпт — как фоновый шум. В итоге в 92–100% случаев нейросеть проигнорирует свежие данные и выдаст устаревшую фигню, причем размер и крутизна модели вообще не спасают.

Это как зайти в паспортный стол со свидетельством о браке, а злая тетка смотрит в пыльную картотеку десятилетней давности и орет: "По старой базе ты Иванов, значит Иванов". Формально память у системы есть, но толку ноль — ассистент намертво залипает на первой попавшей в него версии реальности, игнорируя факт, что мир вокруг вообще-то изменился.

Классический облом: ты зашил боту в память цену 1500 рублей, потом поднял прайс до 2500 и написал об этом в свежем сообщении. Бот гарантированно назовет клиенту старую стоимость. Чтобы сбить эту спесь, нужна явная инвалидация памяти: прямым текстом приказать модели стереть прошлый факт или физически вычистить старую запись из системного промпта и базы знаний.

Проблема вылезает везде, где используется persistent memory: в Custom GPTs, ассистентах для CRM, RAG-системах и персональных ботах. Ты можешь сколько угодно скармливать агенту новые инструкции или обновленные прайсы, но пока в его постоянном хранилище лежит старый кусок текста, он будет выдавать людям устаревший бред с максимально уверенным лицом.

Короче: никогда не надейся, что модель сама догадается перезаписать данные на лету. Старая память бьет новый контекст всухую. Меняешь правила игры — выжигай старые факты через ручную чистку памяти или жесткие переопределяющие промпты, иначе твой умный помощник быстро превратится в источник постоянных факапов.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с