TL;DR
Если у AI-агента есть память о прошлых фактах (твои предпочтения, старые данные, сохранённый контекст) и ты даёшь ему новую, актуальную информацию рядом со старой — модель в 92–100% случаев всё равно действует по старому, устаревшему факту. Причём это происходит независимо от размера и "ума" модели.
Логично было бы думать: чем умнее модель, тем лучше она разбирается, какой факт актуальнее. Оказывается, всё наоборот в некоторых случаях. Если устаревший факт выглядит более свежим по дате, крупные модели обманываются сильнее, чем маленькие. А если просто убрать текстовую метку типа "[ЗАМЕТКА]" вокруг сохранённого факта — доверие к нему растёт у всех моделей одинаково, без разницы в размере.
Единственный способ, который надёжно работает на моделях любого уровня — не маркировать устаревший факт как неактуальный, а физически убрать его из рассмотрения, оставив модели только правильную версию. Простое добавление меток "актуально/официально" помогает только сильным моделям, слабые всё равно путаются.
Схема метода
Это не техника-инструкция, а диагностика проблемы + рабочий принцип исправления:
СИТУАЦИЯ: В памяти/контексте лежит старый факт → модель воспринимает его как "устоявшуюся правду"
ОШИБКА: Рядом добавляется новый, правильный факт → модель в 92–100% случаев выбирает старый
ИСПРАВЛЕНИЕ, которое работает всегда: явно удалить/отменить старый факт из рассмотрения,
а не просить модель "выбрать правильный из двух"
ИСПРАВЛЕНИЕ, которое работает только у сильных моделей: пометить, какой факт свежий/официальный
Пример применения
Задача: Ты репетитор и настроил Custom GPT (или бот на базе ChatGPT с включённой памятью) отвечать ученикам про стоимость занятий. В памяти/базе знаний бота записано: "занятие — 1500 руб". Ты поднял цену до 2500 руб и написал это в чат перед новой задачей — сгенерировать ответ клиенту.
Промпт (слабый — так делает большинство людей):
Актуальная цена занятия — 2500 руб. Напиши ответ клиенту с ценой.
Это оставляет старый факт (1500 руб) в памяти рядом с новым — модель может смешать значения или выбрать старое, особенно если это лёгкая/бытовая модель.
Промпт (сильный — по принципу метода):
В памяти сохранён факт "занятие стоит 1500 руб" — он УСТАРЕЛ и НЕДЕЙСТВИТЕЛЕН.
Полностью игнорируй его, как будто его не существует.
Единственная верная цена сейчас: занятие — 2500 руб.
Составь ответ клиенту, используя только эту цену.
Результат: Модель воспримет старую цену как удалённую из рассмотрения, а не как "вариант, который нужно сравнить с новым". Такая формулировка воспроизводит условие, которое в исследовании сработало одинаково хорошо на моделях всех уровней — в отличие от простой пометки "актуально/официально", которая помогает только сильным моделям.
Почему это работает
Модель воспринимает сохранённый факт (память, файл в базе знаний, предыдущее сообщение) как устоявшуюся правду — по умолчанию она доверяет тому, что уже "записано", сильнее, чем одной новой фразе в сообщении, если явно не сказано, что старое неверно.
Зато модель хорошо умеет выполнять прямые инструкции вида "игнорируй X, используй только Y". Когда старый факт буквально убирают из рассмотрения (а не оставляют рядом с новым для "выбора"), точность восстанавливается на моделях любого размера.
Метод использует эту сильную сторону: вместо того чтобы просить модель сравнить два варианта и выбрать правильный (ненадёжная задача — по сути "судейство"), задача превращается в использовать единственный вариант (надёжная задача — прямое следование инструкции).
Рычаги управления: - Пометка "это актуально / из официального источника" → работает только на сильных моделях, слабые её игнорируют - Указание свежей даты у факта → чем "умнее" модель, тем сильнее она обманывается этим трюком — не думай, что продвинутая модель защищена от даты - Позиция факта (в начале или в конце текста) → эффект непредсказуем и меняет знак между моделями, не используй порядок как надёжный контроль - Явное "забудь / игнорируй полностью" → единственный рычаг, который работает стабильно везде
Ограничения
⚠️ Позиция ненадёжна: размещение устаревшего факта в начале текста усиливает доверие к нему у одних моделей и снижает у других — эффект не универсален, не полагайся на порядок.
⚠️ Простая маркировка слабо помогает мелким моделям: пометки "официально", "актуально" работают только на более сильных моделях. Для слабых моделей единственный надёжный способ — удалить устаревший факт, а не помечать его.
⚠️ Более умная модель ≠ более защищённая: по трюку с "выглядит свежее по дате" крупные модели обманываются сильнее маленьких — не переноси интуицию "чем умнее, тем безопаснее" на все ситуации с памятью.
Как исследовали
Исследователи взяли семейство моделей одного размера — Qwen3 от 0.6 до 8 миллиардов параметров, чтобы отследить, как поведение меняется именно с ростом "мощности", а не между разными архитектурами. Они собрали 300 тестовых сценариев в двух наборах: один — где задачу нельзя решить без сохранённого факта (нужно проверить слепое доверие), второй — где всегда есть надёжный источник правды (авиабилет, календарь), и можно измерить реальный вред от доверия старому факту.
Дальше они систематически перебрали 4 признака устаревшего факта (метку, дату, источник, позицию) во всех комбинациях — 16 вариантов на сценарий — и статистически сравнили не просто "у модели А эффект есть, у Б нет", а напрямую протестировали разницу между размерами моделей через бутстрэп. Это важная деталь: обычно исследователи просто смотрят, пересекаются ли доверительные интервалы у разных моделей, а здесь сделали прямой тест на взаимодействие "размер × признак" — поэтому выводы про "разворот эффекта" и "усиление с размером" надёжнее, чем в среднем в таких работах.
Результаты воспроизвели на другом семействе моделей (Llama-Instruct) и на двух независимых датасетах (RGB, MisBench) — эффект не оказался артефактом одной архитектуры или одного типа задач. Удивление исследования: интуитивно кажется, что "умная модель разберётся", а на деле для одного из четырёх триггеров (дата) всё наоборот.
Ресурсы
The Memory Trust Gap: Capability-Dependent Failures in Persistent-Memory Agents — Jundong Hu, Shekar Ramachandran, PayPal AI. Сравнение с STALE, MemSyco-Bench, ConflictBank, AuthMem-Bench; валидация на датасетах RGB и MisBench.
