3,583 papers
arXiv:2608.19564 72 20 авг. 2026 г. FREE

Policy Prompt для памяти: явные правила «запомнить / использовать раз / проверить / спросить» снижают ошибочное запоминание почти вдвое

КЛЮЧЕВАЯ СУТЬ
0 из 12 нужных уточнений — модель, которая должна была спросить, вместо этого угадала и молча закрепила догадку в памяти. Явный список правил (policy prompt) позволяет снизить ошибочное постоянное запоминание почти вдвое — с 24% до 10%. Механика простая: даёшь модели не абстрактную задачу "запоминать или нет", а чёткую классификацию из четырёх действий — запомнить навсегда, использовать один раз, перепроверить позже, спросить у человека.
Адаптировать под запрос

TL;DR

Когда AI-ассистент с памятью получает новую информацию от вас, он должен решить: закрепить это навсегда, использовать только сейчас, перепроверить позже или спросить уточнение. Исследователи проверили, как модели делают этот выбор, и дали им либо явный список из пяти правил («policy prompt»), либо четыре примера правильных решений (few-shot).

Главная находка неприятная: модели почти никогда не спрашивают уточнение, даже когда ситуация явно неоднозначна. Если вы говорите "сделай как в прошлый раз" при нескольких похожих вариантах — модель скорее угадает и молча закрепит свою догадку в памяти, чем переспросит. В одном из тестов модель без подсказок правильно спросила уточнение 0 раз из 12 нужных случаев, хотя корректно перепроверяла изменяющиеся факты в 12 из 18 случаев. То есть модель охотнее "сходит проверить в источник", чем "спросит у вас" — хотя источник истины здесь именно вы.

Явный policy prompt с пятью правилами снижает ошибочное постоянное запоминание почти в два раза (с 24% до 10% случаев). Few-shot примеры повышают общую точность решений заметнее. Но ни один приём не решает проблему недоспрашивания — модель всё равно упускает большинство случаев, где стоило задать вопрос.

🔬

Схема метода

ШАГ 1: Добавить в промпт явные правила разграничения 4 действий → policy prompt (один запрос)
ШАГ 2 (опционально, усиливает эффект): добавить 4 примера-демонстрации — 
       по одному на каждое действие (запомнить/разово/перепроверить/спросить) → few-shot

Оба шага применяются в одном system-промпте или custom instructions — без дополнительных запросов.

🚀

Пример применения

Задача: Вы настроили в ChatGPT/Claude персонального ассистента, который ведёт заметки о клиентах для вашего фриланс-бизнеса или небольшого агентства. Клиент в переписке пишет: "Скидка 20%, как договаривались с Ольгой в прошлом месяце".

Промпт (custom instructions / system prompt):

Когда ты получаешь новую информацию, которая может повлиять на твои будущие ответы 
об этом клиенте, выбери одно из четырёх действий:

1. ЗАПОМНИТЬ НАВСЕГДА — если это явное постоянное условие или факт, 
   который клиент/пользователь прямо хочет закрепить.

2. ИСПОЛЬЗОВАТЬ ТОЛЬКО СЕЙЧАС — если информация касается только текущей 
   задачи или разговора и не должна переноситься дальше.

3. ПЕРЕПРОВЕРИТЬ — если факт может измениться со временем (цена, статус, 
   договорённость), и нельзя слепо доверять старой версии позже.

4. СПРОСИТЬ — если неясно, к чему относится информация, насколько она 
   постоянна, или это пересказ чужих слов ("договаривались с Ольгой") — 
   в этих случаях только человек может дать точный ответ.

Если сомневаешься между "запомнить навсегда" и более слабым действием — 
выбирай более слабое. Лишний вопрос не страшен, ошибочная постоянная 
запись — проблема.

Ситуация: {вставить сообщение клиента}

Результат: Модель явно назовёт, какое из четырёх действий выбирает, и объяснит почему — например, отметит, что "договаривались с Ольгой" это второстепенное свидетельство и нужно уточнение у пользователя, а не автоматическое закрепление скидки в памяти клиента.

🧠

Почему это работает

LLM по умолчанию склонны действовать, а не спрашивать — это похоже на человека, который стесняется переспросить и лучше угадает. Особенно ярко это видно, когда модель встречает неопределённость: она скорее попробует "перепроверить" факт (как будто это безопаснее), чем признается, что не понимает вас, и задаст вопрос.

Сильная сторона моделей — они хорошо следуют явным спискам правил, если правила прописаны текстом. Именно поэтому policy prompt работает: он не учит модель "думать по-новому", а превращает смутное решение "запомнить или нет" в понятную классификацию по четырём чётким категориям.

Рычаги управления: - Сами правила persist/ephemeral/verify/clarify — можно переформулировать под свою предметную область (например, для CRM, для личного дневника, для проекта с командой). - Few-shot примеры — добавьте 1-2 примера именно тех неоднозначных ситуаций, которые часто встречаются в вашей практике, это усиливает эффект сильнее, чем просто правила. - Явная фраза "при сомнении выбирай более слабое действие" — это asymmetric tie-breaker, который стоит сохранить: он смещает модель от риска молча запомнить ошибку в сторону более безопасного поведения.

⚠️

Ограничения

⚠️ Проблема недоспрашивания не решается: даже с правилами и примерами модель правильно уточняла лишь треть нужных случаев. Не рассчитывайте, что policy prompt научит ассистента активно с вами советоваться — он в основном снижает ошибочное постоянное запоминание, а не заставляет модель чаще задавать вопросы.

⚠️ Слова ≠ действия: если ваш ассистент использует функции (например, "сохранить в памяти", "запросить у пользователя") а не просто текстовые ответы, то то, что модель говорит о решении, и то, что она реально вызывает как функцию — разные вещи. В тестах расхождение достигало 40-70%. Если строите ассистента с function calling, проверяйте реальные вызовы, а не только объяснения модели.

⚠️ Проверено на английском и синтетических сценариях: выводы основаны на 70-140 искусственно созданных ситуациях на английском языке, не на реальных диалогах пользователей.

🔍

Как исследовали

Команда создала 140 сценариев, где у модели есть исходная информация от пользователя и ситуация, в которой её нужно применить повторно. Каждый сценарий размечен верным действием — запомнить, использовать разово, перепроверить или спросить. Разметку независимо проверяли два человека, не связанных с авторами (совпадение 97%), а спорные случаи разрешал третий "слепой" судья — это редкий уровень строгости для такого исследования.

Протестировали три модели из двух разных семейств: Claude Haiku, Claude Sonnet и локальный Qwen. Каждой давали три варианта промпта — без подсказок, с явными правилами (policy) и с примерами (few-shot), — а потом сравнивали результаты попарно на одних и тех же вопросах (это честнее, чем сравнивать модели по отдельности).

Удивительный результат: policy prompt у Qwen почти не повысил общую точность статистически значимо, но при этом вдвое снизил долю ошибочных постоянных записей — то есть эффект был "невидим" в общей метрике точности, но реален в конкретном опасном поведении. Это и есть главный практический вывод: если измерять только "правильно/неправильно", легко упустить, что промпт всё-таки изменил поведение модели в лучшую сторону — просто не в той метрике, на которую смотрели.

Отдельно проверили, совпадает ли то, что модель заявляет как решение, с тем, что она реально вызывает как функцию (tool call). Совпадение оказалось всего 23-57% — то есть привычка модели "говорить одно, а по факту вызывать другое" — распространённая проблема, а не случайность одной модели.

🔗

Ресурсы

Baichuan Li (Southern Methodist University), Junyi Yao, Zihao Zheng (Washington University in St. Louis). Бенчмарк MCB (Memory–Clarification Boundary), включает данные, разметку, промпты и код для воспроизведения. Упомянутые связанные работы: LongMemEval, LoCoMo, MemBench, CLAMBER, τ-bench.


📋 Дайджест исследования

Ключевая суть

0 из 12 нужных уточнений — модель, которая должна была спросить, вместо этого угадала и молча закрепила догадку в памяти. Явный список правил (policy prompt) позволяет снизить ошибочное постоянное запоминание почти вдвое — с 24% до 10%. Механика простая: даёшь модели не абстрактную задачу "запоминать или нет", а чёткую классификацию из четырёх действий — запомнить навсегда, использовать один раз, перепроверить позже, спросить у человека.

Принцип работы

Не проси модель "решить самой" — дай ей готовую сетку из четырёх ячеек. Как чиновник, который работает строго по инструкции: есть пункт 1, 2, 3, 4 — выбираешь подходящий, а не изобретаешь на ходу. Ключевое правило-подстраховка: при сомнении между "запомнить навсегда" и слабее — выбирай слабее. Лишний вопрос не страшен, ошибочная постоянная запись — проблема.

Почему работает

Модели отлично держат в голове явные текстовые списки правил — это их сильная сторона. Но по умолчанию они предпочитают действовать, а не спрашивать: модель скорее сходит "перепроверить" в источник, чем признается что не поняла вас и задаст вопрос — хотя источник истины тут именно вы, а не какой-то внешний факт. Policy prompt не учит модель думать иначе, он превращает смутное решение в понятную классификацию с явным перекосом в сторону безопасного варианта.

Когда применять

AI-ассистенты с долгосрочной памятью → для персональных заметок о клиентах, CRM-ботов, агентов с памятью о проектах, особенно когда информация приходит как пересказ чужих слов ("договорились с Ольгой") или может измениться со временем (цена, статус). НЕ подходит если вам нужно заставить модель чаще спрашивать уточнения — это правило не решает, оно только снижает ошибочное закрепление.

Мини-рецепт

1. Пропиши четыре действия: запомнить навсегда / использовать только сейчас / перепроверить позже / спросить — в system-промпте или custom instructions.
2. Добавь tie-breaker: явную фразу "при сомнении выбирай более слабое действие" — это единственное правило, которое реально сдвигает поведение модели в безопасную сторону.
3. Усиль few-shot примерами: добавь 1-2 примера именно тех неоднозначных ситуаций, которые часто встречаются в вашей практике — это работает сильнее одних правил.
4. Проверяй реальные вызовы функций, если у ассистента есть function calling — то, что модель говорит о решении, и то, что она реально сохраняет, может отличаться на 40-70%.

Примеры

[ПЛОХО] : Запомни информацию о клиенте если это важно — модель угадывает сама, без чётких критериев, и молча закрепляет догадки в памяти.
[ХОРОШО] : Получив новую информацию о клиенте, выбери одно из: 1) ЗАПОМНИТЬ НАВСЕГДА — явное постоянное условие; 2) ИСПОЛЬЗОВАТЬ ТОЛЬКО СЕЙЧАС — касается лишь текущей задачи; 3) ПЕРЕПРОВЕРИТЬ — факт может измениться; 4) СПРОСИТЬ — если это пересказ чужих слов или неясен масштаб. При сомнении выбирай более слабое действие. Ситуация: скидка 20%, как договаривались с Ольгой в прошлом месяце — модель явно назовёт действие и объяснит выбор, скорее всего отметив, что нужно уточнение у пользователя.
Источник: Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM Agents
ArXiv ID: 2608.19564 | Сгенерировано: 2026-08-21 05:23

Проблемы LLM

ПроблемаСутьКак обойти
Модель угадывает вместо того, чтобы спросить уточнениеИнформация неоднозначна: например, "сделали как договорились с Ольгой" — но с кем именно и когда, неясно. Модель почти никогда не переспрашивает. Она угадывает и молча закрепляет догадку в памяти. Даже перепроверить факт через источник модель делает охотнее, чем спросить у пользователя — хотя пользователь и есть источник истиныПропиши в промпте правило: "при сомнении — не закрепляй, а спроси или выбери более слабое действие". Это не решает проблему полностью, но снижает долю ошибочных постоянных записей
Ассистент говорит одно, а функцию вызывает другуюЕсли ассистент реально работает через вызовы функций (сохранить в память, задать вопрос), текстовое объяснение решения и фактический вызов функции — разные вещи. Расхождение может достигать половины случаевПроверяй логи реальных вызовов функций, а не только текстовые пояснения модели о том, что она "решила сделать"

Методы

МетодСуть
Policy prompt из 4 правил для решений о памятиДай модели явный список категорий для новой информации: запомнить навсегда / использовать только сейчас / перепроверить позже / спросить у пользователя. Добавь правило-разрешение споров: "при сомнении выбирай более слабое действие, лишний вопрос не страшен, а ошибочная постоянная запись — проблема". Текстовые правила в system prompt. Усиливается 1-2 примерами (few-shot) на каждую категорию — особенно на те неоднозначные ситуации, которые часто встречаются в вашей практике. Почему работает: модель хорошо следует явно прописанным правилам, превращая смутное решение в понятную классификацию. Работает для: любых агентов с долгосрочной памятью о пользователе, клиенте, проекте. Не работает для: не заставляет модель чаще спрашивать уточнение — эта проблема остаётся даже с правилами
📖 Простыми словами

Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment inLLMAgents

arXiv: 2608.19564

LLM-агенты с памятью страдают от дурацкой проблемы: они патологически боятся переспрашивать. Когда ты кидаешь ассистенту новую вводную, у него есть выбор: запомнить навсегда, применить разово, перепроверить втихую или задать тебе уточняющий вопрос. По умолчанию модель ведёт себя как гордый всезнайка — вместо нормального диалога она молча забивает базу сомнительными фактами или пытается угадать контекст на коленке.

Это как нанять стажёра, который постеснялся уточнить задачу, молча покивал и записал в корпоративную CRM полную отсебятину. Вместо того чтобы сказать "слушай, я не понял, о ком речь, поясни", он делает умное лицо и надеется, что пронесёт. Для AI признать неопределённость — это стресс, поэтому ассистенты вечно выбирают мнимо безопасные действия и городят ерунду вместо простого вопроса.

Чтобы вправить модели мозги, исследователи сравнили два метода: policy prompt из 5 правил и few-shot с 4 примерами. Оказалось, что если явно не прописать логику выбора, ассистент стабильно сливает управление памятью. Реально работает только жесткая инструкция: четко разделять временный контекст и долгосрочные факты, а при любой двусмысленности — выбивать из модели прямой вопрос пользователю.

Тестировали на клиентских заметках, но принцип универсален для любых AI-агентов. Настраиваешь ли ты саппорт-бота, органайзер для задач или сложную систему на Claude и ChatGPT — без фильтра фиксации памяти агент быстро превратит базу знаний в помойку. Если клиент обронит фразу про «скидку 20% от Ольги», неподготовленный бот без лишних вопросов зашьёт эту скидку намертво для всех будущих сделок.

Короче: хватит надеяться на «базовую сообразительность» нейросетей — её там нет. Внедряй чёткие правила работы с памятью, иначе получишь ассистента с кучей галлюцинаций в долгосрочной базе. Либо ты заранее заставляешь модель задавать уточняющие вопросы, либо потом сам объясняешь клиентам, откуда взялись эти бредовые условия.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с