3,583 papers
arXiv:2607.20734 74 22 июля 2026 г. FREE

Evolving Intent: LLM теряют нить разговора, когда вы уточняете, передумываете или переключаетесь на смежную задачу

КЛЮЧЕВАЯ СУТЬ
Обнаружено: даже топовые модели вроде GPT-5.5 теряют до 30% точности, когда задача раскрывается по кусочкам, а не одним сообщением. Хуже всего — смена темы посреди диалога: модель тащит за собой мёртвые детали старой задачи вместо новых. Техника чекпоинт контекста позволяет вручную заставить модель пересобрать актуальную картину, а не надеяться на её память. Просишь пересказать задачу заново — получаешь чистый список актуальных фактов, а не кашу из старого и нового.
Адаптировать под запрос

TL;DR

Когда вы формулируете задачу для ChatGPT одним развёрнутым сообщением — модель решает её почти идеально. Но живой диалог работает иначе: вы дополняете детали по ходу, поправляете то, что сказали раньше, и иногда переключаетесь на смежную задачу («найди ресторан» → «теперь забронируй его»). Исследователи взяли обычные проверяемые задачи (математика, SQL-запросы, поиск в интернете, код) и развернули их в такие диалоги, сохранив возможность автоматически проверить финальный ответ.

Результат неприятный: даже топовые модели вроде GPT-5.5 резко теряют точность, когда задача раскрывается по частям, правится и переключается — падение доходит до 20-30% по сравнению с той же задачей, заданной одним сообщением. Хуже всего модель справляется с переключением темы: она либо тащит за собой уже неактуальные детали из прошлой задачи, либо путает, что относится к новой задаче, а что к старой. Причина проста: у модели нет отдельного «счётчика» актуальных фактов — она держит весь диалог в одном потоке текста и плохо отличает, что уже устарело.

Готового рецепта исправления авторы не дают — эксперимент с «смягчающими стратегиями» в статье упомянут, но подробности не раскрыты. Зато из самой находки вытекает конкретная практика: не надеяться, что модель сама аккуратно «обновит» задачу в голове — после серии правок или смены темы стоит явно попросить её пересобрать весь контекст заново.


📌

Схема феномена

ТИП 1. РАСКРЫТИЕ → пользователь добавляет новую деталь к той же задаче
   "Найди ресторан в Нью-Йорке" → "Я вегетарианец, кстати"

ТИП 2. ПРАВКА → пользователь меняет уже названную деталь
   "Нью-Йорк" → "Хотя нет, лучше Бруклин"

ТИП 3. ПЕРЕКЛЮЧЕНИЕ → пользователь переходит на смежную задачу,
   часть деталей переносится
   "Найди ресторан" → "Теперь забронируй столик"

Каждый следующий переход добавляет деградацию точности. Переключение задачи — самый разрушительный тип: модель должна не просто добавить новую информацию, а понять, что часть старого контекста больше не релевантна.


🚀

Пример применения

Задача: Вы работаете с ChatGPT над рекламным постом для запуска нового продукта в Telegram-канале. Диалог растянут: сначала бриф неполный, потом вы уточняете аудиторию, потом меняете тон, а в конце просите переделать пост в email-рассылку.

Промпт (техника «чекпоинт контекста»):

Прежде чем продолжать, сформулируй заново всю задачу целиком —
так, как она стоит СЕЙЧАС, с учётом всех правок в этом разговоре.

Отдельно укажи:
1. Что мы делаем сейчас (финальная версия задачи)
2. Что изменилось по сравнению с началом разговора
3. Какие детали из начала диалога уже неактуальны и их нужно забыть

Результат: модель выдаст структурированный список — текущее состояние задачи, изменения, устаревшие детали. Вы сверяете этот список глазами и поправляете, если что-то пропущено, прежде чем просить финальный текст. Это снижает риск, что модель по инерции утащит тон или аудиторию из старой версии брифа.


🧠

Почему это работает

У модели нет отдельного «блокнота» с текущим статусом задачи — весь контекст живёт внутри истории сообщений вперемешку. Когда вы правите деталь или меняете тему, старая версия физически остаётся в тексте диалога, и модель должна сама угадать, что из этого уже неактуально. Именно с этим она справляется плохо — особенно если правок несколько.

При этом модель отлично умеет резюмировать по явному запросу — если попросить её прямо, она аккуратно перечислит текущий статус. Проблема не в том, что модель не может собрать актуальную картину, а в том, что она не делает это сама, если не попросить.

Рычаг управления: частота чекпоинтов. Для короткого диалога с одной правкой — не нужен. Для длинного диалога с несколькими уточнениями и сменой темы — стоит ставить чекпоинт после каждого переключения задачи, а не только в конце.


📋

Шаблон промпта

Прежде чем продолжать, сформулируй заново всю задачу так,
как она стоит сейчас: {что мы делаем}.

Учти все уточнения и правки, которые были в этом разговоре.
Укажи явно:
- что изменилось по сравнению с началом
- что из ранних сообщений уже неактуально и не должно влиять на результат

Подставьте в {что мы делаем} короткое описание текущей задачи (текст, код, план и т.д.) — модель сама подтянет остальное из истории диалога.


⚠️

Ограничения

⚠️ Не панацея: это компенсирующая практика читателя, не доказанное решение. В самой статье даже с учётом контекста модели путаются — особенно при переключении задачи в сочетании с правками.

⚠️ Слабее работает в агентных задачах: для работы с кодом или поиском в интернете деградация связана ещё и с тем, что модель тратит бюджет действий на «разведку» (поиск, просмотр файлов) вместо выполнения — простой чекпоинт текста это не лечит.

⚠️ Нужен контроль с вашей стороны: если вы сами не помните, что поменяли в разговоре, чекпоинт не поможет — модель резюмирует то, что видит в истории, а не то, что вы имели в виду.


🔍

Как исследовали

Исследователи взяли четыре проверяемых бенчмарка — математику (GSM8K), генерацию SQL-запросов (BIRD-SQL), агентный поиск (BrowseComp+) и решение багов в коде (SWE-Bench) — и автоматически развернули каждую задачу в диалог. Идея была элегантной: финальный вопрос задачи оставляли как есть (чтобы сохранить автоматическую проверку ответа), а всё, что было ДО него — раскрытие деталей, правки, переключение с похожей задачи — генерировали задом наперёд с помощью LLM.

Протестировали топовые модели: GPT-5.1/5.2/5.5, Gemini 3.1 Pro, Grok, Kimi K2.6, Mistral Large, DeepSeek V3.2. Сравнивали точность на диалоговой версии задачи с точностью на той же задаче, заданной одним сообщением. Разница оказалась ощутимой — падение доходило до 20-30%, причём больше переходов = больше падение, и переключение задачи било по точности сильнее, чем простое раскрытие или правка деталей. В агентных задачах (код, поиск) деградация была особенно сильной: модели тратили выделенный бюджет действий на «разведку» вместо реального выполнения, что дополнительно путало картину.


📋 Дайджест исследования

Ключевая суть

Обнаружено: даже топовые модели вроде GPT-5.5 теряют до 30% точности, когда задача раскрывается по кусочкам, а не одним сообщением. Хуже всего — смена темы посреди диалога: модель тащит за собой мёртвые детали старой задачи вместо новых. Техника чекпоинт контекста позволяет вручную заставить модель пересобрать актуальную картину, а не надеяться на её память. Просишь пересказать задачу заново — получаешь чистый список актуальных фактов, а не кашу из старого и нового.

Принцип работы

Правило простое: не жди, что модель сама подчистит устаревшие детали — проси её явно пересобрать задачу после каждой правки или смены темы. Модель работает как человек с плохой памятью, который держит весь разговор в одной куче бумаг вместо папок с ярлыками. Пока не скажешь «выбрось старое, вот что актуально сейчас», она держит и старое, и новое одновременно — и путает, что к чему относится.

Почему работает

Модель отлично умеет резюмировать по прямому запросу — если попросить, она аккуратно перечислит текущий статус задачи. Проблема не в неспособности, а в том что сама она это не делает. Весь диалог живёт одним потоком текста, без отдельного счётчика актуальных фактов — старая деталь физически остаётся в истории и путается с новой. Сильнее всего это бьёт при переключении темы: падение точности там резче, чем при простых уточнениях или правках.

Когда применять

Длинные рабочие диалоги с ChatGPT → конкретно для задач где параметры меняются на ходу или где вы переключаетесь на смежную подзадачу (нашли ресторан → бронируете столик), особенно когда диалог растянут на 5+ сообщений. Не подходит как автоматическое решение для агентных задач с кодом или поиском в интернете — там деградация ещё и от того что модель тратит ресурсы на разведку, а не только от путаницы в контексте.

Мини-рецепт

1. Замечай точки перелома: новая деталь, правка или смена темы — сигнал поставить чекпоинт.
2. Проси пересборку: Сформулируй заново всю задачу целиком так, как она стоит сейчас.
3. Раздели на три пункта: пусть модель отдельно укажет текущую версию задачи, что изменилось, и что уже неактуально.
4. Сверяй глазами: если модель забыла правку или тащит мёртвую деталь — поправь до того как просить финальный результат.
5. Ставь чекпоинт чаще при смене темы: для простого уточнения он не нужен, для переключения задачи — обязателен.

Примеры

[ПЛОХО] : Найди ресторан в Нью-Йорке... Я вегетарианец... Хотя нет, лучше Бруклин... Теперь забронируй столик на завтра — без чекпоинта модель может тащить Нью-Йорк, забыть про вегетарианство или спутать бронирование с поиском.
[ХОРОШО] : Прежде чем бронировать — сформулируй заново всю задачу: что мы делаем сейчас, что изменилось с начала разговора, что уже неактуально. Модель отвечает: "Бронируем вегетарианский ресторан в Бруклине на завтра, Нью-Йорк как локация уже неактуален" — и вы сразу видите, что она держит верный контекст.
Источник: LLMs Get Lost in Evolving User Intent
ArXiv ID: 2607.20734 | Сгенерировано: 2026-07-24 04:27

Проблемы LLM

ПроблемаСутьКак обойти
Модель теряет нить, когда задача раскрывается по частямТы не пишешь всё сразу. Добавляешь детали, поправляешь то что сказал раньше, иногда меняешь тему. Точность падает на 20-30% по сравнению с тем же заданием одним сообщением. Модель тащит устаревшие детали или путает что относится к новой задачеПосле нескольких правок или смены темы попроси модель заново сформулировать всю задачу целиком. Явно спроси что изменилось и что уже неактуально
Модель не отличает актуальный факт от устаревшегоВесь диалог хранится одним потоком текста. Когда ты меняешь деталь, старая версия физически остаётся в истории. Модели нужно самой угадать что уже неактуально — и она справляется с этим плохоНе полагайся что модель сама разберётся. Ставь контрольную точку: проси пересобрать текущий статус задачи вручную

Методы

МетодСуть
Чекпоинт контекста — принудительная пересборка задачиПопроси модель заново сформулировать всю задачу целиком, с учётом всех правок в разговоре. Укажи: что мы делаем сейчас / что изменилось / что уже неактуально. Работает потому что модель отлично резюмирует по явному запросу — просто не делает это сама. Применяй после каждого переключения темы в длинном диалоге, не только в конце. Не работает если ты сам не помнишь что поменял — модель резюмирует то, что видит в истории, а не то что ты имел в виду

Тезисы

ТезисКомментарий
Переключение темы вредит точности сильнее, чем уточнение или правка деталейКогда ты добавляешь деталь — модель просто дополняет картину. Когда правишь — заменяет одно значение другим. Но когда переключаешься на смежную задачу, модель должна понять что часть старого контекста больше не относится к делу вообще. Это сложнее чем добавить или заменить факт. Применяй: при смене темы в диалоге ставь чекпоинт обязательно, даже если для простых правок он не нужен
📖 Простыми словами

LLMsGet Lost in Evolving User Intent

arXiv: 2607.20734

LLM работают не как люди с памятью, а как текстовые калькуляторы: они не запоминают суть разговора, а каждый раз пересчитывают всю историю сообщений заново. Проблема в том, что внутри контекстного окна модели нет папки «актуальное» — там лежит огромная свалка из ваших старых правок, опечаток и передумок. Когда вы меняете условия задачи в процессе диалога, модель начинает путаться между тем, что вы просили вначале, и тем, что хотите сейчас. Она буквально вязнет в истории, не понимая, какая инструкция аннулирует предыдущую.

Это как пытаться собрать шкаф с инструктором, который помнит каждое ваше слово, но не умеет зачеркивать лишнее. Вы сначала сказали: «хочу синий», потом передумали: «нет, давай красный», а в итоге просите: «сделай его под дерево». Обычный человек просто выкинет мысли про цвета из головы, но нейронка продолжает видеть все три команды одновременно. В итоге она выдает мутанта из противоречий, потому что старые данные физически остаются в тексте и тянут модель назад, как гири на ногах.

Исследователи проверили это на жестких задачах вроде SQL-запросов и кода, где нельзя просто «налить воды». Выяснилось, что эволюция намерения — это криптонит для современных моделей. Пока вы даете задачу одним куском, всё летит идеально. Но стоит разбить процесс на этапы с уточнениями типа «забудь, что я сказал раньше» или «теперь переделай это под другой формат», как точность падает. Модель просто не вывозит динамический контекст и начинает галлюцинировать или цепляться за неактуальные детали.

Принцип универсален: будь то написание кода, планирование отпуска или верстка рекламного поста. Тестировали на математике и поиске, но в жизни это бьет по любому длинному чату. Чем дольше вы «допиливаете» результат в одном диалоге, тем выше шанс, что на десятом сообщении AI выдаст полную херню. Это не вы стали плохо объяснять, это модель захлебнулась в ваших собственных уточнениях. SEO для мозгов AI теперь требует не просто четких промптов, а гигиены диалога.

Главный вывод: не пытайтесь «выращивать» сложный результат в одном бесконечном чате. Если задача сильно изменилась или обросла кучей правок — открывайте новый чат и копируйте туда только финальное, актуальное состояние. Иначе вы потратите больше времени на борьбу с «памятью» модели, чем на саму работу. Либо вы даете чистый контекст, либо получаете результат, отравленный вашими же старыми идеями.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с