3,583 papers
arXiv:2608.02556 76 3 авг. 2026 г. FREE

Контекст диалога — половина запроса: почему нельзя судить по последнему сообщению

КЛЮЧЕВАЯ СУТЬ
44,7% ответов ИИ меняются по существу, если убрать историю переписки перед последним сообщением — не стиль, не длина, а сама рекомендация. Исследование показывает: нельзя переносить долгий диалог в новый чат одним финальным вопросом — модель отвечает буквально, забыв бюджет, отказы, ограничения. Сжатый пересказ истории до 160 слов (цели, ограничения, отвергнутые варианты) снижает долю испорченных ответов с 44,7% до 30,8% — но треть всё равно расходится по существу.
Адаптировать под запрос

TL;DR

Исследователи проверили: если дать модели только последнее сообщение пользователя (без переписки перед ним), ответ изменится по существу почти в половине случаев — 44,7%. Не изменится тон или длина, изменится суть: другая рекомендация, другой факт, другое решение — «отвечать или уточнять».

Причина проста: последнее сообщение в диалоге — это не самостоятельный запрос, а обновление состояния. Пользователь сказал «хочу ноутбук для путешествий», потом добавил бюджет, отверг один вариант, а закончил фразой «какой лучше?». Без этой истории модель не знает бюджет, не знает, что вариант уже отвергнут — и выдаёт правдоподобный, но неверный по сути ответ.

Решение — не обязательно тащить весь диалог. Достаточно сжатого пересказа предыдущих реплик (до 160 слов: цели, ограничения, отвергнутые варианты, что решено, что нет) — это снижает долю «испорченных» ответов с 44,7% до 30,8% и почти убирает разницу в качестве. Но полностью не заменяет полный диалог — треть ответов всё равно расходится по существу.


🔬

Схема метода

УСЛОВИЕ A (полный контекст): 
  Модели дают всю переписку + последнее сообщение → ответ

УСЛОВИЕ B (изоляция):
  Модели дают только последнее сообщение → ответ

УСЛОВИЕ C (сжатие):
  Отдельным запросом сжимают ВСЮ переписку КРОМЕ последнего сообщения 
  в пересказ до 160 слов (цели, ограничения, отвергнутые варианты, что решено)
  → этот пересказ + последнее сообщение → ответ

СРАВНЕНИЕ:
  Судья (отдельная модель) видит все 3 ответа под случайными метками 
  → решает: отличаются ли ответы ПО СУТИ (не по стилю)

Все три ответа генерируются отдельными запросами. Сжатие — тоже отдельный запрос, причём модель, которая сжимает, не видит последнее сообщение — чтобы не подгоняла пересказ под ответ.


🚀

Пример применения

Задача: Вы консультируетесь с ChatGPT по выбору CRM для своего бизнеса. В начале разговора обсудили бюджет (до 50 тыс. руб/мес), отказались от Битрикс24 из-за сложности внедрения, обсудили нужную интеграцию с Telegram. Через 20 сообщений спрашиваете: «Ну так что выбрать?»

Промпт (для проверки, теряется ли контекст):

Вот вся моя переписка с тобой про выбор CRM [вставить историю].

Мой последний вопрос: "Ну так что выбрать?"

Ответь на него, учитывая весь контекст переписки — 
бюджет, отвергнутые варианты, требования к интеграциям.

Результат: Если вы зададите тот же вопрос в новом чате без контекста — «Помоги выбрать CRM для бизнеса» — модель предложит популярный вариант (возможно, тот же Битрикс24), не зная о вашем бюджете и отказе. Ответ будет звучать уверенно и по существу — но окажется бесполезным, потому что не учитывает то, что вы уже проговорили.

Практический вывод: если начинаете новый чат для «уточнения» долгого разговора — скопируйте туда сжатую выжимку предыдущего диалога (цели, ограничения, что отвергли), а не только последний вопрос. Иначе модель отвечает с нуля, теряя половину смысла вашего запроса.


🧠

Почему это работает

Модель отвечает только на то, что видит в промпте. Она не хранит память между сообщениями сама — весь «контекст» существует лишь пока он физически находится в тексте запроса. Если убрать историю, модель честно отвечает на последнюю фразу буквально, теряя все накопленные условия.

Сильная сторона модели — она отлично распаковывает и удерживает явно прописанные условия, если они есть в тексте. Именно поэтому сжатый пересказ (160 слов: цели, ограничения, отвергнутые варианты) закрывает большую часть разрыва в качестве — модель получает нужные факты в компактном виде.

Но сжатие теряет порядок и роли: кто предложил вариант — ассистент или пользователь; что было принято, а что просто озвучено. Именно эта потеря объясняет, почему треть ответов всё равно расходится — сжатый пересказ передаёт факты, но не передаёт историю принятия решений.

Рычаги управления: - Длина сжатия (160 слов в исследовании) → увеличьте лимит для сложных многошаговых решений, уменьшите для простых уточнений - Что просить сохранить в пересказе (цели, ограничения, отвергнутые варианты, что решено/не решено) → добавьте свои категории под задачу (например, «кто это предложил — я или ты») - Формулировка «различие по существу» (другая рекомендация, другое соответствие ограничению, другое уточнение/отказ) → это критерий, который стоит держать в голове, когда решаете, нужен ли полный контекст или сжатие достаточно


📋

Шаблон промпта

Для случаев, когда вы переносите долгий разговор в новый чат или просите модель подытожить контекст перед сложным вопросом:

Вот моя переписка с тобой на тему {тема}:

{вставить историю переписки}

Не отвечай на последний вопрос из истории. Вместо этого сделай 
краткую выжимку (не больше {число} слов), которая фиксирует:
— мои цели
— ограничения и требования, которые я озвучил
— варианты, которые обсуждались, и что я решил по каждому
— что я отверг и почему
— что осталось нерешённым

Отличай мои требования от твоих предложений — не выдавай 
свои предложения за мои решения. Не добавляй фактов, 
которых не было в переписке.

Затем в новом чате (или продолжении):

Вот выжимка контекста нашего разговора:
{вставить выжимку}

Мой вопрос: {последний_вопрос}

Что подставлять: {тема} — суть разговора (выбор CRM, планирование поездки, разработка стратегии), {число} — лимит слов для выжимки (160 — отправная точка из исследования, для сложных тем увеличьте до 300–400), {последний_вопрос} — то самое финальное сообщение, которое вы хотите задать.

🚀 Быстрый старт — вставь в чат:

Вот шаблон для сжатия контекста долгого разговора. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какая у вас тема разговора и насколько подробной должна быть выжимка — потому что от этого зависит, что войдёт в сжатый пересказ и не потеряются ли важные детали именно вашего случая.


⚠️

Ограничения

⚠️ Сжатие — не полная замена контекста: даже с хорошим пересказом почти треть ответов остаётся другой по существу. Для важных решений (не мелких уточнений) стоит давать модели полную историю, а не выжимку.

⚠️ Метод проверен на «нейтральных» темах: исследование исключило медицинские, юридические, финансовые и другие чувствительные темы. На них разрыв между полным контекстом и изоляцией может быть ещё больше — а ошибка дороже.

⚠️ Судил ту же модель: оценку «отличается или нет» и «насколько хорошо» ставила отдельная модель, не человек. Возможны системные слепые пятна в оценке, общие для ИИ-судей.

⚠️ Один прогон на условие: каждый ответ генерировался один раз. Обычная случайность самой генерации (одна и та же модель на разные запуски выдаёт разные ответы) не отделена от эффекта контекста — реальный разброс может быть шире.


🔍

Как исследовали

Исследователи взяли 180 диалогов — 90 из коммерческого корпуса и 90 из открытого датасета PRISM — и для каждого сделали три версии ответа на один и тот же финальный вопрос: с полной историей, без истории, и с истории, сжатой в пересказ до 160 слов. Модель, которая делала сжатие, не видела финальный вопрос — чтобы не подгоняла пересказ под ответ.

Затем отдельная модель-судья (не участвовавшая в генерации ответов) под случайными метками A/Б/В оценивала: отличаются ли ответы по существу — другая рекомендация, другое соблюдение условия, другое решение уточнять или отвечать сразу. Стиль, тон и длина не считались.

Результат проверили на надёжность: 48 случаев прогнали повторно с другим порядком меток — совпадение решений судьи составило 91,7%, что говорит о стабильности оценки, а не случайном разбросе.

Что удивило: эффект в коммерческом корпусе (68,5% различий) оказался вдвое сильнее, чем в PRISM (35,4%) — вероятно, из-за более сложной структуры реальных бизнес-диалогов. Также неожиданно: даже разговоры, которые по формальным признакам выглядели «самодостаточными» (последнее сообщение не содержало явных отсылок к прошлому), в 31% случаев всё равно менялись при добавлении контекста — то есть формальные признаки «зависимости от контекста» ненадёжны.


🔗

Ресурсы

Benjamin Tannenbaum, Aiso (Tel Aviv, Israel). Beyond the Final Prompt: Measuring the Effect of Within-Conversation Context on AI Answers. Ссылки на связанные работы автора: Tannenbaum 2026a, 2026b (предыдущее исследование о том, что запросы часто "растворены" по репликам разговора). Датасет PRISM — Kirk et al., 2024.


📋 Дайджест исследования

Ключевая суть

44,7% ответов ИИ меняются по существу, если убрать историю переписки перед последним сообщением — не стиль, не длина, а сама рекомендация. Исследование показывает: нельзя переносить долгий диалог в новый чат одним финальным вопросом — модель отвечает буквально, забыв бюджет, отказы, ограничения. Сжатый пересказ истории до 160 слов (цели, ограничения, отвергнутые варианты) снижает долю испорченных ответов с 44,7% до 30,8% — но треть всё равно расходится по существу.

Принцип работы

Модель не хранит память сама. Она отвечает только на то, что физически есть в тексте запроса. Убрал историю — модель честно отвечает на последнюю фразу буквально, теряя все накопленные условия. Контекст диалога — это не преамбула, а часть самого запроса. Последнее сообщение вроде «какой лучше?» — это не вопрос с нуля, это обновление статуса длинного разговора.

Почему работает

Модель отлично удерживает явно прописанные факты, если они есть в тексте — вот почему сжатый пересказ закрывает большую часть разрыва в качестве. Но сжатие теряет порядок и роли: кто предложил вариант — вы или ассистент, что принято, а что просто озвучено. Именно эта потеря объясняет, почему треть ответов всё равно расходится — факты на месте, а история принятия решений исчезла.

Когда применять

Перенос долгого разговора в новый чат → уточняющие вопросы после многошаговых решений (выбор продукта, планирование поездки, стратегия), особенно когда в диалоге были отвергнутые варианты и ограничения. НЕ подходит для критичных тем — медицина, финансы, право: там разрыв может быть больше, а ошибка дороже, метод на таких темах не проверен.

Мини-рецепт

1. Сожми историю отдельным запросом: попроси модель ДО последнего вопроса сделать выжимку до 160 слов — цели, ограничения, отвергнутые варианты, что решено, что нет.
2. Разделяй роли: явно попроси отличать твои требования от предложений самой модели — иначе она выдаст свои идеи за твои решения.
3. Собери новый запрос: выжимка + реальный вопрос вместе, а не последний вопрос сам по себе.
4. Для важных решений — не сжимай: тащи весь диалог целиком, если ошибка обойдётся дорого.

Примеры

[ПЛОХО] : Помоги выбрать CRM для бизнеса (в новом чате, без упоминания бюджета и отказа от Битрикс24)
[ХОРОШО] : Вот выжимка нашего разговора: бюджет до 50 тыс/мес, отверг Битрикс24 из-за сложности внедрения, нужна интеграция с Telegram. Вопрос: какую CRM выбрать?
Источник: Beyond the FinalPrompt: Measuring the Effect of Within-Conversation Context on AI Answers
ArXiv ID: 2608.02556 | Сгенерировано: 2026-08-04 06:31

Проблемы LLM

ПроблемаСутьКак обойти
Модель отвечает на последнее сообщение как на отдельный запросМодель не хранит память сама. Весь контекст существует только пока физически в тексте запроса. Если убрать историю переписки — модель честно отвечает на последнюю фразу буквально. Она не знает бюджет, отвергнутые варианты, ограничения — если их не видит. Ответ по существу меняется почти в половине случаев. Это не про тон или длину — меняется сама суть: другая рекомендация, другой факт, другое решениеНе полагайся на "память" модели между чатами или после долгой переписки. Явно прописывай накопленный контекст в каждом важном запросе: цели, ограничения, что уже отвергли, что решено

Методы

МетодСуть
Сжатая выжимка диалога вместо полной историиОтдельным запросом попроси модель пересказать всю переписку (без последнего вопроса) в компактном виде: цели, ограничения, отвергнутые варианты, что решено/не решено. Лимит — 150-400 слов зависимости от сложности темы. Дай этот пересказ + последний вопрос вместо всей истории. Почему работает: модель хорошо распаковывает и удерживает явно прописанные факты, если они есть в тексте — компактный список условий работает почти как полная история. Когда да: долгий разговор нужно перенести в новый чат, нет возможности вставить всю переписку целиком, тема не критичная. Когда нет: важное решение (много участников, высокая цена ошибки) — там лучше давать полную историю, треть ответов всё равно расходится по существу даже с хорошей выжимкой
📖 Простыми словами

Beyond the FinalPrompt: Measuring the Effect of Within-Conversation Context onAIAnswers

arXiv: 2608.02556

Суть в том, что у нейросетей нет никакой «памяти» в человеческом смысле — они живут моментом. Когда ты общаешься с чат-ботом, он каждый раз перечитывает всю вашу переписку заново, чтобы понять, к чему ты клонишь. Исследование 2608.02556 доказало: если выкинуть историю и оставить только последнюю фразу, ответ модели изменится по существу в 44,7% случаев. Это не просто смена тона или длины текста, это фундаментальный сдвиг: модель выдаст другой факт, предложит другой товар или вообще откажется отвечать там, где раньше была готова помочь.

Это как если бы ты полчаса объяснял консультанту в магазине, что у тебя аллергия на лактозу, бюджет сто рублей и ты ненавидишь синий цвет, а потом спросил: «Ну, что мне взять?». Если в этот момент у консультанта случится приступ амнезии и он услышит только финальный вопрос, он с радостью впарит тебе огромный синий йогурт. Формально он ответил на вопрос, но по факту этот совет — полная херня, потому что он потерял все вводные, которые ты разжевывал до этого.

Что конкретно ломается: в 17% случаев модель меняет само решение — например, вместо конкретного совета начинает задавать уточняющие вопросы. В 16% случаев меняется фактическое содержание, а в 11% — рекомендации. Исследователи использовали метрику Semantic Answer Similarity (SAS), чтобы понять, насколько ответы «без памяти» далеки от оригиналов. Выяснилось, что контекстное окно — это не просто склад логов, а фильтр, который отсекает мусорные варианты. Без него модель превращается в гадалку, которая тычет пальцем в небо.

Хотя эксперименты ставили на чат-ботах, этот принцип применим к любой работе с AI, от написания кода до генерации маркетинговых стратегий. Если ты используешь RAG (подгрузку знаний из базы) или длинные цепочки промптов, помни: ценность ответа на 45% зависит не от твоего последнего гениального вопроса, а от того «багажа», который тянется следом. SEO для мозгов здесь не работает — работает только плотность и релевантность истории сообщений.

Короче, если результат от нейронки стал напоминать бред сумасшедшего, скорее всего, она просто «забыла», о чем вы договорились на берегу. Главный вывод: контекст — это не дополнение, это половина смысла. Не надейся, что модель «сама поймет» контекст из одной фразы; если история переписки перегружена или обрезана, ты получишь рандомный ответ, который в половине случаев будет бесполезен. Кто умеет управлять историей диалога, тот получает результат, остальные — синий йогурт.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с