3,583 papers
arXiv:2608.24080 76 25 авг. 2026 г. FREE

Минимальные отклики: почему LLM не умеют молчать вовремя — и как их научить

КЛЮЧЕВАЯ СУТЬ
0% против 97% — вот разница между LLM без инструкции и с одной короткой фразой в промпте. Метод позволяет получить от модели уместный короткий отклик — «понимаю», «продолжай» — вместо совета и вопроса там, где человеку просто нужно выговориться. Модель обучена быть полезной, а польза для неё почти всегда означает совет или вопрос. Одна явная инструкция «если человек не закончил — не спрашивай» переключает поведение мгновенно — с 0% до 80–97% уместных коротких ответов.
Адаптировать под запрос

TL;DR

Языковые модели, играя роль психолога или просто внимательного собеседника, почти никогда сами не отвечают коротко — даже когда собеседнику нужно просто "угу, понимаю, продолжай", модель выдаёт развёрнутый ответ с советом и вопросом в конце. Причина в том, что модели обучались на текстах, где "хороший" ответ = информативный, поэтому короткая эмпатичная фраза кажется им "недоработкой", а не осознанным приёмом.

Исследователи проверили: если явно попросить модель — она резко меняет поведение. Без инструкции топовые коммерческие модели давали короткий отклик в 0% случаев, даже когда по контексту это было явно нужно. С явной инструкцией "если человек ещё не закончил говорить — не задавай вопрос, просто покажи, что слушаешь" доля коротких ответов подскакивала до 80–97%. То есть модель умеет — она просто не знает, когда надо, если ей не сказать прямо.

Второй важный вывод: если попросить ту же LLM оценить качество такого диалога, она занизит оценку короткому, но уместному ответу — просто потому что он "менее содержательный". Это касается не только психологии, а любой задачи, где вы просите ИИ оценить текст, реплику поддержки или ответ клиенту.


🔬

Схема метода

ШАГ 1: Задать модели роль слушателя/собеседника (один промпт)
ШАГ 2: Добавить явное условие — когда давать короткий отклик, а когда развёрнутый
ШАГ 3 (отдельно, если нужно): при оценке диалогов через LLM — учитывать, что судья занижает баллы коротким ответам

🚀

Пример применения

Задача: Вы используете Claude или ChatGPT как "тренажёр" перед сложным разговором — например, хотите потренироваться, как поддержать сотрудника, который на созвоне жалуется на выгорание, или проговорить сложный разговор с близким человеком, прежде чем писать ему.

Промпт:

Ты играешь роль моего друга, которому я сейчас пишу о тяжёлом дне на работе.
Правило: если по тексту видно, что я ещё не закончил(а) выговариваться — 
не задавай вопрос и не давай совет. Ответь коротко (1 фраза), 
покажи, что слушаешь: "понимаю", "да, это правда тяжело", "продолжай, я здесь".
Переходи к вопросам или советам только когда я явно закончил мысль 
или сам(а) прошу совета.

Моё сообщение: "Сегодня начальник на встрече при всех сказал, что я 
плохо справляюсь с проектом. Я не знала куда деться, весь день потом 
руки тряслись, ничего не могла делать..."

Результат: Модель ответит короткой поддерживающей фразой вместо стандартного "Мне жаль это слышать. Как думаешь, стоит ли поговорить с начальником об этом?" — без вопроса и без готового решения, оставляя место договорить.


🧠

Почему это работает

Модель обучена быть полезной — а "польза" в её понимании почти всегда означает содержательный ответ: совет, вопрос, структуру. Короткая реплика без информации воспринимается моделью как недоработанный ответ, поэтому по умолчанию она туда не идёт.

При этом модель отлично следует явным правилам про стиль и формат, если их прописать словами. Она не угадывает контекст сама — но если сказать "в такой ситуации отвечай так", она это выполнит почти идеально.

Рычаг управления: можно менять условие срабатывания короткого ответа ("если человек не закончил" → "если человек явно расстроен" → "каждый второй раз") и задать конкретные фразы-примеры, которые модель должна использовать — это делает поведение предсказуемым.


📋

Шаблон промпта

Ты выступаешь в роли {роль: друга / внимательного слушателя / коллеги} 
в разговоре про {тема}.

Правило: если собеседник ещё не закончил делиться переживаниями — 
не задавай вопрос и не предлагай решение. Вместо этого дай короткий отклик 
(1 фраза), который показывает, что ты слушаешь: например "понимаю", 
"да, это тяжело", "продолжай, я слушаю".

Переходи к вопросам, советам или развёрнутому ответу только если 
собеседник явно закончил высказывание или сам просит совета.

Сообщение собеседника: {текст_сообщения}

Подставь роль, тему разговора и реальный текст сообщения.

🚀 Быстрый старт — вставь в чат:

Вот шаблон для эмпатичных коротких ответов в диалоге. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, кто говорит, о чём разговор и какой у вас стиль общения с этим человеком — потому что от этого зависит, какие короткие фразы будут звучать естественно, а не механически.


⚠️

Ограничения

⚠️ Модель не угадывает момент сама: без явной инструкции LLM почти никогда не выберет короткий ответ, даже если по контексту это очевидно нужно. Правило нужно прописывать всегда явно, а не надеяться, что модель "почувствует".

⚠️ LLM-судья занижает короткие ответы: если просите модель оценить качество диалога, поддержки или ответа клиенту — она предпочтёт содержательный текст, даже если короткий был уместнее. Не доверяйте такой оценке слепо, особенно для задач, где "меньше — лучше".

⚠️ Специализированные "психологические" модели хуже обычных: модели, дообученные на искусственно сгенерированных диалогах, тяготеют к длинным информационным ответам сильнее, чем обычный ChatGPT или Claude — потому что в их обучающих данных коротких откликов почти нет.

⚠️ Не проверено на длинном диалоге: исследование смотрело только на отдельные моменты разговора. Неизвестно, как часто нужно использовать короткие отклики — если модель будет отвечать "понимаю... понимаю... да..." на каждую фразу, это будет звучать механически, а не по-человечески.


🔍

Как исследовали

Исследователи собрали семь датасетов консультационных диалогов на китайском, японском и английском языках: часть — реальные записи консультаций (транскрипты видео, ролевые игры настоящих психологов), часть — диалоги, сгенерированные LLM для обучения других моделей. Через двухэтапный фильтр (сначала по длине и ключевым словам, потом проверка через GPT-модель) они искали короткие эмпатичные реплики типа "угу", "понимаю", "да, это тяжело".

Результат оказался наглядным: в реальных диалогах такие реплики встречаются регулярно, а в датасетах, сгенерированных LLM, — почти полностью отсутствуют (доли меньше 1%). Дальше они взяли контексты, где реальный психолог использовал короткий отклик, и попросили разные модели — от открытых Qwen и Llama до топового коммерческого GPT-5.4 и специализированных психологических моделей — сгенерировать ответ вместо психолога, сначала без подсказки, потом с прямой инструкцией.

Без подсказки почти все модели дали 0% коротких ответов на действительно подходящих контекстах. С подсказкой доля взлетала до 80–97% у сильных моделей. Отдельно проверили, как LLM-оценщик судит качество ответов, и обнаружили: чем короче и уместнее ответ, тем ниже оценка по стандартным метрикам качества — даже реальные ответы человека-психолога получали низкие баллы просто за краткость. Это главный неожиданный вывод: сама метрика оценки диалогов через LLM встроенно предпочитает "многословность".


🔗

Ресурсы

When Less Is More: An Empirical Study of Minimal Responses in Counseling Dialogues and the Behavior of LLMs, Zhiyang Qi, The University of Tokyo. Датасеты: AnnoMI, KokoroChat, PsyDial-D4 (человеческие), CACTUS, CPsyCounD, PsyDTCorpus, SmileChat (сгенерированные LLM).


📋 Дайджест исследования

Ключевая суть

0% против 97% — вот разница между LLM без инструкции и с одной короткой фразой в промпте. Метод позволяет получить от модели уместный короткий отклик — «понимаю», «продолжай» — вместо совета и вопроса там, где человеку просто нужно выговориться. Модель обучена быть полезной, а польза для неё почти всегда означает совет или вопрос. Одна явная инструкция «если человек не закончил — не спрашивай» переключает поведение мгновенно — с 0% до 80–97% уместных коротких ответов.

Принцип работы

LLM не считывает подтекст сама — она ждёт словесной команды. Правило простое: пропиши условие для короткого ответа — «если собеседник не закончил мысль», «если явно расстроен» — и модель выполнит это почти идеально. Она гораздо лучше следует формату, чем угадывает контекст без подсказки.

Почему работает

Причина проста: в текстах, на которых модель учили, «хороший» ответ почти всегда информативный — совет, вопрос, структура. Короткая фраза без содержания кажется ей недоработкой. Отсюда и обвал до 0% без инструкции — модель физически не выбирает «пустой» ответ, если её не попросить. Хуже всего с этим у специализированных «психологических» моделей — они дообучены на искусственных диалогах, где коротких откликов почти нет, и тянут к советам ещё сильнее обычного ChatGPT.

Когда применять

Диалоги и поддержка → тренировка сложных разговоров, ролевые сценарии друга или коллеги, ответы клиенту, особенно когда человеку нужно просто выговориться, а не получить план действий. Не подходит, если вы просите LLM оценить качество чужого ответа — она занизит балл короткой, но уместной реплике просто за то, что она «не содержательная».

Мини-рецепт

1. Задай роль: не «психолог», а «друг», «коллега», «внимательный слушатель» — так фразы звучат живее.
2. Впиши условие: «если собеседник не закончил мысль — не задавай вопрос и не советуй».
3. Дай примеры фраз: «понимаю», «да, это тяжело», «продолжай, я слушаю» — без образцов модель придумает что-то книжное.
4. Отдельно оговори переход: к советам и вопросам — только когда человек сам просит или явно закончил.

Примеры

[ПЛОХО] : Ты мой друг, ответь на моё сообщение: "Начальник унизил меня перед всеми на встрече..."
[ХОРОШО] : Ты мой друг. Если я ещё не закончил(а) выговариваться — не задавай вопрос и не советуй, просто скажи "понимаю" или "продолжай, я здесь". Моё сообщение: "Начальник унизил меня перед всеми на встрече..."
Источник: When Less Is More: An Empirical Study of Minimal Responses in Counseling Dialogues and the Behavior of LLMs
ArXiv ID: 2608.24080 | Сгенерировано: 2026-08-26 05:23

Проблемы LLM

ПроблемаСутьКак обойти
Модель не даёт короткий отклик без прямой командыСобеседнику нужно просто "угу, продолжай" — а модель выдаёт развёрнутый ответ с советом и вопросом. Даже когда по контексту очевидно, что человек не закончил говорить. Это ломает любой диалог, где нужна поддержка, а не решение проблемы: коучинг, поддержка сотрудника, обратная связь клиентуПропиши явное условие: "если собеседник не закончил мысль — не задавай вопрос, ответь одной короткой фразой ('понимаю', 'продолжай')". Модель выполняет такое правило почти всегда
LLM-судья занижает оценку коротким, но уместным ответамПросишь модель оценить качество диалога или реплики поддержки. Она предпочитает содержательный текст — даже если короткий ответ был правильнее. Работает для любой задачи оценки текста: фидбек, качество ответа клиенту, тон перепискиНе доверяй автоматической оценке LLM в задачах, где "короче — лучше". Добавь в промпт-судью явное указание: короткие уместные реплики не штрафовать за отсутствие содержания

Методы

МетодСуть
Явное условие переключения длины ответаЗадай правило: "если условие А — короткая реплика, если условие Б — развёрнутый ответ", и дай примеры фраз для короткого варианта. если человек не закончил — 1 фраза без вопроса и совета. Работает потому что модель хорошо исполняет явные правила про стиль и формат, но сама не угадывает контекст. Применяй в любых ролевых диалогах: поддержка, консультации, тренажёры переговоров. Не работает, если правило абстрактное ("отвечай уместно") — нужен конкретный триггер

Тезисы

ТезисКомментарий
Для модели "полезный ответ" = информативный ответМодель обучена на текстах, где хороший ответ — это совет, вопрос, структура. Короткая фраза без информации воспринимается ей как недоработка, а не как приём. Отсюда системный перекос в сторону длинных ответов даже там, где нужна просто эмпатия. Применяй: если хочешь короткий ответ, явно скажи что "короткая реплика — это и есть хороший ответ здесь", иначе модель по умолчанию будет "доделывать"
📖 Простыми словами

When Less Is More: An Empirical Study of Minimal Responses in Counseling Dialogues and the Behavior ofLLMs

arXiv: 2608.24080

Нейросети патологически не умеют вовремя заткнуться и просто послушать. Архитектурно и через обучение с подкреплением их выдрессировали быть максимально полезными: сразу выдавать анализ ситуации, списки решений и ценные указания. Из-за этого обычное человеческое «угу, продолжай» модель считает багом и недоработкой, вываливая простыню текста вместо простого присутствия в моменте.

Это как прийти к другу выговориться после адского дня, а он вместо сочувственного взгляда достаёт маркерную доску и чертит пятишаговый план выхода из кризиса. Формально он дико старается помочь, но в реальности хочется просто стукнуть его этой доской. Тебе нужно было банальное сопереживание, а не назойливый коучинговый сеанс.

В психотерапии этот инструмент называют минимальными репликами — короткими фразами вроде «понимаю» или «да уж», которые дают человеку безопасно выгрузить эмоции. Исследование показало: современные модели по умолчанию сливают этот навык в ноль. Вместо классического активного слушания AI сразу начинает пичкать собеседника непрошеными советами и шаблонными вопросами в духе «а что ты при этом чувствуешь?», намертво убивая живой диалог.

Изучали психологические сессии, но принцип универсален. Если ты используешь нейросеть как тренажёр для сложных разговоров, настраиваешь саппорт-бота или репетируешь диалог с выгоревшим сотрудником — модель будет безбожно фальшивить. Без отдельного пинка и требования заткнуть внутреннего советчика любой бот превращается в ходячую энциклопедию банальностей.

Короче: если строишь диалогового агента или тренируешь софт-скиллы, жестко прописывай в промпте запрет на простыни текста и требуй микро-реакций. Сама модель никогда не поймёт, что меньше — это больше. Либо ты принудительно ограничиваешь её многословие, либо получаешь душного робота-консультанта, от которого собеседник сбежит через две минуты.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с