3,583 papers
arXiv:2608.22425 76 23 авг. 2026 г. FREE

Что LLM говорят больше, чем слушают в кризисных разговорах — и спешат с советами

КЛЮЧЕВАЯ СУТЬ
TL;DR
Адаптировать под запрос

TL;DR

Когда человек в остром кризисе — например, только что узнал о диагнозе деменции у близкого — приходит к ChatGPT, Claude, Mistral или DeepSeek за поддержкой, все четыре модели ведут себя одинаково плохо: они говорят больше, чем слушают, и предлагают решения раньше, чем разобрались в ситуации человека. Исследователи проверили это не на живых людях (что неэтично и недёшево), а создали синтетических собеседников с точно заданными психологическими профилями — тревожность, стиль совладания со стрессом, устойчивость к выгоранию — и проверили, различают ли модели одного человека от другого и правда ли они ведут себя по-разному в диалоге с разными типами людей.

Главная боль: человек в кризисе физически не может усвоить много информации сразу — у него сужено внимание и снижена рабочая память. Кризисная психология учит: сначала выслушать и стабилизировать, потом информировать и решать. LLM делают наоборот — у них соотношение "говорю/слушаю" выше единицы почти всегда, и это никак не зависит от того, какая модель перед вами. GPT-4.1, Claude, Mistral и DeepSeek — все одинаково "многословные советчики", а не "слушатели".

Метод исследования — трёхролевая система: Advisee (синтетический человек в кризисе с заданным психологическим профилем) говорит с Advisor (тестируемая модель), а Auditor (третья модель, не знающая профиля) оценивает разговор задним числом — пытается угадать характер собеседника и оценить качество поддержки. Если Auditor правильно восстанавливает профиль из одного текста диалога — значит, личность реально проявляется в речи, и оценке можно доверять.

🔬

Схема метода

ШАГ 1: Создать синтетического "Advisee" с точным психологическим профилем
       (уровень тревожности, стиль совладания, устойчивость к стрессу) → текстовая инструкция-персона

ШАГ 2: Advisee ведёт диалог с тестируемой моделью (Advisor) в роли человека,
       который узнал о диагнозе деменции у родственника → 20+ реплик диалога

ШАГ 3: Отдельная модель-судья (Auditor), НЕ видевшая исходный профиль,
       читает только диалог и пытается угадать черты личности собеседника
       → оценка по шкале 1-5 по каждому параметру

ШАГ 4: Auditor также считает поведенческие метрики Advisor:
       соотношение "говорю/слушаю", момент появления советов, признаки нажима
       → числовые метрики + список нарушений

Все шаги выполняются в отдельных запросах (разные роли — разные вызовы модели).


🚀

Пример применения

Задача: Ваш друг написал вам в 2 часа ночи: "Врач сказал, что у мамы Альцгеймер. Не знаю, что теперь делать." Вы открываете Claude или ChatGPT, чтобы подготовиться к разговору — или сами используете чат как первую точку опоры перед тем, как позвонить другу.

Промпт (без учёта находки — так делает большинство):

Моей маме поставили диагноз Альцгеймер. Что мне делать?

Результат: модель выдаст сразу структурированный план — стадии болезни, куда обращаться, юридические моменты, советы по уходу. Много полезной информации, ноль пауз, чтобы спросить, как вы сейчас себя чувствуете.

Промпт с учётом находки:

Моей маме поставили диагноз Альцгеймер, я узнал об этом сегодня.
Не давай мне советов и план действий сразу.
Сначала задай мне 2-3 вопроса о том, что я сейчас чувствую и что для меня 
сейчас самое тяжёлое. Дождись моих ответов, прежде чем переходить 
к какой-либо информации или рекомендациям.

Результат: модель задаст уточняющие вопросы о ваших чувствах, подождёт ответа, и только потом (если вы попросите) перейдёт к практической информации. Диалог будет короче с её стороны и длиннее с вашей — то есть соотношение "говорю/слушаю" перевернётся в правильную сторону.


🧠

Почему это работает

LLM обучены быть полезными — а полезность в их понимании чаще всего означает "дать много релевантной информации быстро". Это отличная стратегия для вопроса "как настроить Wi-Fi", но катастрофическая для человека, который ещё не осмыслил новость. Модель не умеет отличать запрос на информацию от запроса на присутствие — если явно не сказать ей об этом.

Сильная сторона LLM, которую использует находка: модель отлично следует явным инструкциям про порядок действий. Она не игнорирует просьбу "сначала спроси, потом советуй" — она просто не делает этого сама по умолчанию, потому что её обучали быть быстро полезной, а не терапевтически выдержанной.

Рычаги управления: - Фраза "не давай советов, сначала задай вопросы" → переключает модель из режима "решаю проблему" в режим "слушаю" - Число уточняющих вопросов (2-3) → задаёт темп разговора, не даёт модели проскочить фазу выслушивания - Явное указание "дождись моих ответов" → предотвращает то, что модель сама ответит на свои вопросы и продолжит советовать


📋

Шаблон промпта

Я сейчас переживаю {ситуация}. 
Не предлагай решения и план действий сразу.
Сначала задай мне {число} вопросов о том, что я чувствую 
и что для меня сейчас самое тяжёлое.
Дождись моих ответов на каждый вопрос, прежде чем двигаться дальше.
Когда я сам попрошу совет или информацию — тогда переходи к ней.

Подставьте: {ситуация} — что случилось (диагноз, увольнение, расставание, любая тяжёлая новость); {число} — сколько вопросов хотите (2-3 обычно достаточно).

🚀 Быстрый старт — вставь в чат:

Вот шаблон разговора для тяжёлой личной ситуации. Адаптируй под мою ситуацию: {опиши свою ситуацию своими словами}.
Задавай вопросы, чтобы понять контекст.

[вставить шаблон выше]

LLM спросит детали ситуации — потому что без них не сможет понять, какие вопросы задать вам первыми и когда переходить к советам.


⚠️

Ограничения

⚠️ Не работает как автоматическая настройка: модель сама по себе не переключается в режим "слушать первым" — это нужно прописывать явно в каждом новом диалоге, память между чатами не переносится.

⚠️ Проверено на одном сценарии: исследование тестировало только ситуацию "родственнику поставили диагноз деменции". Насколько находка верна для других кризисов (развод, потеря работы, паническая атака) — исследование не проверяло напрямую, хотя механика (модель обучена быть быстро полезной) должна работать одинаково.

⚠️ Модели неотличимы друг от друга по этой проблеме: переключение на другую модель (GPT вместо Claude, например) не решает проблему — все четыре протестированные модели вели себя одинаково многословно.


🔍

Как исследовали

Исследователи не могли тестировать реальных людей в остром кризисе — это неэтично. Поэтому они создали синтетических собеседников: моделям задавали точный психологический профиль (уровень тревожности, стиль совладания со стрессом, устойчивость) и просили сыграть человека, узнавшего о диагнозе деменции у родственника. Затем эти "персонажи" вели диалог с четырьмя топовыми моделями (GPT-4.1, Claude-Sonnet-4.5, Mistral-Medium, DeepSeek-V3.2), а третья модель-судья, не знавшая исходного профиля, пыталась угадать характер собеседника только по тексту диалога.

Судья угадывала профиль с высокой точностью (согласие между четырьмя независимыми судьями — 91%), причём не только по классическим чертам личности (открытость, невротизм и т.д.), но и по более тонким вещам — стилю совладания со стрессом, самооценке способности справиться, устойчивости к манипуляции. Это подтвердило, что личность реально "прощупывается" через диалог, а значит, оценке качества поддержки можно доверять.

Дальше проверили сами модели-советчики: насколько разговор снижает тревогу и стресс у собеседника (измеряли психологическими опросниками по первым и последним репликам), и насколько поведение модели соответствует правилам кризисной психологии. Результат оказался неожиданно единодушным: все четыре модели статистически неотличимы друг от друга по качеству эмоциональной стабилизации — и все одинаково нарушают базовое правило "сначала слушай, потом советуй".


🔗

Ресурсы

All four leading LLMs talk more than they listen to personality-verified synthetic help-seekers Pablo A. Fonseca, Raquel Rodríguez-Carvajal, Rafael A. Calvo Dyson School of Design Engineering, Imperial College London; Universidad Autónoma de Madrid

Упомянутые в статье: MindBench.ai (домен-специфичный бенчмарк для mental health LLM-оценки), исследование факторов терапевтического альянса в психотерапии (мета-анализ 99 исследований).


Проблемы LLM

ПроблемаСутьКак обойти
Модель советует раньше, чем слушаетЧеловек в кризисе (плохой диагноз, увольнение, расставание) пишет модели. Модель сразу выдаёт план действий и советы. Человек в остром стрессе не может усвоить много информации — у него сужено внимание. Модель не различает "мне нужна информация" и "мне нужно, чтобы меня услышали". Смена модели не помогает — GPT, Claude, Mistral, DeepSeek ведут себя одинаковоЯвно попроси: "не советуй сразу, сначала задай 2-3 вопроса о моих чувствах, дождись ответов". Это переключает модель из режима "решаю проблему" в режим "слушаю"

Методы

МетодСуть
Явный порядок "сначала слушай, потом советуй"В запросе прямо укажи последовательность: Не давай советов сразу. Сначала задай {N} вопросов о том, что я чувствую. Дождись моих ответов. Переходи к советам только когда я сам попрошу. Работает потому что модель хорошо следует явным инструкциям о порядке действий — но сама по умолчанию так не делает, так как обучена быть быстро полезной, а не терапевтически выдержанной. Применяй в любых эмоционально тяжёлых разговорах (диагноз, потеря, конфликт). Не работает как настройка "на будущее" — нужно прописывать в каждом новом диалоге, память не переносится между чатами
📖 Простыми словами

All four leadingLLMstalk more than they listen to personality-verified synthetic help-seekers

arXiv: 2608.22425

Нейросети обучены быть полезными решалами, и в этом их главный провал при общении с живым человеком. Для LLM «быть полезной» означает быстро вывалить простыню релевантного текста. Когда ты спрашиваешь, «как настроить Wi-Fi», это работает идеально. Но в момент острого психологического кризиса модель слепнет: она путает запрос на банальное сочувствие с запросом на техническую справку и заваливает тебя инструкциями вместо того, чтобы заткнуться и выслушать.

Это как прийти к другу в слезах со словами «у мамы подозрение на деменцию», а он вместо поддержки сразу сует тебе в руки распечатку с адресами домов престарелых и диктует список из 10 шагов. Формально он молодец и помог, но по факту это полная эмоциональная глухота. Тебе нужно переварить шок и выговориться, а тебе с порога скармливают мануал по оптимизации проблемы.

Исследователи проверили все 4 ведущие модели — ChatGPT, Claude, Mistral и DeepSeek — на специально созданных синтетических личностях с разными уровнями тревожности и выгорания. Итог один: все модели говорят больше, чем слушают. Они не считывают психологический профиль, почти не задают уточняющих вопросов и начинают агрессивно советовать задолго до того, как собеседник вообще закончил мысль.

Тестировали на кризисе с тяжелым диагнозом, но баг универсален. Он проявляется везде, где есть стресс: в HR-ботах при общении с выгоревшими сотрудниками, в клиентской поддержке при жестких конфликтах и в любых AI-психологах. Без жестких рамок дефолтная модель всегда выбирает режим душного лектора, которому плевать на твои чувства — ему главное закрыть тикет.

Короче: если строишь диалогового агента для людей или сам используешь AI как точку опоры в кризисе, запрети модели решать проблемы с первого сообщения. Прописывай в промпте: «только валидация эмоций, уточняющие вопросы и ноль советов без прямого запроса». Иначе вместо помощи человек получит канцелярскую отписку, от которой станет только хуже.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с