TL;DR
Когда человек в остром кризисе — например, только что узнал о диагнозе деменции у близкого — приходит к ChatGPT, Claude, Mistral или DeepSeek за поддержкой, все четыре модели ведут себя одинаково плохо: они говорят больше, чем слушают, и предлагают решения раньше, чем разобрались в ситуации человека. Исследователи проверили это не на живых людях (что неэтично и недёшево), а создали синтетических собеседников с точно заданными психологическими профилями — тревожность, стиль совладания со стрессом, устойчивость к выгоранию — и проверили, различают ли модели одного человека от другого и правда ли они ведут себя по-разному в диалоге с разными типами людей.
Главная боль: человек в кризисе физически не может усвоить много информации сразу — у него сужено внимание и снижена рабочая память. Кризисная психология учит: сначала выслушать и стабилизировать, потом информировать и решать. LLM делают наоборот — у них соотношение "говорю/слушаю" выше единицы почти всегда, и это никак не зависит от того, какая модель перед вами. GPT-4.1, Claude, Mistral и DeepSeek — все одинаково "многословные советчики", а не "слушатели".
Метод исследования — трёхролевая система: Advisee (синтетический человек в кризисе с заданным психологическим профилем) говорит с Advisor (тестируемая модель), а Auditor (третья модель, не знающая профиля) оценивает разговор задним числом — пытается угадать характер собеседника и оценить качество поддержки. Если Auditor правильно восстанавливает профиль из одного текста диалога — значит, личность реально проявляется в речи, и оценке можно доверять.
Схема метода
ШАГ 1: Создать синтетического "Advisee" с точным психологическим профилем
(уровень тревожности, стиль совладания, устойчивость к стрессу) → текстовая инструкция-персона
ШАГ 2: Advisee ведёт диалог с тестируемой моделью (Advisor) в роли человека,
который узнал о диагнозе деменции у родственника → 20+ реплик диалога
ШАГ 3: Отдельная модель-судья (Auditor), НЕ видевшая исходный профиль,
читает только диалог и пытается угадать черты личности собеседника
→ оценка по шкале 1-5 по каждому параметру
ШАГ 4: Auditor также считает поведенческие метрики Advisor:
соотношение "говорю/слушаю", момент появления советов, признаки нажима
→ числовые метрики + список нарушений
Все шаги выполняются в отдельных запросах (разные роли — разные вызовы модели).
Пример применения
Задача: Ваш друг написал вам в 2 часа ночи: "Врач сказал, что у мамы Альцгеймер. Не знаю, что теперь делать." Вы открываете Claude или ChatGPT, чтобы подготовиться к разговору — или сами используете чат как первую точку опоры перед тем, как позвонить другу.
Промпт (без учёта находки — так делает большинство):
Моей маме поставили диагноз Альцгеймер. Что мне делать?
Результат: модель выдаст сразу структурированный план — стадии болезни, куда обращаться, юридические моменты, советы по уходу. Много полезной информации, ноль пауз, чтобы спросить, как вы сейчас себя чувствуете.
Промпт с учётом находки:
Моей маме поставили диагноз Альцгеймер, я узнал об этом сегодня.
Не давай мне советов и план действий сразу.
Сначала задай мне 2-3 вопроса о том, что я сейчас чувствую и что для меня
сейчас самое тяжёлое. Дождись моих ответов, прежде чем переходить
к какой-либо информации или рекомендациям.
Результат: модель задаст уточняющие вопросы о ваших чувствах, подождёт ответа, и только потом (если вы попросите) перейдёт к практической информации. Диалог будет короче с её стороны и длиннее с вашей — то есть соотношение "говорю/слушаю" перевернётся в правильную сторону.
Почему это работает
LLM обучены быть полезными — а полезность в их понимании чаще всего означает "дать много релевантной информации быстро". Это отличная стратегия для вопроса "как настроить Wi-Fi", но катастрофическая для человека, который ещё не осмыслил новость. Модель не умеет отличать запрос на информацию от запроса на присутствие — если явно не сказать ей об этом.
Сильная сторона LLM, которую использует находка: модель отлично следует явным инструкциям про порядок действий. Она не игнорирует просьбу "сначала спроси, потом советуй" — она просто не делает этого сама по умолчанию, потому что её обучали быть быстро полезной, а не терапевтически выдержанной.
Рычаги управления: - Фраза "не давай советов, сначала задай вопросы" → переключает модель из режима "решаю проблему" в режим "слушаю" - Число уточняющих вопросов (2-3) → задаёт темп разговора, не даёт модели проскочить фазу выслушивания - Явное указание "дождись моих ответов" → предотвращает то, что модель сама ответит на свои вопросы и продолжит советовать
Шаблон промпта
Я сейчас переживаю {ситуация}.
Не предлагай решения и план действий сразу.
Сначала задай мне {число} вопросов о том, что я чувствую
и что для меня сейчас самое тяжёлое.
Дождись моих ответов на каждый вопрос, прежде чем двигаться дальше.
Когда я сам попрошу совет или информацию — тогда переходи к ней.
Подставьте: {ситуация} — что случилось (диагноз, увольнение, расставание, любая тяжёлая новость); {число} — сколько вопросов хотите (2-3 обычно достаточно).
🚀 Быстрый старт — вставь в чат:
Вот шаблон разговора для тяжёлой личной ситуации. Адаптируй под мою ситуацию: {опиши свою ситуацию своими словами}.
Задавай вопросы, чтобы понять контекст.
[вставить шаблон выше]
LLM спросит детали ситуации — потому что без них не сможет понять, какие вопросы задать вам первыми и когда переходить к советам.
Ограничения
⚠️ Не работает как автоматическая настройка: модель сама по себе не переключается в режим "слушать первым" — это нужно прописывать явно в каждом новом диалоге, память между чатами не переносится.
⚠️ Проверено на одном сценарии: исследование тестировало только ситуацию "родственнику поставили диагноз деменции". Насколько находка верна для других кризисов (развод, потеря работы, паническая атака) — исследование не проверяло напрямую, хотя механика (модель обучена быть быстро полезной) должна работать одинаково.
⚠️ Модели неотличимы друг от друга по этой проблеме: переключение на другую модель (GPT вместо Claude, например) не решает проблему — все четыре протестированные модели вели себя одинаково многословно.
Как исследовали
Исследователи не могли тестировать реальных людей в остром кризисе — это неэтично. Поэтому они создали синтетических собеседников: моделям задавали точный психологический профиль (уровень тревожности, стиль совладания со стрессом, устойчивость) и просили сыграть человека, узнавшего о диагнозе деменции у родственника. Затем эти "персонажи" вели диалог с четырьмя топовыми моделями (GPT-4.1, Claude-Sonnet-4.5, Mistral-Medium, DeepSeek-V3.2), а третья модель-судья, не знавшая исходного профиля, пыталась угадать характер собеседника только по тексту диалога.
Судья угадывала профиль с высокой точностью (согласие между четырьмя независимыми судьями — 91%), причём не только по классическим чертам личности (открытость, невротизм и т.д.), но и по более тонким вещам — стилю совладания со стрессом, самооценке способности справиться, устойчивости к манипуляции. Это подтвердило, что личность реально "прощупывается" через диалог, а значит, оценке качества поддержки можно доверять.
Дальше проверили сами модели-советчики: насколько разговор снижает тревогу и стресс у собеседника (измеряли психологическими опросниками по первым и последним репликам), и насколько поведение модели соответствует правилам кризисной психологии. Результат оказался неожиданно единодушным: все четыре модели статистически неотличимы друг от друга по качеству эмоциональной стабилизации — и все одинаково нарушают базовое правило "сначала слушай, потом советуй".
Ресурсы
All four leading LLMs talk more than they listen to personality-verified synthetic help-seekers Pablo A. Fonseca, Raquel Rodríguez-Carvajal, Rafael A. Calvo Dyson School of Design Engineering, Imperial College London; Universidad Autónoma de Madrid
Упомянутые в статье: MindBench.ai (домен-специфичный бенчмарк для mental health LLM-оценки), исследование факторов терапевтического альянса в психотерапии (мета-анализ 99 исследований).
