3,583 papers
arXiv:2608.26291 80 26 авг. 2026 г. FREE

Social Chain-of-Thought: заставь модель сначала предсказать ход соперника, потом выбрать свой

КЛЮЧЕВАЯ СУТЬ
Обнаружено: без специальной подсказки большинство LLM в переговорах и играх ведут себя как примитивный счётчик подкреплений — просто повторяют то, что сработало в прошлый раз, вообще не думая о мотивах другой стороны. Из-за этого их легко просчитать и обыграть — противник видит паттерн за пару раундов. Social Chain-of-Thought (SCoT) позволяет заставить модель рассуждать о намерениях контрагента перед тем как принять решение — в переговорах, спорах, играх с повторяющимся взаимодействием. Модель сначала прописывает текстом предсказание хода соперника, а потом использует этот же текст как основание для своего решения — это разворачивает обычный chain-of-thought в сторону социального рассуждения, и результат вплотную подходит к человеческому уровню или превосходит его.
Адаптировать под запрос

TL;DR

Social Chain-of-Thought (SCoT) — простой приём: перед тем как модель выбирает свой ход в стратегической игре, её просят явно предсказать, что сделает противник. Только после этого модель принимает решение, опираясь на своё же предсказание.

Главная находка: без этой подсказки большинство LLM ведут себя как простой "счётчик подкреплений" — повторяют то, что сработало в прошлый раз, вместо того чтобы думать о том, что думает противник. Из-за этого их легко предсказать и обыграть — противник видит паттерн и подстраивается. Только новейшие reasoning-модели (GPT-5) делают это моделирование "в голове" сами, без специальных инструкций.

SCoT решает проблему в один шаг внутри промпта: сначала модель формулирует предсказание хода соперника (текстом), потом на основе этого предсказания выбирает свой ход. Этот простой сдвиг переводит модель с уровня "реагирую на прошлое" на уровень "думаю о чужих мыслях" — и результат резко улучшается, вплотную приближаясь к человеческому уровню или превосходя его.


🔬

Схема метода

ШАГ 1: Модель предсказывает следующий ход/решение соперника, опираясь на историю → текстовое предсказание
ШАГ 2: Модель выбирает свой ход, учитывая собственное предсказание из шага 1 → финальное решение

Оба шага выполняются в одном промпте/одном ответе модели — просто в него добавлена явная просьба сначала предсказать, потом решить. Повторяется на каждом раунде взаимодействия.


🚀

Пример применения

Задача: Вы готовитесь к переговорам с крупным поставщиком о снижении цены на закупку. Переговоры идут раундами — вы делаете предложение, поставщик отвечает, вы корректируете позицию.

Промпт:

Ты — мой стратегический советник по переговорам с поставщиком.

Ситуация: я закупаю товар оптом, хочу снизить цену на 15%. 
Поставщик уже дважды отказывал на прошлых раундах, но во втором раунде 
предложил скидку 5% в обмен на увеличение объёма заказа.

История переговоров:
Раунд 1: я попросил -15%, поставщик отказал полностью.
Раунд 2: я попросил -15%, поставщик предложил -5% при увеличении объёма на 20%.

Шаг 1 — Предсказание: прежде чем предлагать свой следующий шаг, 
предскажи, как поставщик отреагирует на раунд 3, учитывая его прошлое 
поведение и вероятную логику (маржа, интерес в долгосрочном контракте).

Шаг 2 — Решение: на основе этого предсказания предложи мой оптимальный 
ход на раунде 3. Кратко объясни, почему именно этот ход логичен 
при таком предсказании.

Формат ответа:
Предсказание: ...
Мой ход: ...
Обоснование: ...

Результат: Модель выдаст три чётких блока — сначала гипотезу о поведении поставщика (например, "скорее всего снова предложит компромисс по объёму, а не по цене"), затем конкретную рекомендацию хода (например, "предложи объём +10% в обмен на -10% к цене, а не -15%"), и короткое обоснование логики. Ответ будет опираться не просто на "что было в прошлый раз", а на явную модель мотивов другой стороны.


🧠

Почему это работает

Без специальной инструкции модель по умолчанию тяготеет к самому простому паттерну: делай то, что сработало в прошлый раз. Это похоже на поведение алгоритма обучения с подкреплением — реакция на исход, а не размышление о мотивах другой стороны. Такое поведение легко считать и обыграть, потому что оно однообразное.

При этом LLM хорошо умеет генерировать текст "с точки зрения другого" — если её явно попросить. Формулировка "предскажи, что сделает соперник" запускает у модели своего рода симуляцию чужой логики текстом.

SCoT использует эту сильную сторону: заставляет модель сначала произвести предсказание вслух, а потом использовать этот же текст как контекст для решения. Это похоже на обычный Chain-of-Thought, но нацеленный конкретно на социальное рассуждение — не "распиши шаги решения задачи", а "распиши, что думает другая сторона".

Рычаги управления: - Замени "соперника" на любого контрагента — клиента, начальника, конкурента, оппонента в споре. - Добавь второй уровень: "предскажи, что он думает про твой предыдущий ход" — для более сложных многоходовых переговоров это создаёт рассуждение второго порядка (модель думает о том, что думает о ней). - Вставь проверку на "застревание в паттерне": "если ты предлагал одно и то же три раза подряд — рассмотри смену стратегии". В исследовании именно готовность менять ход (а не упорствовать) сильнее всего коррелировала с результатом.


📋

Шаблон промпта

Ты участвуешь в повторяющемся стратегическом взаимодействии с {контрагент}.

Ситуация: {описание_ситуации_и_цели}
История прошлых ходов: {история_ходов_и_реакций}

Шаг 1 — Предсказание: прежде чем выбрать свой ход, предскажи, что сделает 
{контрагент} на этом шаге. Опирайся на его прошлые решения и вероятную логику 
(мотивы, ограничения, интересы).

Шаг 2 — Решение: на основе этого предсказания выбери свой оптимальный ход. 
Кратко объясни, почему именно он лучший при таком предсказании.

Выведи в формате:
Предсказание: ...
Мой ход: ...
Обоснование: ...

Подставляй: {контрагент} — с кем идёт взаимодействие (клиент, поставщик, конкурент), {описание_ситуации_и_цели} — что вы хотите получить, {история_ходов_и_реакций} — что уже происходило в предыдущих раундах.

🚀 Быстрый старт — вставь в чат:

Вот шаблон Social Chain-of-Thought для стратегических переговоров. 
Адаптируй под мою задачу: {твоя задача}. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про контрагента, цель и историю прошлых раундов — потому что без этого предсказание его хода будет пустой догадкой, а не рассуждением на основе данных.


⚠️

Ограничения

⚠️ Эффект зависит от модели: приём почти всегда помогает, но размер выигрыша разный — где-то прирост огромный, где-то скромный. Для новых reasoning-моделей (типа GPT-5) выигрыш может быть минимальным — они и без подсказки рассуждают о мотивах другой стороны.

⚠️ Нужна история взаимодействия: метод работает в повторяющихся раундах, где есть прошлые ходы для анализа. В одноразовом решении без истории "предсказание" превращается в гадание на пустом месте.

⚠️ Однообразность поведения модели: в исследовании одна и та же модель при одинаковом промпте вела себя почти одинаково от запуска к запуску — в отличие от людей, у которых сильный разброс индивидуальных стратегий. Не жди от модели "живой" непредсказуемости человека — она более шаблонна.


🔍

Как исследовали

Исследователи взяли две классические экономические игры — "игру в инспекцию" (сотрудник решает работать или лениться, работодатель решает проверять или нет) и "камень-ножницы-бумага" (с буквами J/Q/Z вместо привычных символов, чтобы убрать смысловые ассоциации). Против LLM и 251 живого человека выставили компьютерных соперников разного уровня "хитрости" — от простого до умеющего просчитывать реакцию на твои действия.

Проверили четыре семейства моделей — DeepSeek, GPT-4.1, GPT-5, Gemini — с обычным промптом и с SCoT. Чтобы понять, что происходит внутри, а не просто сравнить очки, к решениям каждой группы подогнали математические модели поведения: "реагирую на прошлый исход" (простое подкрепление), "слежу за паттерном соперника" (первый порядок), "предугадываю, как мой ход повлияет на соперника" (второй порядок, как у людей).

Оказалось, что без SCoT большинство моделей лучше всего описывались самой простой моделью — реакцией на исход, а не мышлением о сопернике. SCoT сдвигал победившую модель к более сложному типу рассуждения почти во всех случаях. GPT-5 без всякой подсказки сразу показывал поведение "второго порядка" — той же сложности, что у людей, и даже точнее подстраивался под усложняющегося соперника. Это и есть главный практический вывод: явная просьба "предскажи, что сделает другая сторона" реально меняет тип рассуждения модели, а не просто улучшает результат косметически.


📋 Дайджест исследования

Ключевая суть

Обнаружено: без специальной подсказки большинство LLM в переговорах и играх ведут себя как примитивный счётчик подкреплений — просто повторяют то, что сработало в прошлый раз, вообще не думая о мотивах другой стороны. Из-за этого их легко просчитать и обыграть — противник видит паттерн за пару раундов. Social Chain-of-Thought (SCoT) позволяет заставить модель рассуждать о намерениях контрагента перед тем как принять решение — в переговорах, спорах, играх с повторяющимся взаимодействием. Модель сначала прописывает текстом предсказание хода соперника, а потом использует этот же текст как основание для своего решения — это разворачивает обычный chain-of-thought в сторону социального рассуждения, и результат вплотную подходит к человеческому уровню или превосходит его.

Принцип работы

Работает как двухшаговый конвейер внутри одного ответа модели. Шаг 1 — модель проговаривает вслух, что, по её мнению, сделает соперник, опираясь на историю его ходов. Шаг 2 — модель выбирает свой ход, но уже не из истории, а из собственного предсказания на шаге 1. Модель не думает о прошлом соперника — она думает о его будущих мыслях, и именно эта смена фокуса меняет всё поведение. Можно усилить приём вторым уровнем — попросить модель предсказать, что соперник думает про её предыдущий ход — тогда получается рассуждение второго порядка, как в реальных многоходовых переговорах.

Почему работает

LLM неплохо умеет писать текст «от лица другого» — если попросить прямо. Формулировка «предскажи, что сделает соперник» запускает у модели что-то похожее на симуляцию чужой логики текстом, а не молчаливое угадывание. Без этой просьбы модель скатывается в самый ленивый режим — «делай то, что вчера сработало», и это легко считываемый однообразный паттерн. Готовность модели сменить стратегию, а не упорствовать в одном ходе, оказалась сильнее всего связана с итоговым результатом — то есть SCoT работает не потому что модель стала умнее в целом, а потому что перестала зацикливаться на одном ответе. Отдельная деталь: новейшие reasoning-модели типа GPT-5 делают это моделирование чужих мотивов сами, без всякой подсказки — SCoT для них почти ничего не добавляет.

Когда применять

Стратегические взаимодействия с повторяющимися раундами → переговоры о цене, споры, игры, где есть история прошлых ходов другой стороны, особенно когда контрагент подстраивается под ваше поведение и легко считывает шаблон. НЕ подходит для одноразовых решений без истории — там «предсказание» превращается в гадание на кофейной гуще, а не в рассуждение на данных.

Мини-рецепт

1. Дай историю: распиши прошлые ходы контрагента и его реакции, без этого предсказывать нечего.
2. Попроси предсказать первым: явно вставь шаг «прежде чем решить свой ход, предскажи ход соперника» — до, а не после решения.
3. Свяжи шаги: попроси модель обосновать свой ход именно через собственное предсказание, а не через общую логику.
4. Добавь ловушку на застревание: «если предлагал одно и то же три раза подряд — рассмотри смену стратегии» — это самый рабочий рычаг из всего приёма.

Примеры

[ПЛОХО] : Предложи мой следующий шаг в переговорах с поставщиком, учитывая прошлые раунды
[ХОРОШО] : Шаг 1 — Предсказание: предскажи, как поставщик отреагирует на раунд 3, учитывая его прошлое поведение и мотивы (маржа, интерес к долгосрочному контракту). Шаг 2 — Решение: на основе этого предсказания предложи мой оптимальный ход. Обоснование: почему этот ход логичен именно при таком предсказании
Источник: Assessing mentalization in humans and large language models
ArXiv ID: 2608.26291 | Сгенерировано: 2026-08-28 04:33

Проблемы LLM

ПроблемаСутьКак обойти
Модель повторяет прошлый успешный ход вместо рассуждения о мотивах другой стороныВ любом повторяющемся взаимодействии (переговоры, игра, спор) модель по умолчанию делает то, что сработало в прошлый раз. Она не думает "чего хочет соперник" — просто реагирует на исход. Из-за этого её легко считать и обыграть: паттерн однообразный, противник быстро подстраиваетсяПопроси модель явно предсказать текстом, что сделает другая сторона, ПЕРЕД тем как она выберет свой ход. Формат: сначала "Предсказание: ...", потом "Мой ход: ...". Предсказание становится контекстом для решения

Методы

МетодСуть
Social Chain-of-Thought — предсказание чужого хода перед своим решениемРазбей ответ модели на два шага в одном промпте: 1) предскажи ход контрагента на основе истории и его вероятных мотивов; 2) выбери свой ход, опираясь на это предсказание. Предсказание: ... / Мой ход: ... / Обоснование: .... Почему работает: модель хорошо умеет писать текст "с точки зрения другого", если её явно попросить — это переключает её с режима "реагирую на прошлое" на режим "думаю о чужих мыслях". Когда работает: есть история нескольких раундов взаимодействия, нужно предсказывать поведение другой стороны — переговоры, споры, повторяющиеся игры, конкурентная динамика. Когда не работает: одноразовое решение без истории — предсказание превращается в пустую догадку. Можно усложнить до рассуждения второго порядка: "предскажи, что он думает о твоём предыдущем ходе"
📖 Простыми словами

Assessing mentalization in humans andlargelanguagemodels

arXiv: 2608.26291

По умолчанию языковые модели ведут себя в любых играх и спорах как примитивные боты: они просто повторяют прошлый успешный паттерн. Никакого понимания чужих мотивов там нет — обычная слепая реакция на исход. Но если применить Social Chain-of-Thought (SCoT) и заставить модель сначала влезть в чужую голову, качество ходов резко растет, превращая тупой автокомплит в стратега с рабочей ментализацией.

Это как играть в покер и пялиться исключительно в свои две карты, начисто игнорируя поведение соперника. Формально ты в игре, но тебя разденут до нитки за пару раундов, потому что твой шаблон считывается мгновенно. Метод SCoT буквально заставляет нейросеть оторвать взгляд от своих карт и прицельно спросить себя: «А что этот парень задумал против меня?»

Механика метода проста: задачу делят на два обязательных шага. Сначала модель заставляют выдать прогноз действий противника с учетом его скрытых стимулов, и только затем строить свой ответ на базе этой догадки. Без такого пинка нейросеть скатывается в ленивую эвристику, которую любой опытный переговорщик раскатает в два счета.

Тестировали механику на играх, но принцип универсален. Пошаговые переговоры о цене с поставщиком, согласование неудобных контрактов, ценовые войны или B2B-продажи — SCoT работает везде, где есть конфликт интересов. Везде, где исход зависит от реакции живого человека, модель обязана просчитывать чужой шаг наперед.

Короче: завязывай просить AI выдать ответ в стиле «напиши, что сказать клиенту». Сначала требуй расписать, как оппонент попытается тебя прогнуть, и только потом запрашивай финальный оффер. Кто научит модель думать о чужих мотивах — заберет лучшие условия сделки, остальные продолжат сливать раунды по шаблону.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с