TL;DR
Social Chain-of-Thought (SCoT) — простой приём: перед тем как модель выбирает свой ход в стратегической игре, её просят явно предсказать, что сделает противник. Только после этого модель принимает решение, опираясь на своё же предсказание.
Главная находка: без этой подсказки большинство LLM ведут себя как простой "счётчик подкреплений" — повторяют то, что сработало в прошлый раз, вместо того чтобы думать о том, что думает противник. Из-за этого их легко предсказать и обыграть — противник видит паттерн и подстраивается. Только новейшие reasoning-модели (GPT-5) делают это моделирование "в голове" сами, без специальных инструкций.
SCoT решает проблему в один шаг внутри промпта: сначала модель формулирует предсказание хода соперника (текстом), потом на основе этого предсказания выбирает свой ход. Этот простой сдвиг переводит модель с уровня "реагирую на прошлое" на уровень "думаю о чужих мыслях" — и результат резко улучшается, вплотную приближаясь к человеческому уровню или превосходя его.
Схема метода
ШАГ 1: Модель предсказывает следующий ход/решение соперника, опираясь на историю → текстовое предсказание
ШАГ 2: Модель выбирает свой ход, учитывая собственное предсказание из шага 1 → финальное решение
Оба шага выполняются в одном промпте/одном ответе модели — просто в него добавлена явная просьба сначала предсказать, потом решить. Повторяется на каждом раунде взаимодействия.
Пример применения
Задача: Вы готовитесь к переговорам с крупным поставщиком о снижении цены на закупку. Переговоры идут раундами — вы делаете предложение, поставщик отвечает, вы корректируете позицию.
Промпт:
Ты — мой стратегический советник по переговорам с поставщиком.
Ситуация: я закупаю товар оптом, хочу снизить цену на 15%.
Поставщик уже дважды отказывал на прошлых раундах, но во втором раунде
предложил скидку 5% в обмен на увеличение объёма заказа.
История переговоров:
Раунд 1: я попросил -15%, поставщик отказал полностью.
Раунд 2: я попросил -15%, поставщик предложил -5% при увеличении объёма на 20%.
Шаг 1 — Предсказание: прежде чем предлагать свой следующий шаг,
предскажи, как поставщик отреагирует на раунд 3, учитывая его прошлое
поведение и вероятную логику (маржа, интерес в долгосрочном контракте).
Шаг 2 — Решение: на основе этого предсказания предложи мой оптимальный
ход на раунде 3. Кратко объясни, почему именно этот ход логичен
при таком предсказании.
Формат ответа:
Предсказание: ...
Мой ход: ...
Обоснование: ...
Результат: Модель выдаст три чётких блока — сначала гипотезу о поведении поставщика (например, "скорее всего снова предложит компромисс по объёму, а не по цене"), затем конкретную рекомендацию хода (например, "предложи объём +10% в обмен на -10% к цене, а не -15%"), и короткое обоснование логики. Ответ будет опираться не просто на "что было в прошлый раз", а на явную модель мотивов другой стороны.
Почему это работает
Без специальной инструкции модель по умолчанию тяготеет к самому простому паттерну: делай то, что сработало в прошлый раз. Это похоже на поведение алгоритма обучения с подкреплением — реакция на исход, а не размышление о мотивах другой стороны. Такое поведение легко считать и обыграть, потому что оно однообразное.
При этом LLM хорошо умеет генерировать текст "с точки зрения другого" — если её явно попросить. Формулировка "предскажи, что сделает соперник" запускает у модели своего рода симуляцию чужой логики текстом.
SCoT использует эту сильную сторону: заставляет модель сначала произвести предсказание вслух, а потом использовать этот же текст как контекст для решения. Это похоже на обычный Chain-of-Thought, но нацеленный конкретно на социальное рассуждение — не "распиши шаги решения задачи", а "распиши, что думает другая сторона".
Рычаги управления: - Замени "соперника" на любого контрагента — клиента, начальника, конкурента, оппонента в споре. - Добавь второй уровень: "предскажи, что он думает про твой предыдущий ход" — для более сложных многоходовых переговоров это создаёт рассуждение второго порядка (модель думает о том, что думает о ней). - Вставь проверку на "застревание в паттерне": "если ты предлагал одно и то же три раза подряд — рассмотри смену стратегии". В исследовании именно готовность менять ход (а не упорствовать) сильнее всего коррелировала с результатом.
Шаблон промпта
Ты участвуешь в повторяющемся стратегическом взаимодействии с {контрагент}.
Ситуация: {описание_ситуации_и_цели}
История прошлых ходов: {история_ходов_и_реакций}
Шаг 1 — Предсказание: прежде чем выбрать свой ход, предскажи, что сделает
{контрагент} на этом шаге. Опирайся на его прошлые решения и вероятную логику
(мотивы, ограничения, интересы).
Шаг 2 — Решение: на основе этого предсказания выбери свой оптимальный ход.
Кратко объясни, почему именно он лучший при таком предсказании.
Выведи в формате:
Предсказание: ...
Мой ход: ...
Обоснование: ...
Подставляй: {контрагент} — с кем идёт взаимодействие (клиент, поставщик, конкурент), {описание_ситуации_и_цели} — что вы хотите получить, {история_ходов_и_реакций} — что уже происходило в предыдущих раундах.
🚀 Быстрый старт — вставь в чат:
Вот шаблон Social Chain-of-Thought для стратегических переговоров.
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит про контрагента, цель и историю прошлых раундов — потому что без этого предсказание его хода будет пустой догадкой, а не рассуждением на основе данных.
Ограничения
⚠️ Эффект зависит от модели: приём почти всегда помогает, но размер выигрыша разный — где-то прирост огромный, где-то скромный. Для новых reasoning-моделей (типа GPT-5) выигрыш может быть минимальным — они и без подсказки рассуждают о мотивах другой стороны.
⚠️ Нужна история взаимодействия: метод работает в повторяющихся раундах, где есть прошлые ходы для анализа. В одноразовом решении без истории "предсказание" превращается в гадание на пустом месте.
⚠️ Однообразность поведения модели: в исследовании одна и та же модель при одинаковом промпте вела себя почти одинаково от запуска к запуску — в отличие от людей, у которых сильный разброс индивидуальных стратегий. Не жди от модели "живой" непредсказуемости человека — она более шаблонна.
Как исследовали
Исследователи взяли две классические экономические игры — "игру в инспекцию" (сотрудник решает работать или лениться, работодатель решает проверять или нет) и "камень-ножницы-бумага" (с буквами J/Q/Z вместо привычных символов, чтобы убрать смысловые ассоциации). Против LLM и 251 живого человека выставили компьютерных соперников разного уровня "хитрости" — от простого до умеющего просчитывать реакцию на твои действия.
Проверили четыре семейства моделей — DeepSeek, GPT-4.1, GPT-5, Gemini — с обычным промптом и с SCoT. Чтобы понять, что происходит внутри, а не просто сравнить очки, к решениям каждой группы подогнали математические модели поведения: "реагирую на прошлый исход" (простое подкрепление), "слежу за паттерном соперника" (первый порядок), "предугадываю, как мой ход повлияет на соперника" (второй порядок, как у людей).
Оказалось, что без SCoT большинство моделей лучше всего описывались самой простой моделью — реакцией на исход, а не мышлением о сопернике. SCoT сдвигал победившую модель к более сложному типу рассуждения почти во всех случаях. GPT-5 без всякой подсказки сразу показывал поведение "второго порядка" — той же сложности, что у людей, и даже точнее подстраивался под усложняющегося соперника. Это и есть главный практический вывод: явная просьба "предскажи, что сделает другая сторона" реально меняет тип рассуждения модели, а не просто улучшает результат косметически.
