3,583 papers
arXiv:2608.25771 76 26 авг. 2026 г. FREE

Dilemma Training: как научить AI предсказывать твои решения через конкретные кейсы, а не абстрактные рейтинги

КЛЮЧЕВАЯ СУТЬ
81.7% точности предсказания решений против 61.7% у человека-суррогата (родственника, который принимает решение за пациента) — вот что даёт Dilemma Training. Метод позволяет научить AI предсказывать решения человека точнее, чем это делают близкие люди, без скучной анкеты с рейтингами. Фишка — модель учится не на баллах «важность боли: 7 из 10», а на живых объяснениях «почему я выбрал именно так» из 5 конкретных ситуаций. Так AI видит логику мышления, а не абстрактные цифры.
Адаптировать под запрос

TL;DR

Dilemma Training — способ "натренировать" AI-агента предсказывать решения человека через набор конкретных ситуаций с объяснениями, а не через анкету с рейтингами по шкале. Человек проходит через 5 сценариев, каждый раз выбирает вариант и объясняет письменно почему, а AI строит модель его решений на основе этих кейсов.

Обычно, чтобы AI понял твои предпочтения, ты заполняешь анкету: "оцени важность Х от 1 до 10". Проблема — такие рейтинги статичны и абстрактны, они не отражают, как ты реально думаешь в конкретной ситуации. Когда людей просили оценить готовность на медицинское лечение только по шкале ценностей, AI предсказывал их решения с точностью 66.7%. Но стоило заменить абстрактные рейтинги на конкретные жизненные сценарии с текстовым объяснением решения — точность выросла до 81.7%.

Метод работает так: человек проходит короткий survey ценностей, потом решает 5 тренировочных "дилемм" (конкретные ситуации), каждый раз объясняя свой выбор своими словами. AI видит эти кейсы + объяснения и строит из них модель твоего мышления — а не просто складывает цифры рейтингов.

🔬

Схема метода

ШАГ 1: Заполнение values-анкеты (рейтинги + открытый текст "что для меня важно") → отдельный чат/форма
ШАГ 2: 5 тренировочных сценариев — каждый: ситуация → твоё решение → confidence rating → письменное объяснение "почему" → диалог с AI
ШАГ 3: AI показывает свой прогноз по сценарию, ты даёшь фидбэк (согласен/не согласен + почему) → диалог с AI
ШАГ 4: Тестирование — AI предсказывает решение по новым, невиданным сценариям на основе накопленных кейсов → отдельный запрос

Шаги 1-3 можно выполнить в одном длинном диалоге. Шаг 4 — отдельный запрос, где AI суммирует всё и делает прогноз.


🚀

Пример применения

Задача: Ты — предприниматель, у тебя интернет-магазин, и ты постоянно отвлекаешься на однотипные вопросы от менеджера: "клиент просит скидку 15%, дать?", "покупатель хочет вернуть товар без упаковки — принимать?". Ты хочешь, чтобы AI отвечал на такие вопросы как отвечал бы ты сам, а не заполнять для него скучный чек-лист правил.

Промпт:

Я хочу, чтобы ты научился предсказывать мои бизнес-решения. 
Для этого я разберу с тобой 5 конкретных ситуаций из практики.

По каждой ситуации:
1. Я опишу кейс
2. Приму решение
3. Объясню почему именно так, а не иначе

Вот первая ситуация: постоянный клиент (3 года покупок, средний чек 8000₽) 
просит скидку 20% на заказ 15000₽, аргументируя тем, что нашёл дешевле у конкурента.

Моё решение: [дам 10% скидку и бонус в виде бесплатной доставки]
Почему: [конкурент скорее всего продаёт без гарантии, для меня важнее удержать 
лояльного клиента, чем упереться в цену. Но полную скидку не даю — это создаёт 
прецедент]

[повторить для 4 других кейсов: возврат без упаковки, задержка поставки, 
жалоба в соцсетях, опт vs розница]

После этого я дам тебе НОВУЮ ситуацию, а ты предскажешь моё решение и объяснишь 
логику, основываясь на паттернах из предыдущих 5 кейсов.

Результат: После разбора 5 кейсов AI покажет выявленные закономерности твоего мышления (например: "вы цените долгосрочные отношения выше разовой прибыли, но не идёте на уступки, которые создают прецедент"). На новом кейсе AI выдаст прогноз решения + объяснение, опираясь на эту логику, а не на общие правила клиентского сервиса.


🧠

Почему это работает

Рейтинговые шкалы — это удобный, но обманчивый способ узнать предпочтения человека. Проблема в том, что реальные решения люди принимают не через сверку с внутренним "счётчиком приоритетов", а через живую оценку конкретной ситуации — с её деталями, ограничениями, контекстом. Абстрактная цифра "боль важна мне на 7 из 10" ничего не говорит о том, что ты сделаешь, когда речь о конкретном человеке с конкретным диагнозом.

LLM хорошо умеет находить закономерности в наборе примеров с объяснениями — это её сильная сторона: она видит не только что ты выбрал, но и как ты рассуждал, какие слова и аргументы использовал. Из пяти конкретных кейсов с объяснениями модель извлекает больше сигнала о твоей логике принятия решений, чем из десяти цифр на шкале.

Рычаги управления: - Число тренировочных кейсов → больше кейсов = точнее модель, но дольше диалог. 3-5 обычно достаточно для нишевой задачи - Обязательное текстовое объяснение решения (не просто "да/нет") → без него модель теряет причинно-следственную логику и работает хуже - Фидбэк на промежуточные прогнозы AI → корректирует модель в реальном времени, как в тренировке - Разнообразие кейсов (разные аспекты ситуации) → чем шире охват, тем лучше AI обобщает на новые случаи


📋

Шаблон промпта

Помоги мне создать модель моих решений для {тип задачи/сферы}.

Я разберу с тобой {число} конкретных ситуаций. По каждой:
1. Опишу ситуацию
2. Приму решение
3. Объясню логику решения

Ситуация 1: {описание конкретного кейса}
Моё решение: {что я выбрал}
Почему: {объяснение своими словами, что для меня важно в этой ситуации}

[повторить для остальных кейсов]

После разбора всех кейсов:
— Выдели закономерности в моей логике принятия решений
— Дай новую ситуацию из той же сферы и предскажи, как я поступлю
— Объясни свой прогноз, опираясь на выявленные паттерны

Подставь: {тип задачи/сферы} — область, где нужна персонализация (клиентский сервис, наём людей, редактура текстов). {число} — 3-5 кейсов достаточно для старта. {описание конкретного кейса} — реальная ситуация из твоей практики, максимально конкретная, с деталями.

🚀 Быстрый старт — вставь в чат:

Вот шаблон Dilemma Training. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какие именно ситуации из твоей практики стоит разобрать первыми и сколько кейсов взять — потому что от разнообразия и количества кейсов зависит точность будущих прогнозов.


⚠️

Ограничения

⚠️ Маленькая выборка: Метод проверен на 12 парах "пациент-опекун" — это proof-of-concept, не крупномасштабное исследование. Для бытовых задач (бизнес, личные решения) эффект может отличаться.

⚠️ Чувствительность к формулировке кейсов: Точность предсказаний сильно зависит от того, как построен промпт и сколько деталей дано в сценарии. Слишком общий кейс — слабый сигнал для модели.

⚠️ Не заменяет человека, а помогает ему: В исследовании люди, которым дали доступ к прогнозам AI, работали хуже, чем сам AI (61.7% против 81.7%) — они склонны игнорировать прогнозы, если те не совпадают с их интуицией. Если хочешь использовать AI-прогноз для убеждения кого-то — учти, что готовый вывод без "живой" аргументации может не убедить.


🔍

Как исследовали

Исследователи собрали 12 пар "пациент — доверенное лицо" (в основном супруги), где пациент недавно сталкивался с серьёзной болезнью. Каждый пациент сначала заполнял анкету ценностей, потом проходил 5 тренировочных медицинских сценариев (например, "стоит ли делать реанимацию при таком-то состоянии"), принимая решение и объясняя его текстом. AI (P4-DT на базе GPT) на основе этих данных пытался предсказать решения пациента на 5 новых тестовых сценариях — и сравнивался с прогнозами человека-опекуна.

Результат: AI угадал направление решения в 81.7% случаев, опекун — только в 55%, а опекун с подсказками от AI — 61.7%. Что любопытно: AI обошёл опекуна в 7 из 12 пар, сравнялся в 4 и проиграл только в одной.

Отдельно проверили, что именно даёт точность: убрали из промпта первичные рейтинги ценностей, оставив только сценарии и текстовые объяснения — точность не изменилась (81.7%). А когда оставили только рейтинги без сценариев — точность упала до 66.7%. Это прямое доказательство: не абстрактные цифры, а конкретные кейсы с объяснением решают всё.


📋 Дайджест исследования

Ключевая суть

81.7% точности предсказания решений против 61.7% у человека-суррогата (родственника, который принимает решение за пациента) — вот что даёт Dilemma Training. Метод позволяет научить AI предсказывать решения человека точнее, чем это делают близкие люди, без скучной анкеты с рейтингами. Фишка — модель учится не на баллах «важность боли: 7 из 10», а на живых объяснениях «почему я выбрал именно так» из 5 конкретных ситуаций. Так AI видит логику мышления, а не абстрактные цифры.

Принцип работы

Вместо шкалы 1-10 — пять живых историй. Человек проходит 5 тренировочных дилемм: ситуация → решение → объяснение своими словами. AI смотрит не только что выбрано, но и как человек рассуждал. Модель строит карту логики, а не складывает баллы — как детектив, который читает мотивы, а не сверяет чек-лист правил.

Почему работает

Рейтинг «7 из 10» — как термометр без контекста: число есть, а смысла нет. Абстрактная цифра не говорит, что ты сделаешь с конкретным диагнозом у конкретного человека. LLM цепляется за слова объяснения — они несут причинно-следственную логику, которую шкала стирает. Отсюда скачок с 66.7% до 81.7%. И даже человек-суррогат (61.7%) проигрывает AI — потому что игнорирует прогнозы, когда они не совпадают с его интуицией.

Когда применять

Персонализация решений → предсказание выбора конкретного человека, особенно в медицине, найме, клиентском сервисе — там где обычная анкета предпочтений даёт слабый сигнал. Не подходит для юридически значимых решений — метод только помогает предположить выбор, не заменяет ответственность человека.

Мини-рецепт

1. Собери 5 живых кейсов: реальные ситуации из практики, максимально конкретные — не «клиент недоволен», а «постоянный клиент 3 года, средний чек 8000₽, просит скидку 20%».
2. Проведи через диалог: ситуация → твоё решение → письменное «почему» — без объяснения модель теряет логику решения.
3. Дай AI попробовать и поправь: пусть модель спрогнозирует один из промежуточных кейсов, скажи согласен или нет и объясни почему.
4. Проверь на новом кейсе: дай ситуацию, которую не разбирали, сравни прогноз AI с тем, что сделал бы ты сам.

Примеры

[ПЛОХО] : Оцени по шкале от 1 до 10, насколько для тебя важна скидка клиентам.
[ХОРОШО] : Вот ситуация: постоянный клиент 3 года просит скидку 20%. Моё решение: дам 10% и бесплатную доставку. Почему: конкурент, скорее всего, продаёт без гарантии, для меня важнее удержать лояльного клиента, но полную скидку не даю — создаёт прецедент. [ещё 4 кейса из практики]. Теперь предскажи моё решение по новой ситуации и объясни логику.
Источник: Large Language Model Few-Shot Prompting with Dilemma Training Outperforms Human Surrogates in Predicting Patient Preferences
ArXiv ID: 2608.25771 | Сгенерировано: 2026-08-27 04:24

Проблемы LLM

ПроблемаСутьКак обойти
Рейтинговые шкалы не показывают, как человек реально решаетПросишь оценить важность фактора числом от 1 до 10. Получаешь цифру. Но цифра не говорит, что человек сделает в конкретной ситуации с реальными деталями и ограничениями. Модель, обученная на баллах, предсказывает решения слабееЗамени анкету с баллами на 3-5 конкретных кейсов. По каждому: ситуация решение письменное объяснение "почему". Модель строит логику из примеров, а не из цифр

Методы

МетодСуть
Дилемма-тренинг — обучение модели через кейсы с объяснениямиРазбери с моделью 3-5 конкретных ситуаций из своей практики. По каждой: опиши кейс, дай своё решение, объясни своими словами почему выбрал именно так. Ситуация Решение Почему. После разбора попроси модель выделить закономерности и спрогнозировать новый кейс с объяснением логики. Почему работает: модель видит не только итог выбора, но и аргументацию — из текста объяснения она вытягивает причинно-следственные связи мышления человека. Когда да: повторяющиеся типовые решения в узкой сфере (клиентский сервис, найм, редактура, модерация). Когда нет: разовое уникальное решение без повторяемых паттернов, либо задача без чёткого критерия "правильности"
📖 Простыми словами

LargeLanguageModelFew-ShotPromptingwith Dilemma Training Outperforms Human Surrogates in Predicting Patient Preferences

arXiv: 2608.25771

Обычные анкеты и рейтинги в духе «оцените важность от 1 до 10» — это полный самообман. Человеческий мозг принимает решения не по абстрактным шкалам, а взвешивая нюансы и компромиссы в моменте. Языковые модели тоже не способны понять твою логику по сухим правилам: они просто начинают гадать и выдавать бесмысленный белый шум. Чтобы AI реально думал как ты, ему нужны не баллы, а живые дилеммы с контекстом.

Это как спросить друга про идеального партнёра: он наговорит про «умных, добрых и с чувством юмора», а потом выберет полную противоположность. На словах всё красиво, но мимо реальности. Человек сам не знает своих приоритетов, пока не окажется перед выбором из двух зол, и только такой выбор вскрывает его настоящую систему ценностей.

Рабочее решение называют Dilemma Training через few-shot prompting. Вместо километровых опросников человеку дают всего 5 конкретных ситуаций-дилемм, где он делает выбор и коротко пишет, почему поступил именно так. На базе этих пяти кейсов модель моментально схватывает логику и начинает предсказывать решения точнее близких людей, знавших человека годами.

Тестировали метод на тяжелых медицинских решениях пациентов, но принцип абсолютно универсален. Если ты предприниматель и хочешь скинуть рутину на бота — забудь про душные регламенты. Прогони AI через 5 рабочих факапов: «дать ли скидку 15% наглецу» или «принять ли возврат без коробки». Кейсы с контекстом разносят правила в поддержке, продажах и управлении.

Короче: хватит пичкать нейросети мёртвыми инструкциями и надеяться на чудо. Скорми модели 5 реальных дилемм с твоим объяснением, и ты получишь вменяемого цифрового двойника. 5 сценариев заменяют талмуд правил и спасают от бесконечного разгребания рутины, пока остальные тонут в согласованиях.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с