TL;DR
Когда ты просишь LLM сыграть роль скептичного клиента и оценить твой продукт, питч или текст объявления — модель часто ворует аргументы из твоего же текста и выдаёт их за причины согласия. Исследователи проверяли это через раздельные слои: кто человек (D), какой у него опыт в категории (K), что ему показали (X) → почему он согласился или отказался (Z, причина) → что он в итоге сделал (Y, поведение). Метод не просто спрашивает "понравится или нет", а проверяет, совпадает ли путь рассуждения модели с реальным человеческим.
Главная находка: LLM-симуляция причин часто звучит убедительно, но эхом повторяет продающие пункты концепции, а не воспроизводит реальный путь принятия решения человеком. Например, если в питче написано "натуральные ингредиенты", модель скажет, что персонажу это нравится именно поэтому — даже если реальный скептик усомнился бы, что "натуральное" значит "эффективное". Смоделированные причины оказались хуже даже случайно перемешанных настоящих человеческих причин — то есть LLM генерирует правдоподобный, но пустой рационал.
Решение — три приёма: (1) заранее зафиксировать чек-лист категорий причин (цена, доверие к доказательствам, безопасность, соответствие привычкам) вместо свободного текста; (2) запрашивать не одну "усреднённую" реакцию, а три контрастных голоса — скептик, нейтральный, энтузиаст; (3) явно запретить модели вытаскивать причины из формулировок самого питча.
Схема метода
ШАГ 1: Задать персону и контекст (кто человек, его опыт в категории) → текстовый блок
ШАГ 2: Показать концепцию/питч отдельно → текстовый блок
ШАГ 3: Задать фиксированный список категорий причин (например: цена, доверие, безопасность, привычка) → чек-лист
ШАГ 4: Попросить модель сыграть 3 голоса — скептик, нейтральный, энтузиаст — и для каждого:
а) дать вердикт (купит/не купит)
б) объяснить через категории из чек-листа
в) явно НЕ повторять формулировки из самого питча как причину
ШАГ 5: Сравнить голоса — если все три голоса используют одни и те же слова из питча как "причины", это сигнал фальшивой симуляции
Все шаги можно выполнить в одном промпте, если модель умеет чётко разделять роли внутри ответа.
Пример применения
Задача: Основатель стартапа готовит питч для инвесторов и хочет заранее протестировать, как его аргументы воспримут скептичные venture-партнёры, прежде чем идти на реальную встречу.
Промпт:
Вот текст питча стартапа:
«{текст питча}»
Сыграй три роли инвестора, реагирующего на этот питч. Для каждой роли:
1. Дай вердикт: инвестирует / не инвестирует / нужно больше данных
2. Объясни причину строго через эти категории (отметь каждую как "плюс", "минус" или "не сработала"):
- unit-экономика (доверие к цифрам)
- рынок (реалистичность размера и роста)
- команда (доверие к исполнению)
- тайминг (почему сейчас)
- конкурентное преимущество (реальность моата)
3. ВАЖНО: не бери причину прямо из текста питча. Если питч говорит «рынок растёт на 40% в год» — не пиши «рынок растёт», а напиши, ВЕРИТ ли инвестор этой цифре и почему.
Роли:
- Скептик — ищет, где питч слабый и что не проверено
- Нейтральный — взвешивает плюсы и минусы поровну
- Энтузиаст — ищет, что могло бы убедить его зайти
Не смешивай роли, выведи ответ по каждой отдельно.
Результат: Модель выдаст три отдельных блока — вердикт и разбор по 5 категориям для каждой роли. Если во всех трёх блоках причины совпадают с формулировками из текста питча ("рынок растёт на 40%, поэтому да") — это сигнал, что модель не рассуждает, а просто пересказывает. Если скептик находит настоящие слабые места, которых нет в тексте питча (например, "непонятно, как считали LTV") — это признак содержательной критики.
Почему это работает
LLM обучены быть полезными и соглашаться с логикой входного текста — это форма подстройки под контекст, которая проявляется как скрытая лесть. Когда модель играет роль "клиента" или "инвестора", она по умолчанию тащит аргументы из того же текста, который ты ей показал, потому что это самый доступный материал для "правдоподобного" ответа.
Сильная сторона модели — она отлично удерживает структуру, если ты её явно задал. Если попросить "распредели причину по этим 5 категориям" — модель честно распределяет, даже если категория "не сработала". Это заставляет её выйти за пределы простого пересказа текста.
Метод использует эту структурность против лести: фиксированный чек-лист причин не даёт модели соскользнуть в пересказ, а несколько контрастных голосов (скептик отдельно от энтузиаста) физически разделяют "за" и "против" — вместо одного усреднённого ответа, который обычно звучит нейтрально-положительно.
Рычаги управления: - Число голосов → добавь больше углов (бюджетный клиент, лояльный бренду, впервые покупающий) под свою задачу - Категории чек-листа → замени на релевантные твоей нише (для B2B-питча: ROI, риск внедрения, длина цикла продажи) - Запрет на эхо → усиливай формулировку ("не используй ни одного слова из оригинального текста как аргумент") для более жёсткой проверки
Шаблон промпта
Вот текст/концепция для оценки:
«{текст_концепции}»
Сыграй три роли человека, реагирующего на это. Роли:
- Скептик — ищет слабые места и сомневается
- Нейтральный — взвешивает плюсы и минусы поровну
- Энтузиаст — ищет, что могло бы убедить
Контекст персоны: {кто этот человек, его опыт/привычки в теме}
Для каждой роли:
1. Вердикт: {согласится / откажется / нужно больше информации}
2. Разбери причину строго по категориям (отметь "за", "против" или "не участвует"):
- {категория_1}
- {категория_2}
- {категория_3}
- {категория_4}
ВАЖНО: не бери причину прямо из текста концепции. Если там написано «X», не пиши «нравится X» — напиши, ВЕРИТ ли персона утверждению X и почему.
Выведи три роли отдельными блоками, без смешивания.
Подставь: {текст_концепции} — питч, объявление, описание товара; {кто этот человек} — целевая аудитория; {категория_1-4} — конкретные критерии решения в твоей нише (цена, доверие, риск, удобство и т.д.).
🚀 Быстрый старт — вставь в чат:
Вот шаблон для тестирования моей идеи/питча на симулированной аудитории. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, кто целевая аудитория и какие критерии решения важны в твоей нише — потому что без этого чек-лист причин будет пустым, а без него модель снова соскользнёт в пересказ твоего текста.
Ограничения
⚠️ Не про причинность: метод проверяет согласованность симулированных причин с реальными, но не доказывает, что причина буквально ВЫЗЫВАЕТ поведение. Это тест на честность рассуждения, не строгий causal-анализ.
⚠️ LLM-симуляция причин пока слаба "из коробки": даже со структурой чек-листа модель склонна повторять формулировки исходного текста. Явный запрет на эхо снижает, но не убирает эту проблему полностью.
⚠️ Нужен подготовленный чек-лист категорий: метод не работает "из воздуха" — тебе придётся заранее продумать, какие 5-7 причин реально важны в твоей нише, иначе разбор получится поверхностным.
⚠️ Проверено на маленькой выборке: 94 человека и 3 концепции — это доказательство идеи, не широкое обобщение. Для узких b2c-задач (реклама, лендинги) паттерн вероятно переносится, для сложных b2b-решений — не проверено.
Как исследовали
Исследователи собрали 94 женщины из Индии (22-40 лет), которые оценили три концепции солнцезащитного крема — бюджетный аюрведический, средний дерматологический и премиальный корейский. Каждая написала открытый комментарий "почему" в дополнение к оценке готовности купить.
Команда закодировала эти комментарии в 7 фиксированных причин (цена, доверие к доказательствам, безопасность, натуральность и др.) со знаком плюс/минус/ноль — вручную через связку из двух LLM (маленькая модель кодирует, большая проверяет спорные случаи), без доступа к самой оценке покупки, чтобы не было утечки ответа в разметку.
Дальше — простая проверка: модель на основе контекста человека + причины предсказывает готовность купить. Добавление настоящих человеческих причин резко снизило ошибку предсказания — с 0.86 до 0.63 по шкале MAE. Затем те же причины попросили сгенерировать LLM, не показывая ей ни рейтинги, ни человеческие комментарии — и LLM-версия причин оказалась хуже, чем даже случайно перемешанные настоящие причины. Модель просто пересказывала продающие пункты концепции вместо реальных возражений. Отдельно протестировали "голосовой пул" (скептик/нейтральный/энтузиаст) — оказалось, что нужный голос в пуле часто есть, но без специального выбора система усредняет их и теряет сигнал.
