3,583 papers
arXiv:2610.03998 77 2 окт. 2026 г. FREE

Поведенческая история вместо портрета: как делать синтетических респондентов, которые похожи на конкретного человека

КЛЮЧЕВАЯ СУТЬ
Парадокс: описание вида «женщина, 34 года, Казань, доход средний» почти ничего не добавляет к предсказанию ответа. Метод позволяет делать синтетических респондентов, которые похожи на конкретного клиента, а не на усреднённого человека. Фишка: не описывай, кто он, а покажи, что он делал раньше. Модель получает его прошлые ответы на смежные вопросы, то есть поведенческую историю. Это лучший сигнал из проверенных, но он даёт лишь около четверти того, что даёт повторный опрос самого человека.
Адаптировать под запрос
⚡

TL;DR

Синтетический респондент — это LLM, которая отвечает на вопросы «как отвечал бы конкретный человек». Исследование проверило, что в промпт класть лучше всего: демографию, черты характера, баллы тестов или прошлые ответы этого человека на другие вопросы. Лучше всего работают прошлые ответы. Описание вида «женщина, 34 года, высшее образование, доход средний» почти ничего не добавляет к предсказанию.

Главная проблема: по среднему всё выглядит прекрасно, а по людям — нет. Доля людей с каждой установкой в целом похожа на реальную. Но модель по описанию даёт «усреднённого человека»: все респонденты отвечают почти одинаково. Различия между вопросами она воспроизводит, различия между людьми — нет. Если угадывать выбор конкретного человека, портрет по демографии и характеру даёт почти случайный результат. Модель опирается на стереотип группы, а не на личность.

Суть метода: вместо описания «кто он» дай модели то, что он делал и выбирал раньше. Прошлые ответы на смежные вопросы — это лучший сигнал, который нашли. Но даже он восстанавливает лишь около четверти того, что даёт повторный опрос самого человека. Синтетический респондент не заменяет живого, он лишь грубый ориентир.

🔬

Схема метода

ЛЕСТНИЦА ИНФОРМАЦИИ (каждая ступень добавляет блок к предыдущей):
A1: только вопрос                      → ответ «человека вообще»
A2: + демография (16 полей)            → почти без пользы
A3: + черты характера (Big Five)       → почти без пользы
A4: + баллы когнитивных тестов         → чуть лучше
A5: + прошлые ответы человека          → самый сильный сигнал
    на ДРУГИЕ вопросы
    (без вопросов о том же самом)

Каждый вопрос — в новом чате, без накопленного контекста.
🚀

Пример применения

Задача: Команда подписочного сервиса (в духе «Яндекс Плюс» или «СберПрайм») хочет заранее понять, как 30 клиентов из базы отреагируют на новое предложение: «Годовая подписка за 2 990 ₽ вместо помесячной». Раньше аналитик делал персоны так: «Ты — Ирина, 34 года, Казань, менеджер, доход средний, любит путешествовать». Ответы получались гладкие и одинаковые.

Теперь у аналитика есть прошлые ответы этих клиентов из NPS-опроса и анкеты онбординга. Он кладёт в промпт именно их. Вопросы, которые прямо повторяют целевой, он убирает.

Промпт:

Ты отвечаешь на вопрос так, как ответил бы конкретный человек. 
Ниже — его реальные ответы из прошлых опросов. Опирайся на них, 
а не на стереотипы о его возрасте, городе или профессии.

<История_ответов>
Анкета онбординга (весна 2024):
- Как часто пользуетесь сервисом: 2–3 раза в неделю
- Почему подключились: «Скидки на такси и кино»
- Пробовали ли отключать автопродление: да, дважды
- Платите: помесячно

NPS-опрос (осень 2024):
- Вероятность рекомендовать (0–10): 6
- Что не нравится: «Цена растёт, а бонусы те же»
- Пользуетесь ли музыкой из подписки: нет


<Базовые_данные>
Женщина, 34 года, Казань.


Вопрос: Сервис предлагает годовую подписку за 2 990 ₽ вместо 
помесячной оплаты. Вы оформите годовую? Ответьте «да» или «нет» 
и одним предложением объясните, почему.
Отвечай от лица этого человека. Не угадывай «средний» ответ.

Результат: Модель выдаст короткий ответ «да/нет» с одной фразой обоснования. В нём должны быть видны ссылки на конкретные факты из истории: отключала автопродление, жалуется на цену. Разброс между 30 клиентами будет заметно больше, чем при портретных персонах. Это всё равно прогноз, а не факт: его нужно проверить на тех, чьё решение вы уже знаете.

🧠

Почему это работает

Слабость: по демографии и характеру модель угадывает стереотип группы. Всем «женщинам 34 лет из Казани» она даёт похожий ответ. Поэтому в статье портретные персоны дают «сжатую» картину людей: различий между вопросами много, различий между людьми мало. Метрика информированности у них около нуля.

Сильная сторона: модель хорошо видит паттерны в поведении. Если человек дважды отключал автопродление и жалуется на цену, модель логично выводит осторожность к предоплате. Это конкретный сигнал о человеке, а не о группе.

Как метод это использует: вы заменяете абстрактное описание «кто он» фактами «что он делал». Модель от них отталкивается, и ответы становятся разнообразнее. Результат: разброс по людям почти как у реальных респондентов, а предсказание конкретного выбора заметно точнее портретных вариантов.

Рычаги управления: - Больше смежных ответов → точнее сигнал. Но вопросы про тот же самый предмет убирайте, иначе проверка станет фикцией. - Свежий чат на каждый вопрос → нет накопленного эффекта, ответы не подстраиваются под предыдущие. - Демографию можно оставить, но не рассчитывайте, что она что-то добавит. В статье история шла поверх полного описания. - Явная просьба «не усредняй» — моя добавка, в статье не проверялась. Её стоит проверять на своих данных.

📋

Шаблон промпта

Ты отвечаешь на вопрос так, как ответил бы конкретный человек. 
Ниже — его реальные ответы из прошлых опросов. Опирайся на них, 
а не на стереотипы о группе, к которой он относится.

<История_ответов>
{прошлые_вопросы_и_ответы_человека}


<Базовые_данные>
{возраст_пол_город_и_прочее_если_есть}


Вопрос: {целевой_вопрос}
Формат ответа: {формат_ответа}

Что подставлять: - {прошлые_вопросы_и_ответы_человека} — реальные ответы из CRM, опросов, анкет. Без вопросов, которые измеряют то же самое, что вы предсказываете. - {базовые_данные} — по желанию. Их польза небольшая. - {целевой_вопрос} — вопрос в той же формулировке, что вы задали бы живому человеку. - {формат_ответа} — «да/нет», шкала 1–5, выбор из вариантов. Чем жёстче формат, тем проще сравнивать с реальностью.

Правила использования: 1. Каждого респондента и каждый вопрос запускайте в новом чате. 2. Если вопрос ссылается на ваш прошлый ответ, повторите его явно в промпте. 3. Проверьте на людях с известным исходом, прежде чем доверять (см. адаптации).

⚠️

Ограничения

⚠️ Точность низкая даже в лучшем случае: лучший вариант восстанавливает лишь около четверти сигнала, который даёт повторный опрос самого человека. Использовать как замену конкретному клиенту нельзя. Для оценки тренда по группе или для первичного отбора идей — можно.

⚠️ Портретные персоны почти бесполезны для индивидуального прогноза: демография и черты характера добавляют очень мало. «Ты — Ирина, 34, Казань…» без истории даёт красивый, но почти случайный ответ.

⚠️ Усреднение и перекос: модель выдаёт меньше разнообразия, чем реальные люди. Различия по доходу и образованию она преувеличивает, а различия по полу и возрасту искажает. Для некоторых установок (например, склонность к риску) она вообще сдвигает картину в одну сторону.

⚠️ Структура связей между установками не восстанавливается: в реальных данных одни установки связаны с другими. В синтетических данных эти связи не подтвердились. Кросс-анализ («кто склонен к А, тот и к Б») на таких данных строить нельзя.

⚠️ Один набор данных, одна модель: выводы получены на одной американской панели и одной модели. Для российских клиентов и других тематик результат нужно перепроверять.

⚠️ Группа с высоким доходом: для неё история помогла меньше всего, точность почти не выросла.

🔍

Как исследовали

Исследователи взяли панель из 845 американцев, которые дважды, с интервалом в три года, проходили опрос по 14 поведенческим искажениям: склонность к риску, предпочтение немедленной выгоды, самоуверенность, ошибки в статистике. Это дало идеальную контрольную точку: как человек сам повторяет свои ответы через время.

Для каждого человека собрали пять вариантов промпта: без информации, с демографией, с чертами характера, с когнитивными баллами, с прошлыми ответами. Модель и вопросы не менялись. Предсказывали ответы второго опроса. Ключевая деталь: в варианте с историей вырезали все вопросы, которые измеряют целевую установку, чтобы модель не списывала.

Результат оказался двойным. Среднее число искажений на человека у всех вариантов выглядело правильным: около 7 из 14, как у людей. Но у портретных вариантов разброс между людьми составлял лишь 53–67% человеческого. А точность по человеку (информированность — доля правильных угадываний в обоих классах за вычетом случайных) составляла 7–12% от повторного опроса самого человека. С историей разброс вернулся к человеческому, а точность выросла до 28%.

Удивительно, что среднее ничего не показывало: по нему все пять вариантов казались одинаково хорошими. Только индивидуальная проверка показала разницу. Для практики вывод: оценивайте синтетических респондентов не по общим цифрам, а по угадыванию конкретных людей.

💡

Адаптации и экстраполяции

🔧 Техника: проверка на скрытом ответе → понимаете, можно ли доверять

Прежде чем применять синтетических респондентов в работе, проверьте их на своих данных. Это моя адаптация логики исследования, в статье такого шаблона нет.

Вот 20 клиентов. У каждого есть история ответов. 
Ответ на вопрос {вопрос} скрыт.
Для каждого клиента отдельно предскажи ответ «да» или «нет».
Не объединяй клиентов, не ищи общих трендов.

Затем сравните с реальными ответами отдельно среди «да» и среди «нет». Если модель почти всегда говорит «да», общая точность будет высокой, но толку мало. В статье именно поэтому использовали метрику информированности (доля верных «да» + доля верных «нет» − 1). Если она около нуля, модель просто следует за самым частым ответом.

🔧 Техника: сравнение с простой базой → убирает иллюзию точности

Добавьте контрольную группу: тот же прогноз без истории, только по демографии. Если разница небольшая, значит, ваши данные не несут нужного сигнала, и персонам доверять нельзя.

🔗

Ресурсы

  • Название: Behavioral History Outperforms Descriptions of the Person for LLM Synthetic Personas
  • Авторы: Khashayar Pourtaheri (University of Washington), Ahmad Zareei
  • Данные: панель Stango & Zinman (2023), 845 взрослых американцев, 14 поведенческих искажений
  • Связанные работы: Park et al. (2024) об агентах на основе интервью, Argyle et al. (2023) о симуляции подгрупп, Bisbee et al. (2024) о сжатии вариации в персонах

📋 Дайджест исследования

Ключевая суть

Парадокс: описание вида «женщина, 34 года, Казань, доход средний» почти ничего не добавляет к предсказанию ответа. Метод позволяет делать синтетических респондентов, которые похожи на конкретного клиента, а не на усреднённого человека. Фишка: не описывай, кто он, а покажи, что он делал раньше. Модель получает его прошлые ответы на смежные вопросы, то есть поведенческую историю. Это лучший сигнал из проверенных, но он даёт лишь около четверти того, что даёт повторный опрос самого человека.

Принцип работы

Исследователи собрали лестницу из пяти ступеней, и каждая добавляет блок к предыдущей:
1. Только вопрос. Выходит ответ «человека вообще».
2. Плюс демография (16 полей). Пользы почти нет.
3. Плюс черты характера. Пользы почти нет.
4. Плюс баллы когнитивных тестов. Чуть лучше.
5. Плюс прошлые ответы человека на другие вопросы. Это единственная ступень, которая реально сдвигает прогноз.
Главное условие: вопросы про тот же предмет из истории убирай. Иначе ты подсунул модели ответ в подсказке, и проверка превращается в фикцию. Каждый вопрос идёт в новом чате, без накопленного контекста. Это как анкета, которую заполняют с чистого листа. Ответы не подстраиваются под предыдущие.

Почему работает

По демографии и характеру модель угадывает стереотип группы. Всем «женщинам 34 лет из Казани» она выдаёт похожий ответ. Поэтому портретные персоны дают сжатую картину: различия между вопросами модель воспроизводит, различия между людьми нет. Их метрика информированности около нуля. По среднему всё выглядит прекрасно, а по конкретным людям нет. Модель хорошо видит паттерны в поведении, а не в анкетных полях. Человек дважды отключал автопродление и жалуется на цену. Модель сама выводит осторожность к предоплате. Это сигнал о человеке, а не о группе. Разброс между респондентами становится почти как у живых людей.

Когда применять

Исследование клиентов → предварительная оценка реакции на новое предложение, особенно когда в базе уже лежат прошлые опросы и анкеты этих же людей. Хорошо для оценки тренда по группе и для первичного отбора идей. НЕ подходит как замена живому опросу: точность низкая даже в лучшем случае. НЕ подходит для кросс-анализа вида «кто склонен к А, тот и к Б»: связи между установками на синтетических данных не подтвердились. Для группы с высоким доходом история помогала меньше всего. Выводы получены на одной американской панели и одной модели, так что на российских клиентах проверяй отдельно.

Мини-рецепт

1. Собери историю: реальные ответы человека из клиентской базы, анкет и опросов. Чем больше смежных вопросов, тем точнее сигнал.
2. Вычисти повторы: убери всё, что измеряет то же самое, что ты предсказываешь. Иначе получишь фикцию.
3. Собери промпт: роль, блок <История_ответов>, блок <Базовые_данные> (по желанию, пользы от них мало), целевой вопрос.
4. Задай жёсткий формат: «да/нет» или шкала 1-5. Так проще сравнивать с реальностью.
5. Один вопрос и один человек на один чат: новый чат каждый раз. Если вопрос ссылается на прошлый ответ, повтори его явно.
6. Проверь на тех, чей исход известен: прогони метод на клиентах, чьё решение уже есть, и сравни. Фразу «не угадывай средний ответ» можно добавить, но в статье её не проверяли. Это моя добавка, смотри на своих данных.

Примеры

[ПЛОХО] : Ты — Ирина, 34 года, Казань, менеджер, доход средний, любит путешествовать. Оформишь годовую подписку за 2 990 ₽?

[ХОРОШО] : Ты отвечаешь так, как ответил бы конкретный человек. Опирайся на его реальные ответы, а не на стереотипы о возрасте и городе. <История_ответов> Анкета при подключении: пользуется 2–3 раза в неделю; подключилась ради скидок на такси и кино; дважды отключала автопродление; платит помесячно. Опрос готовности рекомендовать (NPS): оценка 6 из 10; не нравится: «Цена растёт, а бонусы те же»; музыкой из подписки не пользуется. <Базовые_данные> Женщина, 34 года, Казань. Вопрос: сервис предлагает годовую подписку за 2 990 ₽ вместо помесячной оплаты. Вы оформите годовую? Ответьте «да» или «нет» и одним предложением объясните почему. Не угадывай «средний» ответ.

В хорошем ответе видны ссылки на факты из истории: автопродление, жалоба на цену. У 30 клиентов ответы разойдутся заметно сильнее, чем у одинаковых «Ирин». Это всё равно прогноз, а не факт.
Источник: Behavioral History Outperforms Descriptions of the Person for LLM Synthetic Personas
ArXiv ID: 2610.03998 | Сгенерировано: 2026-10-06 05:00

Проблемы LLM

ПроблемаСутьКак обойти
Персона по описанию даёт «усреднённого человека», а не личностьПишешь в промпте: «Ты — Ирина, 34 года, Казань, менеджер, доход средний». Модель берёт стереотип группы. Все «женщины 34 лет» отвечают похоже. Разница между вопросами видна, разница между людьми почти пропадает. Угадать выбор конкретного человека по такому портрету почти невозможно. Страдают любые задачи с имитацией людей: опросы, тест идей, имитация клиентовВместо портрета дай факты о поведении. Это прошлые ответы человека, его выборы и жалобы. Демографию можно оставить, но она почти ничего не добавит. См. метод ниже

Методы

МетодСуть
История поведения вместо портрета — разнообразные и точные ответы «за конкретного человека»Положи в промпт реальные прошлые ответы человека на смежные вопросы. Скажи модели опираться на них, а не на стереотипы. Шаблон: <История_ответов>{прошлые вопросы и ответы} <Базовые_данные>{возраст, пол, город} Вопрос: {целевой вопрос}. Формат ответа: {да/нет, шкала 1–5}. Почему работает: модель хорошо видит паттерны в поведении. Если человек дважды отключал автопродление и жалуется на цену, она выводит осторожность к предоплате. Это сигнал о человеке, а не о группе. Два правила. Первое: убери из истории вопросы, которые измеряют то же самое, что ты предсказываешь. Иначе проверка превратится в подсказку ответа. Второе: каждого человека и каждый вопрос запускай в новом чате. Тогда ответы не подстраиваются под предыдущие. Если вопрос ссылается на прошлый ответ, повтори его в промпте. Когда да: есть реальные ответы или действия людей из CRM, анкет, опросов. Нужна оценка реакции на новое предложение. Когда нет: истории нет, есть только портрет. Тогда результат близок к случайному. Даже с историей это грубый ориентир, а не замена живому опросу

Тезисы

ТезисКомментарий
Хороший средний результат не доказывает, что модель различает людейДоля «да» и «нет» по всей группе может совпасть с реальной. При этом у каждого человека ответ будет угадан плохо. Модель верно передаёт различия между вопросами, но сглаживает различия между людьми. Средняя цифра это скрывает. Применяй: проверяй имитацию на людях с известным исходом. Сравнивай ответ модели с реальным ответом каждого человека. Смотри ещё, насколько разнообразны ответы внутри группы. Если все ответы почти одинаковые, это тревожный знак
📖 Простыми словами

Behavioral History Outperforms Descriptions of the Person forLLMSynthetic Personas

arXiv: 2610.03998

Когда ты пытаешься заставить LLM притвориться конкретным клиентом через анкету, модель выдаёт полный шлак. Ей скармливают профиль в духе «женщина, 34 года, средний доход», а она генерирует стереотип группы — тупо среднюю температуру по больнице. Нейросети цепляются за ярлыки и выдают плоские штампы, превращая индивидуальность в белый шум. Чтобы модель реально мыслила как живой человек, ей нужны не абстрактные ярлыки, а поведенческая история.

Это как нанимать сотрудника, глядя только на его знак зодиака и строчку «коммуникабельный экстраверт». Формально портрет есть, но по факту — облом. Любой вменяемый босс забьёт на эти сказки и спросит: «Что конкретно ты делал на прошлых проектах?» Только реальные поступки показывают суть, а словесные описания личности — обычный булшит из резюме.

В исследовании метод поведенческой истории всухую разнёс классические описания персон. Добавление черт характера, тестов и демографии даёт информативность, которая стремится к нулю. Что реально работает: скормить модели реальные прошлые ответы человека на другие темы. Когда сеть видит цепочку предыдущих выборов, она перестаёт выдавать картонную куклу и моделирует живого респондента.

Тестировали на синтетических респондентах, но принцип универсален для любого бизнеса. Хочешь быстро проверить через AI, зайдёт ли пользователям годовой тариф за 2 990 рублей? Забудь про идиотские промпты вроде «ты Ирина из Казани, любишь комфорт». Загрузи историю того, как Ирина реально покупала и от чего отказывалась раньше — только так ты получишь правду вместо розовых фантазий маркетолога.

Короче: хватит пичкать нейросети социологической мутью и ждать от них глубоких инсайтов. Факты прошлого бьют любые описания. Если тестируешь гипотезы на синтетических пользователях, скармливай модели логи и реальные действия, а не анкеты из отдела кадров. Иначе примешь фатальное бизнес-решение, поверив сферическому клиенту в вакууме.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с