3,583 papers
arXiv:2607.26348 78 28 июля 2026 г. FREE

Синтетические пользователи: LLM выдумывают связь между демографией и мнением, которой не существует

КЛЮЧЕВАЯ СУТЬ
Политические взгляды объясняют всего 1,5% разброса мнений о доверии банкам — это реальные данные соцопросов. Модель, которую просят сыграть человека с такими взглядами, ведёт себя так, будто эта связь объясняет 67%. Бенчмарк на 4 моделях (от Llama 8B до Claude Sonnet) показывает: LLM-персоны не дают преимущества перед простой таблицей «что обычно отвечают такие люди», а на вопросах о культурных ценностях из 63 стран — заметно хуже. Фишка находки: для модели демография — это судьба, она стирает реальный разброс мнений внутри группы и выдаёт готовый стереотип вместо живого человека.
Адаптировать под запрос

TL;DR

Когда LLM просят сыграть роль человека с определённой демографией (возраст, пол, политические взгляды) и ответить на вопрос из соцопроса, модель не даёт никакого преимущества перед банальной справочной таблицей «что обычно отвечают люди с такими характеристиками». А на вопросах о культурных ценностях — предсказывает заметно хуже этой простой таблицы. При этом модель ведёт себя так, будто демография — это судьба: она резко переоценивает, насколько пол, возраст или политические взгляды определяют мнение человека.

Конкретный пример боли: в реальных данных политические взгляды объясняют всего 1,5% разброса в ответах на вопрос о доверии банкам. А модель, играющая роль человека с такими взглядами, ведёт себя так, будто это объясняет до 67%. Модель хватается за демографический ярлык как за главный предиктор мнения и стирает реальный разброс мнений внутри группы — грубо говоря, вместо живого человека получаешь клише.

Метод в статье — не техника генерации, а диагностика и предупреждение: авторы показывают, что даже более мощная модель эту проблему не решает. Хуже того — на задаче «выбери сегмент аудитории для таргетинга» модель раздувает разницу между сегментами в 2–4 раза, в половине случаев для США и в большинстве кросс-культурных случаев направит команду на неправильный сегмент, а иногда придумывает разницу между сегментами, которой в реальности нет вообще.


📌

Схема находки

ШАГ 1: Промпт — «Ты человек с демографией X (возраст, пол, политика). Как ты ответишь на вопрос?»
ШАГ 2: Модель выдаёт один «типичный» ответ или распределение вероятностей
ШАГ 3: Проверка против реальных людей с теми же характеристиками →
       модель НЕ точнее простой таблицы «что обычно отвечают такие люди»
ШАГ 4: Проверка, насколько демография предсказывает ответ →
       модель завышает эту связь в разы (стереотипизация)

Это происходило одинаково на четырёх моделях (от Llama 8B до Claude Sonnet) и на двух разных типах опросов (американские социальные установки и ценности 63 стран). Больше модель — не значит меньше стереотипов.


🚀

Пример применения

Задача: Маркетолог готовит рекламную кампанию и просит Claude/ChatGPT сыграть роль «типичной аудитории» — например, «мужчина 45 лет, консервативные политические взгляды» — чтобы понять, как эта группа отреагирует на месседж и стоит ли делить кампанию на сегменты.

Наивный промпт (то, что делают сейчас — и что не работает):

Представь, что ты мужчина, 45 лет, консервативных политических взглядов, 
из региона Х. Как ты отнесёшься к рекламному сообщению: 
«[текст рекламы]»? Оцени по шкале от 1 до 10.

Результат наивного промпта: модель выдаст уверенное конкретное число, которое будет выглядеть убедительно — но на самом деле отражает не мнение реального человека с такими характеристиками, а стереотип модели о том, каким должен быть консерватор 45 лет. Разница между «сегментами» (например, консерваторы vs либералы) в ответах модели будет казаться в 2-4 раза больше, чем в реальной жизни — и решение «бить в этот сегмент, а не в тот» может оказаться ошибочным.

Промпт с поправкой на находку исследования:

Ты моделируешь мнение группы людей с характеристиками: [демография].

Важно: демографические характеристики обычно объясняют лишь небольшую 
долю разброса мнений внутри группы — люди с одинаковой демографией 
могут думать по-разному.

Вместо одного «типичного» ответа дай:
1. Диапазон возможных реакций внутри этой группы (не одну точку, а разброс)
2. Явно укажи: насколько сильно, по-твоему, демография ЭТОЙ группы 
   влияет на ответ, а насколько — другие факторы (личный опыт, 
   ситуативные обстоятельства)
3. Не делай вывод, что вся группа думает одинаково

Вопрос: [твой вопрос]

Результат: модель даст менее «уверенный», но более честный ответ — с разбросом мнений и явным признанием неопределённости. Это не устраняет проблему полностью (исследование показывает, что она системная), но снижает риск принять стереотип за факт.


📌

Почему это происходит

LLM обучена на текстах, где демографические ярлыки часто идут в связке с определёнными взглядами — это создаёт сильную статистическую ассоциацию в тексте, которая не отражает реальный разброс мнений у живых людей. Модель хорошо умеет продолжать паттерн «раз написано консерватор — значит, скажет вот это», но плохо умеет держать в голове, что внутри любой демографической группы реальные люди расходятся во мнениях намного сильнее, чем кажется по стереотипу.

Сильная сторона модели — она отлично играет роль и звучит убедительно. Слабая сторона — убедительность не равна точности: модель заменяет живого человека клише о человеке.

Рычаги управления промптом: - Просьба дать диапазон/разброс мнений, а не единственный ответ → снижает эффект стереотипизации - Явная просьба оценить силу связи демографии с ответом → заставляет модель отрефлексировать, что она делает - Замена «дай один балл» на «дай вероятностное распределение по вариантам ответа» → видно, насколько модель уверена, и легче поймать переоценку


⚠️

Ограничения

⚠️ Не работает как замена реальным опросам: если решение зависит от точного знания, как отреагирует конкретная демографическая группа (а не общее направление), LLM-симуляция не даёт преимущества перед банальной справочной таблицей «что обычно говорят такие люди» — и на межкультурных вопросах ощутимо хуже.

⚠️ Больше — не безопаснее: переход на более мощную/дорогую модель не решает проблему стереотипизации. Frontier-модели стереотипизируют так же сильно или сильнее, чем маленькие модели.

⚠️ Опасно для сегментации аудитории: если используешь LLM-персоны, чтобы решить, на какой сегмент таргетировать кампанию или продукт — велик риск получить неправильный сегмент или вымышленную разницу там, где её нет.

⚠️ Промпт-техника из этой статьи снижает, но не устраняет проблему — это управление рисками, не решение.


🔍

Как исследовали

Команда взяла два независимых источника реальных ответов людей: американский General Social Survey (10 вопросов об установках, 2016–2024) и World Values Survey (16 вопросов о ценностях, 63 страны). Прогнали через четыре модели двух семейств (от Llama 8B до Claude Sonnet) один и тот же протокол: дать модели демографию человека и спросить, как он ответит.

Ключевая деталь дизайна — исследователи не просто сравнили ответы модели с ответами реальных людей, а построили справочную таблицу-бейзлайн: что обычно отвечают реальные люди с такими же характеристиками (плюс более сложные модели — логистическая регрессия, случайный лес). Без этого сравнения число «модель угадала 40% ответов» ничего не значит — может, простая таблица угадывает 45%.

Оказалось, что модель эту таблицу не превосходит, а на межкультурных ценностях уступает ей на 11–22 процентных пункта. И отдельно измерили, насколько демография «объясняет» ответ у реальных людей против модели — и разница оказалась в разы. Удивительный момент: увеличение размера и качества модели проблему не смягчает — это говорит о том, что источник ошибки не в «недообученности» модели, а в самой природе того, как она обобщает демографические стереотипы из текста.


📋 Дайджест исследования

Ключевая суть

Политические взгляды объясняют всего 1,5% разброса мнений о доверии банкам — это реальные данные соцопросов. Модель, которую просят сыграть человека с такими взглядами, ведёт себя так, будто эта связь объясняет 67%. Бенчмарк на 4 моделях (от Llama 8B до Claude Sonnet) показывает: LLM-персоны не дают преимущества перед простой таблицей «что обычно отвечают такие люди», а на вопросах о культурных ценностях из 63 стран — заметно хуже. Фишка находки: для модели демография — это судьба, она стирает реальный разброс мнений внутри группы и выдаёт готовый стереотип вместо живого человека.

Принцип работы

Модель не моделирует человека — она достаёт готовый ярлык из текста, где слово «консерватор» шло рядом с определёнными фразами. Убедительность ответа не равна его точности — модель звучит уверенно, но подменяет живого человека с его противоречиями усреднённым клише о нём.

Почему работает

LLM учится на текстах, где демографический ярлык часто идёт в связке с конкретным мнением — это сильная связь в словах, но не в головах реальных людей. В опросе про доверие банкам взгляды реально объясняют 1,5% разброса ответов, а модель раздувает это до 67%. При выборе сегмента для рекламы разница между группами в ответах модели больше в 2-4 раза, чем в реальности. Жесть — более мощная и дорогая модель Claude Sonnet стереотипизирует не меньше, а иногда даже сильнее маленькой Llama 8B.

Когда применять

Маркетинг и продуктовые исследования → для прикидки общего направления реакции аудитории на месседж, когда точная цифра не критична. НЕ подходит для выбора сегмента таргетинга по демографии и для замены реальных опросов — риск получить выдуманную разницу между группами там, где её нет.

Мини-рецепт

1. Попроси разброс, а не число: вместо "оцени по шкале 1-10" проси диапазон возможных реакций внутри группы.
2. Заставь модель отрефлексировать: явно спроси, насколько по её мнению демография объясняет ответ, а насколько — личный опыт и обстоятельства.
3. Замени балл на распределение: проси вероятности по вариантам ответа, а не одну итоговую цифру — так видна неуверенность модели.
4. Проверь на реальных данных: перед тем как делить бюджет по сегментам, сверь разницу между группами хотя бы с одним реальным опросом.

Примеры

[ПЛОХО] : Представь, что ты мужчина, 45 лет, консервативных политических взглядов. Оцени рекламу по шкале от 1 до 10.
[ХОРОШО] : Ты моделируешь мнение группы: мужчины 45 лет, консервативные взгляды. Помни: демография обычно объясняет малую долю разброса мнений внутри группы. Дай диапазон возможных реакций (не одну цифру), укажи насколько сильно по-твоему демография влияет на ответ этой группы, а насколько — другие факторы. Вопрос: как группа отнесётся к рекламе [текст]?
Источник: When Synthetic Users Fail: A Cross-Domain Benchmark of LLM-Simulated Human Survey Responses
ArXiv ID: 2607.26348 | Сгенерировано: 2026-07-30 04:27

Проблемы LLM

ПроблемаСутьКак обойти
Модель раздувает влияние демографии на мнение персоныПросишь модель сыграть роль человека с демографией (возраст, пол, политические взгляды) и ответить на вопрос. Модель ведёт себя так, будто демография — почти единственная причина мнения. В реальности демография объясняет лишь малую долю разброса мнений людей. Модель стирает разброс мнений внутри группы и выдаёт клише вместо живого человекаПроси не один ответ, а диапазон возможных реакций внутри группы. Явно проси оценить, насколько сильно демография влияет на ответ, а насколько — другие факторы
LLM-персона не точнее простой справочной таблицыМодель, играющая роль человека с заданными характеристиками, предсказывает его мнение не лучше обычной статистики "что чаще отвечают такие люди". На межкультурных вопросах о ценностях — предсказывает заметно хуже. Проблема не решается переходом на более мощную модельИспользуй LLM-персону только для генерации гипотез и черновых формулировок. Для решений, которые зависят от точного знания реакции группы, опирайся на реальные данные, а не на симуляцию

Методы

МетодСуть
Запрос разброса мнений вместо одной оценкиВместо "дай ответ от имени персоны с баллом" проси: 1) диапазон возможных реакций внутри группы, 2) явную оценку — насколько демография объясняет ответ, а насколько личный опыт и ситуация, 3) вероятностное распределение по вариантам ответа, а не одну точку. Работает потому что заставляет модель отрефлексировать неопределённость вместо выдачи уверенного стереотипа. Применяй: при моделировании мнений групп, сегментации аудитории, персонах в маркетинге. Не работает: как полная замена реальных данных — снижает риск, но не убирает искажение

Тезисы

ТезисКомментарий
Размер модели не снижает стереотипизацию персонПереход на более мощную и дорогую модель не уменьшает переоценку связи демографии с мнением. Причина не в размере модели, а в самой природе обучения на тексте: связь ярлыка и взгляда зашита в статистике текстов, а не исправляется масштабом. Применяй: не жди, что дорогая модель сама решит проблему стереотипов в ролевой игре — нужна явная инструкция про разброс мнений
📖 Простыми словами

When Synthetic Users Fail: A Cross-Domain Benchmark ofLLM-Simulated Human Survey Responses

arXiv: 2607.26348

Идея заменить живых людей на синтетических пользователей из ChatGPT кажется гениальной, пока не посмотришь на цифры. На бумаге всё красиво: просишь модель прикинуться «консервативным дедом 60 лет» или «либеральной студенткой», и она якобы выдает их мнение. На деле же LLM работают не как психологи, а как стереотипные машины. Они не понимают нюансов человеческого опыта, а просто вываливают усредненный культурный код, который зашит в их веса. В итоге модель не моделирует человека, она моделирует наше представление о том, как должен отвечать такой человек, и в этом кроется главная ловушка.

Это как если бы ты спросил у актера из плохого сериала, что думает настоящий сталевар. Актер нацепит каску, измажет лицо сажей и начнет выдавать заученные фразы про тяжелый труд и заводскую проходную. Формально образ соблюден, но к реальности это не имеет никакого отношения. Модель ведет себя так, будто демография — это приговор: если ты консерватор, ты обязан ненавидеть это и обожать то. В жизни люди куда сложнее и противоречивее, а нейронка превращает их в плоских картонных персонажей.

Исследователи проверили этот метод на прочность и выяснили, что 100% хваленой «человечности» AI — это пшик. Когда модель просят предсказать ответ конкретной группы, она справляется либо так же, либо ощутимо хуже, чем обычная статистическая таблица из учебника социологии. В вопросах культурных ценностей нейронки вообще позорно лажают, проигрывая простейшим алгоритмам. Оказалось, что LLM дико переоценивают влияние демографии на мнение человека, игнорируя тот факт, что люди внутри одной группы могут думать совершенно по-разному.

Этот принцип универсален: неважно, тестируешь ты рекламный слоган, интерфейс приложения или политический лозунг. Если ты скармливаешь нейронке промпт в духе «представь, что ты домохозяйка из Алабамы», ты получаешь ответ не от домохозяйки, а от галлюцинирующего карикатуриста. Это работает и в маркетинге, и в продуктовой аналитике, и в социологии — везде, где бизнес пытается сэкономить на реальных кастдевах и фокус-группах, подсовывая вместо них «умных» ботов.

Короче: использовать LLM как замену соцопросам — это полный провал и самообман. Модель не дает инсайтов, она просто подтверждает твои собственные стереотипы, упаковывая их в вежливый текст. Если хочешь знать, что купят люди, иди и спрашивай людей. А если продолжишь играть в «синтетических пользователей», рискуешь построить стратегию на основе галлюцинаций об усредненном человеке, которого в природе не существует. Кто верит ботам на слово — сливает бюджеты, остальные ищут реальные данные.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с