TL;DR
Когда LLM просят сыграть роль человека с определённой демографией (возраст, пол, политические взгляды) и ответить на вопрос из соцопроса, модель не даёт никакого преимущества перед банальной справочной таблицей «что обычно отвечают люди с такими характеристиками». А на вопросах о культурных ценностях — предсказывает заметно хуже этой простой таблицы. При этом модель ведёт себя так, будто демография — это судьба: она резко переоценивает, насколько пол, возраст или политические взгляды определяют мнение человека.
Конкретный пример боли: в реальных данных политические взгляды объясняют всего 1,5% разброса в ответах на вопрос о доверии банкам. А модель, играющая роль человека с такими взглядами, ведёт себя так, будто это объясняет до 67%. Модель хватается за демографический ярлык как за главный предиктор мнения и стирает реальный разброс мнений внутри группы — грубо говоря, вместо живого человека получаешь клише.
Метод в статье — не техника генерации, а диагностика и предупреждение: авторы показывают, что даже более мощная модель эту проблему не решает. Хуже того — на задаче «выбери сегмент аудитории для таргетинга» модель раздувает разницу между сегментами в 2–4 раза, в половине случаев для США и в большинстве кросс-культурных случаев направит команду на неправильный сегмент, а иногда придумывает разницу между сегментами, которой в реальности нет вообще.
Схема находки
ШАГ 1: Промпт — «Ты человек с демографией X (возраст, пол, политика). Как ты ответишь на вопрос?»
ШАГ 2: Модель выдаёт один «типичный» ответ или распределение вероятностей
ШАГ 3: Проверка против реальных людей с теми же характеристиками →
модель НЕ точнее простой таблицы «что обычно отвечают такие люди»
ШАГ 4: Проверка, насколько демография предсказывает ответ →
модель завышает эту связь в разы (стереотипизация)
Это происходило одинаково на четырёх моделях (от Llama 8B до Claude Sonnet) и на двух разных типах опросов (американские социальные установки и ценности 63 стран). Больше модель — не значит меньше стереотипов.
Пример применения
Задача: Маркетолог готовит рекламную кампанию и просит Claude/ChatGPT сыграть роль «типичной аудитории» — например, «мужчина 45 лет, консервативные политические взгляды» — чтобы понять, как эта группа отреагирует на месседж и стоит ли делить кампанию на сегменты.
Наивный промпт (то, что делают сейчас — и что не работает):
Представь, что ты мужчина, 45 лет, консервативных политических взглядов,
из региона Х. Как ты отнесёшься к рекламному сообщению:
«[текст рекламы]»? Оцени по шкале от 1 до 10.
Результат наивного промпта: модель выдаст уверенное конкретное число, которое будет выглядеть убедительно — но на самом деле отражает не мнение реального человека с такими характеристиками, а стереотип модели о том, каким должен быть консерватор 45 лет. Разница между «сегментами» (например, консерваторы vs либералы) в ответах модели будет казаться в 2-4 раза больше, чем в реальной жизни — и решение «бить в этот сегмент, а не в тот» может оказаться ошибочным.
Промпт с поправкой на находку исследования:
Ты моделируешь мнение группы людей с характеристиками: [демография].
Важно: демографические характеристики обычно объясняют лишь небольшую
долю разброса мнений внутри группы — люди с одинаковой демографией
могут думать по-разному.
Вместо одного «типичного» ответа дай:
1. Диапазон возможных реакций внутри этой группы (не одну точку, а разброс)
2. Явно укажи: насколько сильно, по-твоему, демография ЭТОЙ группы
влияет на ответ, а насколько — другие факторы (личный опыт,
ситуативные обстоятельства)
3. Не делай вывод, что вся группа думает одинаково
Вопрос: [твой вопрос]
Результат: модель даст менее «уверенный», но более честный ответ — с разбросом мнений и явным признанием неопределённости. Это не устраняет проблему полностью (исследование показывает, что она системная), но снижает риск принять стереотип за факт.
Почему это происходит
LLM обучена на текстах, где демографические ярлыки часто идут в связке с определёнными взглядами — это создаёт сильную статистическую ассоциацию в тексте, которая не отражает реальный разброс мнений у живых людей. Модель хорошо умеет продолжать паттерн «раз написано консерватор — значит, скажет вот это», но плохо умеет держать в голове, что внутри любой демографической группы реальные люди расходятся во мнениях намного сильнее, чем кажется по стереотипу.
Сильная сторона модели — она отлично играет роль и звучит убедительно. Слабая сторона — убедительность не равна точности: модель заменяет живого человека клише о человеке.
Рычаги управления промптом: - Просьба дать диапазон/разброс мнений, а не единственный ответ → снижает эффект стереотипизации - Явная просьба оценить силу связи демографии с ответом → заставляет модель отрефлексировать, что она делает - Замена «дай один балл» на «дай вероятностное распределение по вариантам ответа» → видно, насколько модель уверена, и легче поймать переоценку
Ограничения
⚠️ Не работает как замена реальным опросам: если решение зависит от точного знания, как отреагирует конкретная демографическая группа (а не общее направление), LLM-симуляция не даёт преимущества перед банальной справочной таблицей «что обычно говорят такие люди» — и на межкультурных вопросах ощутимо хуже.
⚠️ Больше — не безопаснее: переход на более мощную/дорогую модель не решает проблему стереотипизации. Frontier-модели стереотипизируют так же сильно или сильнее, чем маленькие модели.
⚠️ Опасно для сегментации аудитории: если используешь LLM-персоны, чтобы решить, на какой сегмент таргетировать кампанию или продукт — велик риск получить неправильный сегмент или вымышленную разницу там, где её нет.
⚠️ Промпт-техника из этой статьи снижает, но не устраняет проблему — это управление рисками, не решение.
Как исследовали
Команда взяла два независимых источника реальных ответов людей: американский General Social Survey (10 вопросов об установках, 2016–2024) и World Values Survey (16 вопросов о ценностях, 63 страны). Прогнали через четыре модели двух семейств (от Llama 8B до Claude Sonnet) один и тот же протокол: дать модели демографию человека и спросить, как он ответит.
Ключевая деталь дизайна — исследователи не просто сравнили ответы модели с ответами реальных людей, а построили справочную таблицу-бейзлайн: что обычно отвечают реальные люди с такими же характеристиками (плюс более сложные модели — логистическая регрессия, случайный лес). Без этого сравнения число «модель угадала 40% ответов» ничего не значит — может, простая таблица угадывает 45%.
Оказалось, что модель эту таблицу не превосходит, а на межкультурных ценностях уступает ей на 11–22 процентных пункта. И отдельно измерили, насколько демография «объясняет» ответ у реальных людей против модели — и разница оказалась в разы. Удивительный момент: увеличение размера и качества модели проблему не смягчает — это говорит о том, что источник ошибки не в «недообученности» модели, а в самой природе того, как она обобщает демографические стереотипы из текста.
