Когда просишь LLM сыграть роль "чернокожего республиканца" или "молодой мамы-предпринимательницы из регионов", модель не складывает эти признаки вместе. Она выбирает один и отвечает как будто второго и третьего признака не было — при этом даже не тот признак, который реально важнее для темы разговора.
Проверили это на 21 миллионе симулированных ответов. Оказалось: у настоящих людей мнение подгруппы — это почти точная сумма эффектов каждого признака отдельно, и чем больше признаков пересекается, тем сильнее подгруппа отличается от среднего. У моделей всё наоборот: в 75–82% случаев один-единственный признак объясняет ответ лучше, чем сумма двух, а третий признак не добавляет вообще ничего. Хуже того — модель систематически выбрасывает расу и религию, самые мощные реальные предикторы мнений, и вместо них цепляется за пол, возраст, партию — признаки, которые в реальности влияют слабо.
Метод решения проблемы найден не был. Исследователи проверили всё: chain-of-thought с явной просьбой "учти оба признака", смену формата опроса, разные системные роли, температуру — коллапс на один признак не исчезал ни в одном варианте. Это не проблема формулировки промпта, а свойство того, как модель обрабатывает составные роли.
Схема находки
Промпт: "Ты чернокожая женщина-республиканка, 45 лет. Как относишься к вопросу X?"
Модель на самом деле обрабатывает это как:
→ выбирает ОДИН доминирующий признак (не всегда самый релевантный)
→ второй и третий признак почти не влияют на ответ
→ ошибка модели совпадает с ошибкой одного признака, а не суммой всех
Пример применения
Задача: Маркетолог хочет через LLM протестировать реакцию "молодых мам-предпринимательниц из регионов" на рекламный текст нового сервиса доставки, полагая, что модель учтёт и возраст, и профессию, и географию одновременно.
Промпт:
Ты женщина 28 лет, предпринимательница, живёшь в Краснодаре,
воспитываешь двоих детей. Оцени эту рекламу службы доставки:
[текст рекламы]. Как ты отреагируешь и почему?
Результат: Модель выдаст правдоподобный, живо написанный ответ. Но по механике из исследования велика вероятность, что она отвечает как типичная предпринимательница ИЛИ как типичная мама — а не как человек на пересечении этих ролей. Проверить, какой признак "победил", в обычном чате нельзя — ответ выглядит одинаково убедительно в обоих случаях.
Почему это происходит
Модель не интегрирует несколько условий роли одновременно — она сворачивает промпт с несколькими признаками до одного доминирующего, как будто в голове есть только один слот под роль, а не несколько одновременно активных.
Модель хорошо умеет говорить голосом одной чёткой роли — потому что в текстах, на которых она учена, персонажи почти всегда описаны через один явный маркер идентичности за раз ("как типичный предприниматель скажет..."). Комбинировать несколько маркеров одновременно и удерживать вклад каждого — паттерн, которого в достаточном объёме в данных, видимо, не было.
Рычагов управления здесь нет — это ключевой вывод статьи. Ни инструкция "используй оба признака", ни просьба рассуждать по шагам, ни смена формулировки роли не меняют картину. Единственное, что реально можно сделать на практике — не доверять LLM-персонам с 2+ признаками там, где важна точность, и относиться к таким ответам как к портрету одного признака, а не пересечения.
Ограничения
⚠️ Нет решения, только диагноз: статья не даёт способ заставить модель честно комбинировать признаки. Если твоя задача требует смоделировать мнение именно пересечения групп — результат будет ненадёжен независимо от формулировки.
⚠️ Слепота к расе и религии: если аудитория различается именно по этим признакам, модель скорее всего проигнорирует их и подставит вместо них пол, возраст или политические взгляды — даже если тема прямо связана с расой.
⚠️ Проверено только на США: данные — англоязычный опрос Pew (2017–2021). Перенос выводов на другие страны и языки не проверялся.
Как исследовали
Исследователи взяли восемь моделей — от открытых 7B до GPT-4o-mini, GPT-5.5 и Claude Sonnet 5 — и прогнали их через 15 волн реального опроса Pew American Trends Panel, получив 21 миллион симулированных распределений ответов. Сравнивали с настоящими данными по подгруппам минимум из 20 живых респондентов, вплоть до пересечения трёх признаков одновременно ("чернокожие женщины-республиканки" и подобные).
Хитрость теста: если модель реально использует два признака, её ошибка (разница между симуляцией и реальностью) должна быть суммой ошибок по каждому признаку отдельно. Если модель тайно держит только один — ошибка совпадёт с ошибкой именно этого признака. Оказалось, что "ошибка одного признака" объясняет результат лучше суммы в 75–82% случаев — и это не изменилось ни при смене формата опроса, ни при добавлении рассуждений вслух.
Удивило то, что реальные люди показали почти идеальную аддитивность — эффекты признаков у живых людей складываются практически без искажений, а различия между подгруппами растут в 2,5 раза при добавлении признаков. У моделей — ровно противоположный паттерн: чем больше признаков даёшь, тем меньше отдачи от каждого нового.
Ресурсы
Large language models simulate intersectional synthetic identities with a budget of one to two dimensions, Virgile Rennard (MIT), Christos Xypolopoulos (École Polytechnique). Данные: Pew Research Center, American Trends Panel.
