3,583 papers
arXiv:2608.15871 76 16 авг. 2026 г. FREE

Демографическая симуляция аудитории: как LLM восстанавливает мнение группы по профилям людей

КЛЮЧЕВАЯ СУТЬ
3880 реальных профилей избирателей — и модель восстановила голосование целой группы, хотя статистику выборов она никогда не запоминала. Метод позволяет предсказать реакцию сегмента аудитории на продукт или сообщение без реального опроса — просто через набор описаний людей. Фишка в том, что модель не выбирает один ответ за персону, а отдаёт вероятности по всем вариантам сразу — а потом эти вероятности усредняются по десяткам разных профилей. Мягкое усреднение ответов гасит шум одной персоны, а связь демографии и мнения остаётся на виду.
Адаптировать под запрос

TL;DR

Если попросить модель не выбрать один ответ, а дать вероятность каждого варианта для конкретного человека (пол, возраст, доход, регион, отношение к теме), а потом усреднить эти вероятности по сотням таких "персон" — итоговый прогноз для целой группы получается неожиданно точным. Модель как бы работает сжатым слепком общества: она не помнит статистику голосований, но впитала из текстов интернета связи между социальным профилем и взглядами.

Проблема в деталях: если спросить у модели прямой ответ ("за кого проголосует этот человек?"), маленькие модели категорично режут — говорят "точно не пойдёт голосовать" (вероятность 0%) и из-за этого вообще не дают мнения о предпочтениях. Крупные модели никогда не ставят абсолютный ноль — они держат неопределённость, и именно это делает их точнее на уровне группы.

Метод — soft voting: для каждой персоны берём не финальный выбор, а полное распределение вероятностей по всем вариантам, умножаем на вероятность "участия" (например, придёт ли человек голосовать вообще), и усредняем по множеству разных профилей. Шум на уровне одного "синтетического человека" гасится, а системная закономерность (связь демографии и предпочтений) остаётся видимой на уровне группы.


🔬

Схема метода

ШАГ 1: Описать персону текстом (пол, возраст, регион, доход, отношение к теме) → текстовый промпт-персона
ШАГ 2: Попросить модель вернуть вероятности по ВСЕМ вариантам ответа, а не один выбор → распределение (%)
ШАГ 3: Повторить с десятками-сотнями разных персон, КАЖДЫЙ запрос отдельный, без памяти о предыдущих → набор распределений
ШАГ 4: Умножить вероятность "участия/интереса" на вероятность каждого варианта, сложить и нормализовать по всем персонам → итоговый прогноз группы

Шаг 1-2 можно объединить в один запрос. Шаг 3-4 — либо десятки отдельных запросов, либо один промпт с просьбой сгенерировать таблицу сразу по N персонам.


🚀

Пример применения

Задача: Маркетолог мобильного оператора хочет понять, как разные сегменты аудитории отнесутся к новому тарифу с урезанным интернетом, но без звонков в колл-центр и без реального опроса.

Промпт:

Ты — участник опроса. Вот твой профиль:

Женщина, 34 года, высшее образование, живёт в Краснодаре, 
работает по найму, доход семьи 60-80 тыс. руб/мес, 
среднее отношение к своему уровню жизни, интересуется новостями умеренно.

Тебе предлагают новый тариф мобильной связи: безлимитный интернет, 
но без включённых минут разговора, стоимость 450 руб/мес.

Оцени в процентах вероятность каждого твоего действия:
- Подключу тариф сразу: __%
- Рассмотрю, но не сразу: __%
- Не буду подключать: __%

Верни только числа, сумма = 100%.

Повторить с 15-20 разными профилями (студент, пенсионер, предприниматель, мама в декрете и т.д.), затем попросить модель свести все ответы в таблицу и посчитать средневзвешенный процент.

Результат: Таблица с вероятностями по каждому сегменту + агрегированная оценка, какая доля аудитории вероятно откликнется на тариф. Это не заменяет реальный опрос, но даёт быструю прикидку "куда дует ветер" до того, как тратить деньги на исследование.


🧠

Почему это работает

Если спросить модель напрямую "как поступит этот человек" — ответ шумный: модель выбирает один "типичный" вариант, который может не отражать реальный разброс мнений в этой группе.

Модель хорошо умеет другое — она хранит статистические связи между социальными характеристиками и взглядами, потому что видела миллионы текстов, где такие связи проявлялись. Это её сильная сторона — не точность на одном человеке, а чувство закономерности на уровне популяции.

Метод обходит слабость, заставляя модель каждый раз выдавать не решение, а распределение вероятностей, и потом усредняя по множеству профилей. Шум одного ответа гасится, а системная закономерность (связь дохода/возраста/региона с предпочтением) проявляется в среднем.

Рычаги управления: - Количество персон → больше персон = точнее прогноз группы, но больше запросов - Детализация профиля → добавление лишних деталей (не только демография, но и отношение к теме) улучшает точность, но рискует зашумить, если деталей слишком много - Формат вывода (вероятности, а не выбор) → без этого метод не работает — если попросить модель выбрать один ответ, эффект усреднения пропадает - Модель → крупные модели (например, топовые версии) держат неопределённость лучше, мелкие/бюджетные скатываются к категоричным "0% или 100%" и теряют нюанс


📋

Шаблон промпта

Ты — участник опроса. Вот твой профиль:

{демографическое описание: пол, возраст, регион, доход, образование, 
отношение к теме исследования}

Вопрос: {вопрос про продукт/сообщение/решение}

Оцени в процентах вероятность каждого варианта:
- {вариант 1}: __%
- {вариант 2}: __%
- {вариант 3}: __%

Сумма должна быть 100%. Верни только цифры.

После получения ответов от нескольких персон — отдельным запросом:

Вот ответы {N} персон на вопрос про {тема}: {вставить все ответы}.
Посчитай средневзвешенный процент по каждому варианту 
и укажи, какие сегменты (по возрасту/доходу/региону) 
дают наиболее отличающиеся ответы.

🚀 Быстрый старт — вставь в чат:

Вот шаблон демографической симуляции аудитории. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какие сегменты аудитории тебе важны и какой вопрос ты хочешь протестировать — потому что без чётких персон и чёткого вопроса метод не даёт разброса вероятностей, а скатывается к одному "усреднённому" ответу.


⚠️

Ограничения

⚠️ Не работает для одного человека: прогноз надёжен только на уровне группы (десятки-сотни персон). Ответ для одной конкретной персоны шумный и может быть неточным.

⚠️ Слабые модели теряют нюанс: дешёвые/маленькие модели часто категорично ставят 0% там, где нужна неопределённость — из-за этого весь прогноз смещается к "усреднённому мнению", а не отражает реальный разброс.

⚠️ Стереотипы вместо реальных мнений: модель воспроизводит то, что она "выучила" о группе из текстов интернета — если группа слабо представлена в обучающих данных (редкие профессии, маленькие города, нестандартные взгляды), прогноз будет искажён общими стереотипами.

⚠️ Хуже работает не на английском: для тем и языков, где в интернете меньше текстов (не английский, узкая тема), связи между демографией и мнением восстанавливаются менее точно.


🔗

Ресурсы

Large Language Models as Implicit Sociological Models: Reconstructing Voting Behaviour from Sociodemographic Profiles. Roman Neruda, Martin Bakoš, Josef Šlerka, Vít Tuček, Petra Vidnerová, Gabriela Kadlecová. Institute of Computer Science, Czech Academy of Sciences; Faculty of Arts, Charles University, Prague.


📋 Дайджест исследования

Ключевая суть

3880 реальных профилей избирателей — и модель восстановила голосование целой группы, хотя статистику выборов она никогда не запоминала. Метод позволяет предсказать реакцию сегмента аудитории на продукт или сообщение без реального опроса — просто через набор описаний людей. Фишка в том, что модель не выбирает один ответ за персону, а отдаёт вероятности по всем вариантам сразу — а потом эти вероятности усредняются по десяткам разных профилей. Мягкое усреднение ответов гасит шум одной персоны, а связь демографии и мнения остаётся на виду.

Принцип работы

Спросишь модель "за кого проголосует этот пенсионер" — получишь один категоричный ответ, часто с уверенностью 100%. Спросишь "с какой вероятностью каждый вариант" — получишь честную раскладку в процентах. Правило: усредняй не решения модели, а её вероятности по десяткам синтетических персон. Один ответ — это шум. Сотни усреднённых распределений — это закономерность.

Почему работает

Модель за время обучения впитала миллионы текстов, где демография и взгляды были связаны — доход, возраст, регион давно коррелируют с предпочтениями в интернет-текстах. Она не помнит статистику выборов, но помнит паттерн: такие люди чаще думают так. Крупные модели держат неопределённость дольше — почти никогда не ставят абсолютный ноль. Маленькие модели режут по живому: "точно не пойдёт голосовать" = 0%, и вся картина смещается в одну сторону. Отсюда разница в точности между топовыми моделями и бюджетными.

Когда применять

Маркетинговые опросы и тесты сообщений → быстрая прикидка реакции сегментов на новый тариф, продукт или формулировку, особенно когда нет времени и денег на реальный опрос. Не подходит для прогноза поведения одного конкретного человека — только для группы из десятков-сотен профилей.

Мини-рецепт

1. Собери профили: 15-20 персон с демографией — пол, возраст, доход, регион, отношение к теме
2. Спроси вероятности: для каждой персоны — процент по каждому варианту ответа, сумма строго 100%
3. Запрети выбор: не позволяй модели выбирать один ответ — только распределение по всем вариантам
4. Усредни результат: попроси модель свести все ответы в таблицу и посчитать средневзвешенный процент по группе

Примеры

[ПЛОХО] : Как проголосует безработный мужчина 45 лет из Ижевска?
[ХОРОШО] : Оцени в процентах вероятность каждого варианта для профиля: мужчина, 45 лет, безработный, живёт в Ижевске, среднее отношение к своему уровню жизни. Варианты: за кандидата А __%, за кандидата Б __%, не пойдёт голосовать __%. Сумма = 100%, верни только цифры.
Источник: Large Language Models as Implicit Sociological Models: Reconstructing Voting Behaviour from Sociodemographic Profiles
ArXiv ID: 2608.15871 | Сгенерировано: 2026-08-18 05:25

Проблемы LLM

ПроблемаСутьКак обойти
Прямой вопрос даёт один ответ вместо разброса мненийПросишь модель выбрать один вариант для конкретного профиля. Получаешь один типичный ответ. Реальный разброс мнений группы теряется. Плохо для любой задачи, где нужна оценка распределения реакций, а не единый вердиктПроси не выбор, а вероятность каждого варианта в процентах. Повтори запрос для десятков разных профилей и усредни результаты
Маленькие модели ставят 0% или 100% вместо реальной неопределённостиПросишь оценить вероятность числом. Небольшая модель отвечает категорично — либо 0%, либо 100%, без промежуточных значений. Нюанс пропадает, итоговое усреднение искажается. Проблема всплывает в любой задаче с числовой самооценкой уверенностиИспользуй крупную/топовую модель для таких оценок. Она реже даёт абсолютные 0 или 100 и лучше держит промежуточную неопределённость

Методы

МетодСуть
Персона + вероятностное распределение + усреднение (soft voting)Опиши персону текстом: пол, возраст, доход, регион, отношение к теме. Попроси модель вернуть не финальный выбор, а вероятность % по каждому варианту ответа. Повтори для десятков-сотен разных профилей — каждый запрос отдельно, без памяти о предыдущих. Умножь вероятность "участия/интереса" на вероятность каждого варианта и усредни по всем профилям. Работает: нужен прогноз реакции группы или сегмента (маркетинг, тест сообщения, опрос аудитории). Не работает: нужен точный прогноз для одного конкретного человека — тут ответ шумный
📖 Простыми словами

LargeLanguageModelsas Implicit SociologicalModels: Reconstructing Voting Behaviour from Sociodemographic Profiles

arXiv: 2608.15871

Современные нейросети — это не просто генераторы текста, а скрытые социологические модели, которые впитали в себя структуру общества через терабайты прочитанных книг и новостей. Суть в том, что LLM не хранит сухую статистику выборов или опросов, она понимает глубинные связи между тем, кто ты есть (пол, доход, место жительства), и тем, что ты думаешь. Если правильно «постучать» по модели, она выдает коллективное мнение группы точнее, чем классические методы, потому что видит мир как сложную сеть зависимостей, а не как набор разрозненных цифр.

Это как если бы ты пришел к старому бармену, который сорок лет слушал разговоры за стойкой, и спросил: «Слушай, а что думают мужики с завода о новом законе про рыбалку?». Бармен не лезет в Excel, он просто синтезирует тысячи услышанных жалоб и споров в один точный прогноз. Он не знает каждого рабочего лично, но он знает «тип», и этого достаточно, чтобы предсказать реакцию всей толпы.

Главный финт здесь в методе: нельзя просто спросить «как проголосует этот парень?», потому что модель выдаст один случайный ответ и промахнется. Вместо этого исследователи используют вероятностное распределение для сотен виртуальных «персон». Мы берем конкретный профиль — например, женщина, 45 лет, средний доход, живет в пригороде — и просим модель оценить шансы каждого варианта ответа. Когда ты усредняешь эти вероятности по огромной выборке таких цифровых двойников, шум исчезает, и проявляется реальная картина мнений, которая пугающе совпадает с настоящими социологическими опросами.

Тестировали это на политических голосованиях, но принцип универсален для любого бизнеса или маркетинга. Тебе больше не нужно тратить миллионы на фокус-группы, чтобы понять, взлетит ли новый тариф или как люди отреагируют на ребрендинг. Модель работает как бесконечный полигон для тестов, где можно прогнать любую идею через тысячи демографических срезов за копейки. Это переход от гадания на кофейной гуще к алгоритмической социологии, где данные из интернета превращаются в предсказательную силу.

Короче: LLM — это гигантское зеркало общества, которое знает о наших предпочтениях больше, чем мы сами готовы признать. Прогнозирование через вероятности персон работает в разы лучше прямых вопросов, потому что убирает случайные галлюцинации и оставляет чистую суть. Если тебе нужно понять, что думает рынок, перестань спрашивать «мнение ИИ» — начни использовать его как симулятор реальности, и ты получишь ответы, за которые раньше платили штату аналитиков.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с