Персона-промптинг (когда в начало промпта добавляют описание персонажа — пол, возраст, взгляды) должен помогать LLM предсказывать, как ответит на вопрос конкретный тип человека. Механика простая: без персоны модель выдаёт "усреднённый", самый вероятный ответ. Персона должна сдвигать этот ответ в сторону, характерную для конкретного человека — но сдвигать есть смысл только если у реальных людей ответы действительно разные.
Главная проблема: если вопрос простой и почти все отвечают одинаково — например "поддерживаете ли вы помощь пострадавшим от катастроф" — добавление персоны не помогает, а вредит. Модель начинает выдумывать особое мнение персонажа вместо того, чтобы дать правильный для большинства ответ. Персона превращается в шум, который сбивает модель с верного пути. И наоборот: если мнения людей реально расходятся (например, отношение к повышению налогов), персона нужна — без неё модель просто выдаст "средний" ответ, который никому конкретно не соответствует.
Метод решения — два шага. Шаг 1: перед тем как строить персону, оцени, насколько по этому вопросу расходятся мнения людей — если разброс маленький, персона не нужна. Шаг 2: если разброс большой — не бери стандартный набор атрибутов (возраст-пол-доход), а попроси саму модель подобрать атрибуты, специфичные именно для этого вопроса.
Схема метода
ШАГ 1: Оцени разброс мнений по вопросу → "высокий" или "низкий" (один запрос)
ШАГ 2: Если разброс высокий — попроси LLM выбрать 5 релевантных атрибутов именно под этот вопрос → список атрибутов (отдельный запрос или тот же диалог)
ШАГ 3: Создай персону(ы) с этими атрибутами → предсказание ответа
Все шаги можно сделать в одном диалоге последовательными запросами.
Пример применения
Задача: Маркетолог хочет через ChatGPT понять, как разные сегменты аудитории отреагируют на повышение цены подписки Яндекс Плюс с добавлением новых сервисов.
Промпт:
Вопрос: "Готовы ли вы платить больше за подписку Яндекс Плюс,
если в неё добавят больше сервисов (музыка, доставка, кино)?"
Шаг 1. Оцени: мнения разных людей по этому вопросу скорее совпадают
или сильно расходятся? Объясни кратко почему.
Шаг 2. Если мнения расходятся — не используй стандартный набор
(возраст, пол, доход). Подумай, какие 5 характеристик человека
реально влияют на ЭТОТ конкретный ответ (например: как часто
использует сервисы экосистемы, есть ли альтернативные подписки,
чувствительность к цене).
Шаг 3. Создай 4 персоны с разными значениями этих атрибутов
и предскажи ответ каждой на исходный вопрос. Обоснуй ответ
через атрибуты персоны.
Результат: Модель сначала даст вывод про разброс мнений (вероятно "высокий" — вопрос про цену обычно вызывает разные реакции). Затем предложит атрибуты, специфичные для темы подписок, а не общую демографию. В финале — 4 персоны с разными предсказанными ответами и обоснованием через их характеристики, а не шаблонное "40 лет, женщина, доход средний".
Почему это работает
LLM без персоны склонна выдавать самый вероятный, "усреднённый" ответ — это следствие того, как модель обучена: она концентрирует вероятность на одном "лучшем" ответе, а не воспроизводит весь спектр реальных мнений. Это хорошо, когда мнения людей и так почти совпадают — дефолтный ответ модели уже правильный.
Но когда мнения людей реально расходятся, этот усреднённый ответ никому конкретно не подходит. Здесь персона работает как руль: релевантные атрибуты дают модели зацепку, куда сдвинуть ответ от дефолтного значения.
Проблема в том, что нерелевантные атрибуты (цвет любимой машины, имя персонажа) — это просто шум. Метод обходит слабость модели, заставляя её сначала подумать, какие именно характеристики связаны с конкретным вопросом, а не навешивать стандартный набор демографии на все случаи.
Рычаги управления: - Число атрибутов персоны (в исследовании — 5) → для простых бытовых вопросов можно меньше, для сложных социальных — больше - Формулировка "выбери релевантные атрибуты именно для этого вопроса" → замени шаблонную демографию под конкретную задачу - Оценку вариации мнений можно заменить на свой здравый смысл: "это спорная тема или все примерно согласны?"
Шаблон промпта
Вопрос для анализа: {вопрос}
Шаг 1. Оцени: мнения разных людей по этому вопросу скорее
совпадают или сильно расходятся? Ответь "высокий разброс"
или "низкий разброс" и объясни почему в 2-3 предложениях.
Шаг 2. Если разброс высокий: не используй стандартный набор
атрибутов (возраст, пол, доход). Подумай, какие {число}
характеристик человека реально влияют на ответ именно на
ЭТОТ вопрос, и предложи их.
Шаг 3. Создай {количество_персон} персон с конкретными
значениями этих атрибутов и предскажи ответ каждой на вопрос:
{вопрос}. Обоснуй каждый ответ через атрибуты персоны.
Подставь: {вопрос} — тема, которую изучаешь; {число} — количество атрибутов персоны (по умолчанию 5); {количество_персон} — сколько разных типов людей нужно смоделировать.
🚀 Быстрый старт — вставь в чат:
Вот шаблон для симуляции мнений разных людей по вопросу.
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит про тему вопроса и сколько персон нужно — потому что без этого не может оценить разброс мнений и подобрать релевантные атрибуты.
Ограничения
⚠️ Вредит на "согласных" вопросах: если по теме почти все отвечают одинаково, персона не улучшает, а портит предсказание — модель отклоняется от правильного усреднённого ответа в сторону выдуманной особенности персонажа.
⚠️ Нестабильность выбора атрибутов: при повторных запросах LLM может выбирать разные атрибуты — в исследовании усредняли результат по 30-100 запускам. В обычном чате один запрос может дать неидеальный набор — стоит попросить модель предложить несколько вариантов и выбрать самый логичный.
⚠️ Оценка разброса мнений — на глаз: без реальных данных опроса читатель оценивает разброс мнений интуитивно, через здравый смысл модели, а не через точные метрики. Для острых, поляризующих тем это работает нормально, для нюансированных вопросов — менее надёжно.
Как исследовали
Исследователи взяли данные четырёх крупных социологических опросов — World Value Survey, американский и немецкий General Social Survey — с тысячами реальных ответов на десятки вопросов. Для каждого вопроса посчитали разброс мнений двумя способами: энтропия для вопросов "да/нет" и специальная метрика dissention для шкал типа "согласен — не согласен". Затем прогнали 6 разных LLM через 20 задач предсказания на каждом опросе, сравнивая статистические способы выбора атрибутов персоны (корреляция, важность признаков) с LLM-based способами (модель сама выбирает или оценивает важность атрибутов).
Любопытная деталь: LLM-based методы выбора атрибутов оказались нестабильными — порядок вопросов в промпте влиял на выбор, поэтому каждый эксперимент запускали 30-100 раз и брали самые частые атрибуты. Это подтверждает, что модель "теряет фокус" при большом списке вариантов в одном промпте — практический сигнал, что длинные списки для выбора лучше разбивать на части.
Ресурсы
When Persona Attributes Improve Population Alignment in Large Language Models — Leon Fröhling, Jens Rupprecht, Markus Strohmaier, Claudia Wagner. GESIS – Leibniz Institute for the Social Sciences, University of Mannheim, Complexity Science Hub, RWTH Aachen University.
