TL;DR
ESPP (Evidence-Grounded, Social-Weighted Persona Panel) — метод оценки любого контента через несколько ролей-персон с закреплённой историей, которые сначала оценивают продукт по отдельности, потом обмениваются мнениями по строгому правилу, а в конце их оценки складываются во взвешенный итог. Суть не в том, что LLM «играет роли» — это все умеют, — а в том, как эти роли закрепляются перед оценкой и как им разрешено менять мнение.
Главная находка исследования неожиданная: если просто попросить LLM оценить что-то от имени пяти разных «типов пользователей», результат почти не отличается от одного мнения — модель просто подгоняет обоснование под лейбл персоны ("ты скептик" → любую оценку легко объяснить скептицизмом). Даже если запустить пять независимых проходов и усреднить — выигрыш крошечный. Настоящий прирост точности даёт только одно: если перед оценкой заставить персону ответить на конкретные вопросы о своём опыте, и потом требовать, чтобы оценка не противоречила этим ответам.
ESPP решает это в три шага: (1) закрепить каждую персону конкретными ответами на вопросы — это её "память", а не просто ярлык характера; (2) дать персонам увидеть чужие оценки и изменить своё мнение — но только если аргумент близок по позиции И касается темы, которая лично её волнует; (3) собрать финальный балл не простым средним, а с весами по экспертности и релевантности каждой персоны к задаче.
Схема метода
ШАГ 0 (в промпте): Создать 5 персон — разные черты характера (открытость,
тревожность, склонность к риску и т.д.) + демография + профиль опыта.
Для каждой персоны заранее сгенерировать 3-5 вопросов о её опыте с
похожими продуктами и её же ответы → это "память" персоны.
ШАГ 1 (тот же или следующий промпт): Каждая персона независимо оценивает
продукт по нескольким критериям, ссылаясь на СВОИ ответы из Шага 0
→ оценка + обоснование от каждой персоны.
ШАГ 2 (следующий промпт): Персоны видят все чужие оценки и обоснования.
Меняют своё мнение ТОЛЬКО если:
(а) чужая оценка близка к своей (не кардинально другая)
(б) аргумент касается именно того, что волнует эту персону
→ пересмотренные оценки.
ШАГ 3 (тот же промпт): Пересмотренные оценки складываются с весами:
персоны с большей "экспертностью" в теме и большей "похожестью" на
целевую аудиторию весят чуть больше → финальный балл + разброс мнений.
Все 4 шага можно провести в одном длинном чате последовательными сообщениями — без кода и API.
Пример применения
Задача: Стартап запускает сервис доставки готовых обедов в офисы по подписке. Перед запуском рекламы нужно проверить текст лендинга — не полагаясь на своё мнение и не тратя деньги на фокус-группу.
Промпт:
Создай 5 персон-читателей для оценки текста лендинга ниже. Для каждой
задай: возраст, профессию, отношение к риску, уровень занятости.
Затем для каждой персоны придумай 3 вопроса про их прошлый опыт с
подписками на еду/доставку и дай ответы от лица персоны — это будет
их "память", на которую они должны опираться при оценке.
После этого каждая персона должна оценить текст лендинга (ниже) по
5 критериям: понятность, доверие к бренду, удобство подписки,
ощущение контроля (можно ли легко отменить), прозрачность условий.
Шкала 1-5 с коротким объяснением, ссылаясь на свою "память".
Затем покажи каждой персоне оценки и объяснения остальных. Пусть
персона поменяет своё мнение ТОЛЬКО если чужой аргумент касается
темы, которая лично её волнует (судя по её характеру и ответам),
и оценка соседа не сильно отличается от её собственной. Иначе
пусть остаётся при своём.
В конце сведи итоговую оценку: посчитай средний балл по каждому
критерию, но отметь отдельно, где персоны сошлись, а где остались
разногласия.
Текст лендинга: {текст}
Результат: Модель выдаст профили 5 персон с их "историей", затем 5 независимых оценок с обоснованиями, затем раунд, где видно кто поменял мнение и почему (или не поменял), и в конце — сводную таблицу баллов с указанием, по каким пунктам мнения разошлись сильнее всего (например: все согласны, что текст понятен, но расходятся насчёт доверия к новому бренду).
Почему это работает
LLM, которую просто просят "будь скептичным пользователем", не имеет реальных ограничений — она может подогнать любое обоснование под ярлык "скептик", потому что ярлык почти не сужает пространство возможных ответов.
Зато LLM хорошо умеет держаться уже сказанного в диалоге — если персона до оценки успела "ответить" на конкретные вопросы про свой опыт, эти ответы становятся якорем. Модели сложнее написать оценку, которая противоречит уже зафиксированным фактам, чем написать оценку, противоречащую абстрактному ярлыку личности.
Метод использует это через закрепление историей (Шаг 0-1) и через избирательное влияние на Шаге 2: персона меняет мнение не от любого аргумента, а только от того, что попадает в её собственную зону интересов. Это не даёт дискуссии скатиться либо в единодушие (все сходятся к среднему), либо в хаос (никто никого не слушает).
Рычаги управления: - Число персон (в оригинале 5) → уменьши до 3 для быстрой проверки, увеличь до 7-8 для более тонкой картины разногласий - Правило "меняй мнение, только если аргумент по твоей теме и оценка близкая" → можно ослабить или усилить, если хочешь больше/меньше конвергенции мнений - Веса на Шаге 3 (экспертность, релевантность) → задай явно, кто из персон "главный эксперт" для твоей задачи - Вопросы для "памяти" персоны → замени на вопросы про твой конкретный продукт/нишу
Шаблон промпта
Я хочу оценить {объект оценки} с точки зрения нескольких типов людей.
Критерии оценки: {список критериев, 3-5 штук}.
Шаг 1. Создай {число, например 5} персон-оценщиков с разными чертами
характера, возрастом, профессией и отношением к риску. Для каждой
придумай 3 вопроса про их личный опыт с {категория продукта} и дай
ответы от лица персоны — это будет её "память" на дальнейшие шаги.
Шаг 2. Пусть каждая персона оценит {объект оценки} по каждому критерию
(шкала 1-5) с коротким обоснованием. Обоснование должно ссылаться на
её "память" из Шага 1, а не быть общими словами.
Шаг 3. Покажи каждой персоне оценки и обоснования остальных персон.
Пусть персона пересмотрит свою оценку ТОЛЬКО если: чужой аргумент
касается темы, которая волнует именно её (судя по характеру и памяти),
и чужая оценка не сильно отличается от её собственной. Иначе —
оставляет прежнюю оценку.
Шаг 4. Сведи финальный балл по каждому критерию. Учти, что персоны с
большим релевантным опытом должны весить немного больше при подсчёте
среднего. Отдельно укажи, где персоны сошлись во мнении, а где остались
серьёзные разногласия.
{объект оценки — текст, описание продукта, идея}
Плейсхолдеры: {объект оценки} — что оцениваем (текст, продукт, идея), {критерии} — по каким параметрам оценивать, {число} — сколько персон, {категория продукта} — контекст для вопросов о прошлом опыте.
🚀 Быстрый старт — вставь в чат:
Вот шаблон метода ESPP (панель персон-оценщиков). Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит какие критерии важны для твоей задачи и какие типы людей стоит включить в панель — потому что от этого зависит, будут ли персоны действительно расходиться во мнениях (иначе метод сведётся к одному усреднённому голосу).
Ограничения
⚠️ Долгий процесс: полный цикл (создание персон, память, оценка, обмен мнениями, агрегация) требует длинного промпта или нескольких сообщений — не подойдёт для быстрой разовой проверки в одну строку.
⚠️ Узкий диапазон итоговых баллов: в исследовании даже сильно разные модели получали похожие общие оценки. Метод хорош для выявления где именно мнения расходятся, но не даёт резких контрастов в общем балле — не жди, что метод скажет «это плохо, а это отлично», жди «тут все согласны, а тут мнения разные».
⚠️ Качество зависит от продуманности персон: если характеры персон поверхностны или их "память" противоречива, метод скатывается в обычную ролевую игру без реальной пользы.
Ресурсы
Zheng Wu, Yibo Luo, Pu Zhang, Cheng Yang, Zhuosheng Zhang (Shanghai Jiao Tong University, ByteDance Inc.), «Beyond a Single Judge: Simulating Social Persona Panels for Generative UI Evaluation». Код: https://github.com/Wuzheng02/ESPP
