3,583 papers
arXiv:2607.28439 80 30 июля 2026 г. FREE

ESPP: коллегия персон с «прошлым» вместо одного судьи-LLM

КЛЮЧЕВАЯ СУТЬ
Пять разных персон в промпте почти всегда выдают один и тот же вердикт — LLM просто подгоняет обоснование под ярлык 'ты скептик'. Метод ESPP позволяет получить реально разные, обоснованные мнения от 'типов пользователей' в одном чате, без фокус-групп и кода. Решение простое: перед оценкой персона отвечает на вопросы про свой прошлый опыт — это её память, и оценка потом должна ей не противоречить. Фишка: не описание характера держит модель в рамках, а зафиксированные факты — ярлык обойти легко, а свои же слова из диалога — сложно.
Адаптировать под запрос

TL;DR

ESPP (Evidence-Grounded, Social-Weighted Persona Panel) — метод оценки любого контента через несколько ролей-персон с закреплённой историей, которые сначала оценивают продукт по отдельности, потом обмениваются мнениями по строгому правилу, а в конце их оценки складываются во взвешенный итог. Суть не в том, что LLM «играет роли» — это все умеют, — а в том, как эти роли закрепляются перед оценкой и как им разрешено менять мнение.

Главная находка исследования неожиданная: если просто попросить LLM оценить что-то от имени пяти разных «типов пользователей», результат почти не отличается от одного мнения — модель просто подгоняет обоснование под лейбл персоны ("ты скептик" → любую оценку легко объяснить скептицизмом). Даже если запустить пять независимых проходов и усреднить — выигрыш крошечный. Настоящий прирост точности даёт только одно: если перед оценкой заставить персону ответить на конкретные вопросы о своём опыте, и потом требовать, чтобы оценка не противоречила этим ответам.

ESPP решает это в три шага: (1) закрепить каждую персону конкретными ответами на вопросы — это её "память", а не просто ярлык характера; (2) дать персонам увидеть чужие оценки и изменить своё мнение — но только если аргумент близок по позиции И касается темы, которая лично её волнует; (3) собрать финальный балл не простым средним, а с весами по экспертности и релевантности каждой персоны к задаче.


🔬

Схема метода

ШАГ 0 (в промпте): Создать 5 персон — разные черты характера (открытость, 
тревожность, склонность к риску и т.д.) + демография + профиль опыта. 
Для каждой персоны заранее сгенерировать 3-5 вопросов о её опыте с 
похожими продуктами и её же ответы → это "память" персоны.

ШАГ 1 (тот же или следующий промпт): Каждая персона независимо оценивает 
продукт по нескольким критериям, ссылаясь на СВОИ ответы из Шага 0 
→ оценка + обоснование от каждой персоны.

ШАГ 2 (следующий промпт): Персоны видят все чужие оценки и обоснования. 
Меняют своё мнение ТОЛЬКО если: 
(а) чужая оценка близка к своей (не кардинально другая) 
(б) аргумент касается именно того, что волнует эту персону 
→ пересмотренные оценки.

ШАГ 3 (тот же промпт): Пересмотренные оценки складываются с весами: 
персоны с большей "экспертностью" в теме и большей "похожестью" на 
целевую аудиторию весят чуть больше → финальный балл + разброс мнений.

Все 4 шага можно провести в одном длинном чате последовательными сообщениями — без кода и API.


🚀

Пример применения

Задача: Стартап запускает сервис доставки готовых обедов в офисы по подписке. Перед запуском рекламы нужно проверить текст лендинга — не полагаясь на своё мнение и не тратя деньги на фокус-группу.

Промпт:

Создай 5 персон-читателей для оценки текста лендинга ниже. Для каждой 
задай: возраст, профессию, отношение к риску, уровень занятости.

Затем для каждой персоны придумай 3 вопроса про их прошлый опыт с 
подписками на еду/доставку и дай ответы от лица персоны — это будет 
их "память", на которую они должны опираться при оценке.

После этого каждая персона должна оценить текст лендинга (ниже) по 
5 критериям: понятность, доверие к бренду, удобство подписки, 
ощущение контроля (можно ли легко отменить), прозрачность условий. 
Шкала 1-5 с коротким объяснением, ссылаясь на свою "память".

Затем покажи каждой персоне оценки и объяснения остальных. Пусть 
персона поменяет своё мнение ТОЛЬКО если чужой аргумент касается 
темы, которая лично её волнует (судя по её характеру и ответам), 
и оценка соседа не сильно отличается от её собственной. Иначе 
пусть остаётся при своём.

В конце сведи итоговую оценку: посчитай средний балл по каждому 
критерию, но отметь отдельно, где персоны сошлись, а где остались 
разногласия.

Текст лендинга: {текст}

Результат: Модель выдаст профили 5 персон с их "историей", затем 5 независимых оценок с обоснованиями, затем раунд, где видно кто поменял мнение и почему (или не поменял), и в конце — сводную таблицу баллов с указанием, по каким пунктам мнения разошлись сильнее всего (например: все согласны, что текст понятен, но расходятся насчёт доверия к новому бренду).


🧠

Почему это работает

LLM, которую просто просят "будь скептичным пользователем", не имеет реальных ограничений — она может подогнать любое обоснование под ярлык "скептик", потому что ярлык почти не сужает пространство возможных ответов.

Зато LLM хорошо умеет держаться уже сказанного в диалоге — если персона до оценки успела "ответить" на конкретные вопросы про свой опыт, эти ответы становятся якорем. Модели сложнее написать оценку, которая противоречит уже зафиксированным фактам, чем написать оценку, противоречащую абстрактному ярлыку личности.

Метод использует это через закрепление историей (Шаг 0-1) и через избирательное влияние на Шаге 2: персона меняет мнение не от любого аргумента, а только от того, что попадает в её собственную зону интересов. Это не даёт дискуссии скатиться либо в единодушие (все сходятся к среднему), либо в хаос (никто никого не слушает).

Рычаги управления: - Число персон (в оригинале 5) → уменьши до 3 для быстрой проверки, увеличь до 7-8 для более тонкой картины разногласий - Правило "меняй мнение, только если аргумент по твоей теме и оценка близкая" → можно ослабить или усилить, если хочешь больше/меньше конвергенции мнений - Веса на Шаге 3 (экспертность, релевантность) → задай явно, кто из персон "главный эксперт" для твоей задачи - Вопросы для "памяти" персоны → замени на вопросы про твой конкретный продукт/нишу


📋

Шаблон промпта

Я хочу оценить {объект оценки} с точки зрения нескольких типов людей. 
Критерии оценки: {список критериев, 3-5 штук}.

Шаг 1. Создай {число, например 5} персон-оценщиков с разными чертами 
характера, возрастом, профессией и отношением к риску. Для каждой 
придумай 3 вопроса про их личный опыт с {категория продукта} и дай 
ответы от лица персоны — это будет её "память" на дальнейшие шаги.

Шаг 2. Пусть каждая персона оценит {объект оценки} по каждому критерию 
(шкала 1-5) с коротким обоснованием. Обоснование должно ссылаться на 
её "память" из Шага 1, а не быть общими словами.

Шаг 3. Покажи каждой персоне оценки и обоснования остальных персон. 
Пусть персона пересмотрит свою оценку ТОЛЬКО если: чужой аргумент 
касается темы, которая волнует именно её (судя по характеру и памяти), 
и чужая оценка не сильно отличается от её собственной. Иначе — 
оставляет прежнюю оценку.

Шаг 4. Сведи финальный балл по каждому критерию. Учти, что персоны с 
большим релевантным опытом должны весить немного больше при подсчёте 
среднего. Отдельно укажи, где персоны сошлись во мнении, а где остались 
серьёзные разногласия.

{объект оценки — текст, описание продукта, идея}

Плейсхолдеры: {объект оценки} — что оцениваем (текст, продукт, идея), {критерии} — по каким параметрам оценивать, {число} — сколько персон, {категория продукта} — контекст для вопросов о прошлом опыте.

🚀 Быстрый старт — вставь в чат:

Вот шаблон метода ESPP (панель персон-оценщиков). Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит какие критерии важны для твоей задачи и какие типы людей стоит включить в панель — потому что от этого зависит, будут ли персоны действительно расходиться во мнениях (иначе метод сведётся к одному усреднённому голосу).


⚠️

Ограничения

⚠️ Долгий процесс: полный цикл (создание персон, память, оценка, обмен мнениями, агрегация) требует длинного промпта или нескольких сообщений — не подойдёт для быстрой разовой проверки в одну строку.

⚠️ Узкий диапазон итоговых баллов: в исследовании даже сильно разные модели получали похожие общие оценки. Метод хорош для выявления где именно мнения расходятся, но не даёт резких контрастов в общем балле — не жди, что метод скажет «это плохо, а это отлично», жди «тут все согласны, а тут мнения разные».

⚠️ Качество зависит от продуманности персон: если характеры персон поверхностны или их "память" противоречива, метод скатывается в обычную ролевую игру без реальной пользы.


🔗

Ресурсы

Zheng Wu, Yibo Luo, Pu Zhang, Cheng Yang, Zhuosheng Zhang (Shanghai Jiao Tong University, ByteDance Inc.), «Beyond a Single Judge: Simulating Social Persona Panels for Generative UI Evaluation». Код: https://github.com/Wuzheng02/ESPP


📋 Дайджест исследования

Ключевая суть

Пять разных персон в промпте почти всегда выдают один и тот же вердикт — LLM просто подгоняет обоснование под ярлык 'ты скептик'. Метод ESPP позволяет получить реально разные, обоснованные мнения от 'типов пользователей' в одном чате, без фокус-групп и кода. Решение простое: перед оценкой персона отвечает на вопросы про свой прошлый опыт — это её память, и оценка потом должна ей не противоречить. Фишка: не описание характера держит модель в рамках, а зафиксированные факты — ярлык обойти легко, а свои же слова из диалога — сложно.

Принцип работы

Три шага, а не один запрос 'оцени как скептик'. Шаг 1: персона отвечает на 3-5 вопросов о своём опыте — это её память. Шаг 2: оценка обязана ссылаться на эту память, не на общие слова. Шаг 3: персоны видят чужие оценки, но меняют мнение только если аргумент близкий по позиции и попадает в зону её личных интересов. Без этого правила дискуссия либо скатывается в одинаковое усреднение, либо превращается в бардак, где никто никого не слушает.

Почему работает

LLM легко обходит абстрактный ярлык — слово 'скептик' почти не сужает пространство ответов, под него подгонишь что угодно. А вот собственные слова, сказанные пятью репликами назад в этом же диалоге, обойти сложнее — модель держится за то, что уже написала. Память работает как якорь: характер уже зафиксирован фактами, а не оценка подгоняется под характер. Без этого шага пять персон реально дают тот же результат что одна — исследователи это проверили.

Когда применять

Тестирование текстов, лендингов, офферов, бизнес-идей → когда нужно быстро прощупать реакцию разных типов аудитории без реальной фокус-группы, особенно если важно понять не общий балл, а где именно мнения расходятся. Не подходит для мгновенной проверки в одну строку — процесс многошаговый и длинный.

Мини-рецепт

1. Создай персон с памятью: задай 5 персон (характер, возраст, профессия), для каждой — 3-5 вопросов про её прошлый опыт с похожим продуктом и ответы от её лица.
2. Оценка с опорой на память: каждая персона оценивает объект по критериям, обязательно ссылаясь на свои же ответы — не общими словами.
3. Избирательный обмен мнениями: покажи персонам чужие оценки. Разреши менять мнение только если аргумент по её теме и оценка соседа близкая.
4. Взвешенный итог: собери финальный балл с весами по опыту персоны, отдельно отметь где все сошлись, а где остались разногласия.

Примеры

[ПЛОХО] : Оцени этот текст лендинга от имени пяти разных типов пользователей: скептик, энтузиаст, консерватор, экономный, импульсивный
[ХОРОШО] : Создай 5 персон. Для каждой придумай 3 вопроса про её опыт с подписками на еду и дай ответы от её лица — это её память. Затем пусть каждая оценит лендинг, ссылаясь на эту память, а не на общие слова. После этого покажи персонам чужие оценки — пусть меняют мнение только если аргумент касается лично их темы
Источник: Beyond a Single Judge: Simulating Social Persona Panels for Generative UI Evaluation
ArXiv ID: 2607.28439 | Сгенерировано: 2026-07-31 06:24

Проблемы LLM

ПроблемаСутьКак обойти
Ролевые промпты не создают реальных различий между "персонами"Просишь модель оценить продукт как "скептик", "оптимист", "консерватор". Модель легко подгоняет любое обоснование под название роли. Ярлык характера почти не сужает пространство возможных ответов. Пять персон дают почти то же самое, что одно мнение, даже если считать их независимо и усреднитьПеред оценкой задай персоне 3-5 вопросов о её прошлом опыте с похожим продуктом и получи ответы от её лица. Это станет её "памятью". При оценке требуй, чтобы обоснование ссылалось именно на эти ответы, а не на общие слова про характер

Методы

МетодСуть
Закрепление персоны через "память" (вопрос-ответ)До того как персона оценивает продукт, задай ей 3-5 вопросов про её личный опыт с похожими продуктами и получи ответы от её лица. Затем проси оценку со ссылкой на эти ответы, а не на абстрактный характер. Работает потому что модели проще держаться уже сказанного в диалоге, чем оставаться в рамках размытого словесного ярлыка — противоречить конкретным фактам сложнее, чем противоречить описанию личности. Применяй в любом ролевом промпте, где собираешь мнения "разных типов пользователей" о тексте, продукте, идее. Не работает если вопросы для памяти поверхностны или противоречат друг другу — тогда скатывается в обычную ролевую игру
Избирательный обмен мнениями между персонамиПокажи каждой персоне оценки и обоснования остальных. Разреши менять мнение только если: (а) чужая оценка близка к её собственной, и (б) аргумент касается темы, которая лично волнует эту персону (судя по её характеру и памяти). Во всех остальных случаях персона остаётся при своём мнении. Работает потому что без такого фильтра обсуждение либо скатывается к единому усреднённому мнению (если можно менять от любого аргумента), либо превращается в хаос (если никто никого не слушает). Применяй когда нужно увидеть, где мнения реально расходятся, а не получить одно усреднённое число. Не подходит для задач где нужен один быстрый ответ без нюансов
📖 Простыми словами

Beyond a Single Judge: Simulating Social Persona Panels for Generative UI Evaluation

arXiv: 2607.28439

Обычные нейронки оценивают контент как среднее арифметическое по интернету — получается стерильно и бесполезно. Метод ESPP меняет саму механику: вместо одного «умного» судьи мы создаем целую панель из разных персонажей со своей историей и тараканами в голове. Суть в том, что LLM не просто притворяется кем-то, а жестко привязывается к конкретному опыту, который нельзя игнорировать при вынесении вердикта. Это превращает оценку из гадания на кофейной гуще в симуляцию реального рынка.

Это как собрать в одной комнате прожженного скептика, восторженного гика и экономную домохозяйку, чтобы они обсудили твой продукт. Но есть нюанс: если их просто попросить «побыть ими», они начнут подыгрывать тебе. В ESPP каждому выдают «паспорт» с прошлым опытом, и они обязаны сначала высказаться сами, потом услышать других по строгому протоколу, и только потом выставить финальный балл. Демократия на стероидах, где мнение каждого взвешено и обосновано фактами, а не просто настроением модели.

Вся магия держится на трех китах: закрепление на доказательствах (персонаж не может просто сказать «мне не нравится», он должен сослаться на свой бэкграунд), социальное взвешивание (учет того, чье мнение в этой группе важнее) и строгий регламент дискуссии. Если ты тестируешь лендинг доставки еды, «офисный планктон» будет топить за скорость, а «ЗОЖ-активист» — за калории. Метод заставляет модель сталкивать эти позиции лбами, выявляя скрытые конфликты интересов, которые обычный промпт «проверь мой текст» никогда не найдет.

Хотя метод обкатывали на интерфейсах, принцип универсален. Его можно натравить на рекламные креативы, сценарии роликов или даже политические программы. Везде, где результат зависит от восприятия разных групп людей, панель персон отработает лучше, чем один эксперт. Это позволяет предсказать провал продукта еще до того, как ты сольешь бюджет на реальные тесты. GEO и персонализация требуют именно такого подхода: понимать не «среднего юзера», а конкретные сегменты аудитории.

Короче: хватит спрашивать у ChatGPT «хороший ли это текст». Создавай панель ESPP, давай им биографии и заставляй спорить друг с другом. Это единственный способ вытащить из нейронки объективную критику, а не дежурный комплимент. 15 минут настройки симуляции экономят недели правок после неудачного запуска. Либо ты тестируешь продукт на виртуальных персонажах сейчас, либо на реальных клиентах, но уже за свои деньги.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с