3,583 papers
arXiv:2609.09428 71 8 сент. 2026 г. FREE

Мульти-персона оценка: как заставить LLM судить один и тот же материал глазами разных людей

КЛЮЧЕВАЯ СУТЬ
Одно и то же объяснение отказа в кредите разработчик понимает за секунду, а клиент — нет. Хотя текст один и тот же. Метод XAI-Arena позволяет оценить любой текст глазами разных аудиторий — клиента, юриста, менеджера — без сбора живых людей на каждую проверку. Фишка: вместо расплывчатого «оцени понятность» модель получает роль плюс жёсткий список критериев со шкалой 1-7 — и выдаёт не одну размытую оценку, а сетку чисел с обоснованием по каждой роли.
Адаптировать под запрос

TL;DR

Исследователи проверили, может ли LLM заменить людей в оценке качества объяснений (например, почему модель приняла такое решение), используя не один общий рейтинг, а набор ролей (персон) и набор критериев со шкалой. LLM получает роль ("ты — менеджер", "ты — конечный пользователь без технических знаний"), текст объяснения и список из 8 критериев — и выставляет оценки 1-7 с обоснованием по каждому.

Главная боль: один и тот же текст объясняет по-разному разным людям. Технический разработчик поймёт объяснение мгновенно, а клиент — нет, хотя текст один. Автоматические метрики (насколько объяснение технически точное) не показывают, насколько оно понятно и полезно для конкретного человека, а собирать реальных людей для каждой оценки — дорого и медленно.

Метод решает это, задавая LLM фиксированную структуру: роль + контекст + сам материал + список критериев со шкалой → LLM выдаёт числа и объяснение к ним. Проверка показала: оценки LLM умеренно-сильно совпадают с оценками реальных людей (корреляция Spearman 0,693) — значит, такой подход можно использовать как быструю замену части человеческого ревью.


🔬

Схема метода

ШАГ 1: Задать контекст — что за материал, для какой задачи он создан → текстовое описание
ШАГ 2: Задать персону — от чьего имени оценивать (роль зафиксирована текстом) → фиксированная инструкция-роль
ШАГ 3: Вставить сам материал для оценки → текст/таблица/изображение
ШАГ 4: Задать критерии + шкалу 1-7 и попросить оценку с обоснованием по каждому → числа + короткий текст

Все 4 шага — в одном промпте, одним запросом к LLM.


🚀

Пример применения

Задача: Ваш финтех-сервис (условно как Тинькофф или Сбер) отправляет клиенту объяснение, почему заявку на кредит отклонили. Вы хотите проверить, работает ли это объяснение для разных аудиторий — самого клиента, юриста по защите прав потребителей и внутреннего менеджера, который должен подтвердить решение.

Промпт:

Ты — конечный пользователь без технического образования. Ты хочешь получить 
понятное простое объяснение, чтобы решить, доверять ли результату и что делать дальше.

Контекст: клиенту банка отказали в выдаче кредита. Ниже — текст объяснения, 
которое ему прислали.

Материал для оценки:
"Ваша заявка отклонена из-за высокого отношения долга к доходу и короткой 
кредитной истории. Основной вклад в решение внесли: текущая задолженность 
по другим кредитам (40%) и срок трудовой занятости менее 1 года (25%)."

Оцени этот материал по каждому критерию на шкале от 1 (очень плохо) 
до 7 (очень хорошо). Для каждого критерия дай число и одну строку обоснования:

1. Простота — легко ли понять без специальных знаний
2. Ясность — насколько понятно изложено
3. Адекватность задаче — помогает ли принять решение, которое нужно принять
4. Калибровка доверия — вызывает ли оправданный уровень доверия
5. Применимость — можно ли предпринять конкретные действия
6. Прозрачность — понятно ли, как получен результат
7. Точность — насколько объяснение соответствует реальной логике
8. Общая понятность — итоговая оценка функции объяснения

Результат: Модель выдаст 8 пар "число + обоснование" — например, низкую оценку по простоте (из-за терминов "40%", "отношение долга к доходу") и подскажет, что именно мешает пониманию. Повторив запрос с другой ролью ("ты — юрист"), вы увидите другой профиль оценок того же текста — и поймёте, для кого объяснение работает, а для кого нет.


🧠

Почему это работает

LLM плохо справляется с расплывчатой просьбой "оцени, насколько это понятно" — ответ будет общим и неконкретным. Но LLM хорошо умеет удерживать роль и последовательно применять чек-лист, если роль и критерии прописаны явно.

Метод соединяет две сильные стороны модели: способность имитировать точку зрения конкретного человека (роль-плей) и способность структурированно проходить по списку критериев без "перескакивания". В результате вместо одной размытой оценки вы получаете сетку из нескольких точек зрения × нескольких критериев — и видите где именно объяснение проваливается и для кого.

Рычаги управления: - Персоны → замени на свои роли (клиент, инвестор, налоговая) — острее под вашу задачу - Критерии → используй свои 3-4 вместо 8, если нужна быстрая проверка - Шкала → 1-10 вместо 1-7, если привычнее - Требование обоснования → убери, если нужны только числа для сравнения нескольких вариантов текста


📋

Шаблон промпта

Ты — {персона: например, "менеджер, принимающий решение", "клиент без технической подготовки", "юрист"}.
{краткое описание, что важно для этой роли и на что она обращает внимание}

Контекст: {что объясняется — какое решение, задача, ситуация}

Материал для оценки:
{текст / объяснение / материал}

Оцени этот материал по следующим критериям на шкале от 1 (очень плохо) 
до 7 (очень хорошо). Для каждого критерия дай число и одну строку обоснования:

1. {критерий 1 — например, простота}
2. {критерий 2 — например, ясность}
3. {критерий 3 — например, адекватность задаче}
...

🚀 Быстрый старт — вставь в чат:

Вот шаблон оценки материала с точки зрения разных ролей. Адаптируй под мою задачу: 
{твоя задача}. Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какие роли важны для твоей ситуации и какие критерии качества имеют смысл — потому что без этого нельзя настроить контекст под конкретный материал.


⚠️

Ограничения

⚠️ Проверено на узком материале: Метод тестировали на технических объяснениях моделей (графики, таблицы важности признаков), а не на произвольных текстах — перенос на письма, презентации или обычные документы не проверялся напрямую в этой работе.

⚠️ Совпадение с людьми не полное: Оценки LLM связаны с человеческими, но не идентичны им — в отдельных случаях модель может ошибаться там, где человек прав, поэтому финальное решение по важным вопросам стоит проверять вручную.

⚠️ Чувствительность к формулировке роли и критериев: Результат зависит от того, как именно описана персона и критерии — небольшие изменения текста могут заметно менять оценки, поэтому важно зафиксировать формулировки, если сравниваешь несколько вариантов материала между собой.


🔗

Ресурсы

XAI-Arena. Yanfei Hu Fleischhauer (LMU Munich), Alona Zharova (Humboldt-Universität zu Berlin), Nadja Klein (Karlsruhe Institute of Technology), Stefan Feuerriegel (LMU Munich, MCML). Код и данные: anonymous.4open.science/r/xai-arena/


📋 Дайджест исследования

Ключевая суть

Одно и то же объяснение отказа в кредите разработчик понимает за секунду, а клиент — нет. Хотя текст один и тот же. Метод XAI-Arena позволяет оценить любой текст глазами разных аудиторий — клиента, юриста, менеджера — без сбора живых людей на каждую проверку. Фишка: вместо расплывчатого «оцени понятность» модель получает роль плюс жёсткий список критериев со шкалой 1-7 — и выдаёт не одну размытую оценку, а сетку чисел с обоснованием по каждой роли.

Принцип работы

Правило простое: не спрашивай модель «оцени качество» в общем — она выдаст воду. Дай роль-плей (ты — юрист, ты — клиент без образования) плюс фиксированный чек-лист из 8 критериев со шкалой. Один текст — восемь оценок с одной роли, и другие восемь — с другой роли. Так видно не общее «хорошо/плохо», а где именно объяснение проваливается для конкретного человека.

Почему работает

LLM плохо работает с открытым вопросом «понятно ли это?» — ответ будет общим и ни о чём. Но модель хорошо держит роль и проходит по списку без перескоков, если критерии прописаны явно. Оценки LLM совпали с оценками живых людей с корреляцией Спирмена 0,693 — связь умеренно-сильная, достаточная чтобы заменить часть ручного ревью. Метод просто соединяет две вещи, которые модель умеет хорошо: имитировать точку зрения конкретного человека и структурированно проходить чек-лист.

Когда применять

Проверка текстов и коммуникаций для разных аудиторий → письма об отказе, юридические уведомления, инструкции для пользователей, особенно когда нужно понять для кого текст не работает. НЕ подходит для творческих текстов, где нет единственно правильного восприятия — там оценка ролей будет произвольной.

Мини-рецепт

1. Задай контекст: одно-два предложения — что за материал и для какой задачи он создан.
2. Пропиши роль: <роль>клиент без технического образования или <роль>юрист по защите прав потребителей — и что именно важно этой роли.
3. Вставь материал целиком: текст объяснения, письмо, документ без сокращений.
4. Дай критерии и шкалу: 3-8 пунктов, каждый со шкалой 1-7, и попроси число плюс одну строку обоснования на каждый.
5. Повтори с другой ролью: тот же материал, новая роль — сравни профили оценок и увидишь разницу.

Примеры

[ПЛОХО] : Оцени, насколько понятно это объяснение отказа в кредите
[ХОРОШО] : Ты — клиент банка без финансового образования. Оцени текст ниже по критериям: простота (1-7), ясность (1-7), применимость (1-7). Для каждого дай число и строку обоснования. Текст: "Заявка отклонена из-за высокого отношения долга к доходу и короткой кредитной истории. Основной вклад: текущая задолженность (40%) и срок работы менее года (25%)"
Источник: XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?
ArXiv ID: 2609.09428 | Сгенерировано: 2026-09-10 04:28

Проблемы LLM

ПроблемаСутьКак обойти
Расплывчатая просьба даёт размытый ответПросишь модель "оцени, насколько это понятно" или "оцени качество" без деталей. Получаешь общий, неконкретный ответ без структуры. Непонятно, что именно плохо и для кого. Это ломается на любой задаче оценки текста, кода, объяснения, дизайнаЗадай роль ("ты — юрист", "ты — клиент без техподготовки") и список конкретных критериев со шкалой 1-7. Попроси число + короткое обоснование по каждому пункту. Расплывчатая просьба превращается в структурированный чек-лист

Методы

МетодСуть
Мульти-персона оценка — разный профиль оценок для одного текстаДай модели роль (клиент, юрист, менеджер, инвестор), контекст задачи, сам материал и список из 3-8 критериев со шкалой (например 1-7). Попроси число + строку обоснования по каждому критерию. Повтори тот же запрос с другой ролью на том же материале. Почему работает: LLM плохо тянет расплывчатую просьбу оценить "в целом", но хорошо удерживает заданную роль и последовательно проходит явный чек-лист. Разные роли акцентируют разные критерии — получаешь не одну оценку, а сетку "роль × критерий", где видно где именно текст проваливается и для кого. Когда применять: нужно проверить письмо, объяснение, документ или коммуникацию на разные аудитории до отправки реальным людям. Когда не работает: нужна абсолютная точность (финальное решение по важному вопросу проверяй вручную), результат чувствителен к формулировке роли и критериев — меняй текст персоны и сравнивай варианты только при фиксированной формулировке
📖 Простыми словами

XAI-Arena: CanLLMsAssess the Quality of XAI Explanations?

arXiv: 2609.09428

Если ты просто спросишь нейросеть "нормально ли всё объяснено?", она выдаст вежливую водянистую чушь. Модели в принципе тупят на абстрактных задачах, но идеально работают как симуляторы аудитории, когда их загоняют в жесткие рамки. Вместо одного размытого мнения исследователи скормили LLM ролевые маски и четкие критерии — и сетка внезапно начала оценивать качество объяснений не хуже живых экспертов.

Это как показать макет сайта случайному прохожему и спросить: "Ну как тебе?" Тот просто буркнет «красиво». Но если нарядить его в строгий костюм, сунуть в зубы чек-лист аудитора и сказать: «ты злой инспектор, ищи косяки» — он мгновенно разнесет документ по фактам. Без роли нейросеть пытается угодить всем сразу, а с ролью — включает прицельный анализ.

Метод чертовски прост: задаем ролевую персону («ты въедливый юрист» или «ты клиент без технического образования»), скармливаем объяснение и прогоняем через 8 жестких критериев по шкале от 1 до 7 с обязательным обоснованием. Оценка перестает быть лотереей: модель проверяет, понятна ли причина решения, нет ли скрытого булшита и ясен ли следующий шаг. LLM-оценщик больше не гадает, а методично тестирует текст с нужной колокольни.

Тестировали на финтехе и отказах по кредитам, но принцип универсален. Ту же схему можно натравить на UX-копирайтинг, ответы службы поддержки, медицинские выписки или запутанные оферты. Вместо того чтобы собирать фокус-группу за бешеные деньги, ты за пару секунд прогоняешь текст через виртуальных юристов, злых клиентов и менеджеров.

Короче: забудь про тупые промпты в духе «оцени текст» — это пустая трата токенов. Задавай конкретную персону, давай рубленый чек-лист и требуй баллы с аргументами по каждому пункту. Ролевой аудит через LLM экономит недели ручной вычитки и сразу показывает, где твое объяснение скатилось в птичий язык, а где бьет точно в цель.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с