TL;DR
Исследователи проверили, может ли LLM заменить людей в оценке качества объяснений (например, почему модель приняла такое решение), используя не один общий рейтинг, а набор ролей (персон) и набор критериев со шкалой. LLM получает роль ("ты — менеджер", "ты — конечный пользователь без технических знаний"), текст объяснения и список из 8 критериев — и выставляет оценки 1-7 с обоснованием по каждому.
Главная боль: один и тот же текст объясняет по-разному разным людям. Технический разработчик поймёт объяснение мгновенно, а клиент — нет, хотя текст один. Автоматические метрики (насколько объяснение технически точное) не показывают, насколько оно понятно и полезно для конкретного человека, а собирать реальных людей для каждой оценки — дорого и медленно.
Метод решает это, задавая LLM фиксированную структуру: роль + контекст + сам материал + список критериев со шкалой → LLM выдаёт числа и объяснение к ним. Проверка показала: оценки LLM умеренно-сильно совпадают с оценками реальных людей (корреляция Spearman 0,693) — значит, такой подход можно использовать как быструю замену части человеческого ревью.
Схема метода
ШАГ 1: Задать контекст — что за материал, для какой задачи он создан → текстовое описание
ШАГ 2: Задать персону — от чьего имени оценивать (роль зафиксирована текстом) → фиксированная инструкция-роль
ШАГ 3: Вставить сам материал для оценки → текст/таблица/изображение
ШАГ 4: Задать критерии + шкалу 1-7 и попросить оценку с обоснованием по каждому → числа + короткий текст
Все 4 шага — в одном промпте, одним запросом к LLM.
Пример применения
Задача: Ваш финтех-сервис (условно как Тинькофф или Сбер) отправляет клиенту объяснение, почему заявку на кредит отклонили. Вы хотите проверить, работает ли это объяснение для разных аудиторий — самого клиента, юриста по защите прав потребителей и внутреннего менеджера, который должен подтвердить решение.
Промпт:
Ты — конечный пользователь без технического образования. Ты хочешь получить
понятное простое объяснение, чтобы решить, доверять ли результату и что делать дальше.
Контекст: клиенту банка отказали в выдаче кредита. Ниже — текст объяснения,
которое ему прислали.
Материал для оценки:
"Ваша заявка отклонена из-за высокого отношения долга к доходу и короткой
кредитной истории. Основной вклад в решение внесли: текущая задолженность
по другим кредитам (40%) и срок трудовой занятости менее 1 года (25%)."
Оцени этот материал по каждому критерию на шкале от 1 (очень плохо)
до 7 (очень хорошо). Для каждого критерия дай число и одну строку обоснования:
1. Простота — легко ли понять без специальных знаний
2. Ясность — насколько понятно изложено
3. Адекватность задаче — помогает ли принять решение, которое нужно принять
4. Калибровка доверия — вызывает ли оправданный уровень доверия
5. Применимость — можно ли предпринять конкретные действия
6. Прозрачность — понятно ли, как получен результат
7. Точность — насколько объяснение соответствует реальной логике
8. Общая понятность — итоговая оценка функции объяснения
Результат: Модель выдаст 8 пар "число + обоснование" — например, низкую оценку по простоте (из-за терминов "40%", "отношение долга к доходу") и подскажет, что именно мешает пониманию. Повторив запрос с другой ролью ("ты — юрист"), вы увидите другой профиль оценок того же текста — и поймёте, для кого объяснение работает, а для кого нет.
Почему это работает
LLM плохо справляется с расплывчатой просьбой "оцени, насколько это понятно" — ответ будет общим и неконкретным. Но LLM хорошо умеет удерживать роль и последовательно применять чек-лист, если роль и критерии прописаны явно.
Метод соединяет две сильные стороны модели: способность имитировать точку зрения конкретного человека (роль-плей) и способность структурированно проходить по списку критериев без "перескакивания". В результате вместо одной размытой оценки вы получаете сетку из нескольких точек зрения × нескольких критериев — и видите где именно объяснение проваливается и для кого.
Рычаги управления: - Персоны → замени на свои роли (клиент, инвестор, налоговая) — острее под вашу задачу - Критерии → используй свои 3-4 вместо 8, если нужна быстрая проверка - Шкала → 1-10 вместо 1-7, если привычнее - Требование обоснования → убери, если нужны только числа для сравнения нескольких вариантов текста
Шаблон промпта
Ты — {персона: например, "менеджер, принимающий решение", "клиент без технической подготовки", "юрист"}.
{краткое описание, что важно для этой роли и на что она обращает внимание}
Контекст: {что объясняется — какое решение, задача, ситуация}
Материал для оценки:
{текст / объяснение / материал}
Оцени этот материал по следующим критериям на шкале от 1 (очень плохо)
до 7 (очень хорошо). Для каждого критерия дай число и одну строку обоснования:
1. {критерий 1 — например, простота}
2. {критерий 2 — например, ясность}
3. {критерий 3 — например, адекватность задаче}
...
🚀 Быстрый старт — вставь в чат:
Вот шаблон оценки материала с точки зрения разных ролей. Адаптируй под мою задачу:
{твоя задача}. Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какие роли важны для твоей ситуации и какие критерии качества имеют смысл — потому что без этого нельзя настроить контекст под конкретный материал.
Ограничения
⚠️ Проверено на узком материале: Метод тестировали на технических объяснениях моделей (графики, таблицы важности признаков), а не на произвольных текстах — перенос на письма, презентации или обычные документы не проверялся напрямую в этой работе.
⚠️ Совпадение с людьми не полное: Оценки LLM связаны с человеческими, но не идентичны им — в отдельных случаях модель может ошибаться там, где человек прав, поэтому финальное решение по важным вопросам стоит проверять вручную.
⚠️ Чувствительность к формулировке роли и критериев: Результат зависит от того, как именно описана персона и критерии — небольшие изменения текста могут заметно менять оценки, поэтому важно зафиксировать формулировки, если сравниваешь несколько вариантов материала между собой.
Ресурсы
XAI-Arena. Yanfei Hu Fleischhauer (LMU Munich), Alona Zharova (Humboldt-Universität zu Berlin), Nadja Klein (Karlsruhe Institute of Technology), Stefan Feuerriegel (LMU Munich, MCML). Код и данные: anonymous.4open.science/r/xai-arena/
