3,583 papers
arXiv:2608.04077 79 4 авг. 2026 г. FREE

RGRC (Role-Grounded Rubric Construction): критерии оценки строятся из реальных рабочих документов, а не из головы модели

КЛЮЧЕВАЯ СУТЬ
Спросишь у LLM «какие критерии у хорошего due diligence отчёта» — получишь общие книжные фразы, а не реальный профессиональный стандарт. Метод RGRC даёт возможность строить честный чек-лист оценки для узкоспециализированных задач — там, где стандарты нигде явно не прописаны, а живут только в головах практиков. Модель не придумывает критерии, а вытаскивает их из пачки настоящих документов — находит, что повторяется у разных авторов, и превращает в проверяемые пункты с весами. Результат: обычный промпт покрывает скрытые профессиональные нормы на 78%, метод на реальных документах — на 99%.
Адаптировать под запрос

TL;DR

RGRC — метод создания чек-листа для оценки качества профессиональной работы (отчётов, заключений, аналитики), где критерии берутся не из промпта задачи и не из ответов самой LLM, а из настоящих документов, которые написали практикующие специалисты. Модель анализирует пачку реальных примеров, находит повторяющиеся паттерны качества и превращает их в проверяемый чек-лист с весами.

Если просто спросить LLM «какие критерии качества у хорошего инвестиционного отчёта», она справится неплохо — но только для тех жанров, которые массово представлены в интернете (маркетинговые тексты, типовая документация). А вот для узкоспециализированных задач с неявными, «внутрицеховыми» стандартами (заключение актуария, due diligence отчёт, налоговый меморандум) — модель просто не знает этих скрытых норм, и её чек-лист получается поверхностным. Разница разительная: обычный промпт покрывает такие скрытые стандарты на 78%, а метод на основе реальных документов — на 99%.

Метод в 4 шага: (1) собрать пачку настоящих документов от практиков нужной роли; (2) попросить LLM разобрать каждый документ и выделить паттерны — структуру, глубину анализа, профессиональные конвенции; (3) свести паттерны по всем документам и оставить только те, что повторяются в большинстве («счётчик по частоте», не индивидуальные причуды); (4) превратить это в чек-лист с весами, где каждый критерий — конкретный, проверяемый, без субъективных формулировок типа «глубокий анализ».

🔬

Схема метода

ШАГ 1: Собери документы → пачка реальных примеров работы (мин. 3-5 разных авторов/источников)
ШАГ 2: Разбери каждый документ → LLM выделяет структуру, стандарты, что отличает сильную работу от слабой (отдельный анализ на документ)
ШАГ 3: Сведи в общие стандарты → LLM ищет паттерны, повторяющиеся в большинстве документов
ШАГ 4: Синтезируй чек-лист → список конкретных, проверяемых критериев с весами (важные/менее важные) и «стоп-условиями» (за что снимают баллы полностью)
ШАГ 5: Проверь чек-лист → приложи его к реальному сильному документу и к слабому/сгенерированному — если чек-лист не различает их по баллам, критерии слишком общие, вернись к шагу 4

Шаг 1 — сбор материала вручную (найти документы). Шаги 2–5 можно провести последовательно в одном диалоге с LLM.

🚀

Пример применения

Задача: Вы руководите небольшой консалтинговой фирмой и хотите оценивать due diligence-отчёты (проверка компании перед сделкой), которые готовят ваши аналитики для клиентов. Задача узкая, стандарты неявные — общий промпт «оцени качество отчёта» тут не сработает.

Промпт:

Я хочу построить чек-лист для оценки качества due diligence отчётов, 
которые готовят мои аналитики для клиентов перед сделками M&A.

У меня есть 4 примера реальных due diligence отчётов от разных консалтинговых 
компаний (прикладываю ниже / вставлю по одному).

Сделай так:
1. Разбери каждый отчёт отдельно: какая у него структура, какие разделы 
обязательны, какая глубина анализа, какие профессиональные приёмы 
(например, как оформлены риски, как подтверждаются цифры).
2. После разбора всех отчётов — сведи паттерны: что повторяется в 
большинстве отчётов независимо от автора (это и есть настоящий стандарт).
3. Превратые эти паттерны в чек-лист из 15-25 конкретных, проверяемых пунктов. 
Каждый пункт — конкретный факт, который можно проверить да/нет, а не 
общая фраза типа "анализ глубокий". Дай каждому пункту вес от 1 до 3 
(насколько критичен) и отдельно отметь 2-3 "стоп-условия" — 
критичные ошибки, которые обесценивают весь отчёт.
4. Проверь свой чек-лист: приложи его к одному из реальных отчётов и 
к вымышленному слабому отчёту (напиши его сам как пример халтуры) — 
покажи, что баллы заметно отличаются.

[Отчёт 1: вставить текст]
[Отчёт 2: вставить текст]
[Отчёт 3: вставить текст]
[Отчёт 4: вставить текст]

Результат: Модель даст поэтапный разбор — сначала анализ по каждому отчёту, потом сведённые паттерны («в 3 из 4 отчётов раздел с рисками идёт до финансового анализа», «во всех отчётах указан источник каждой цифры»), затем готовый чек-лист с весами и стоп-условиями, и в конце — проверку на двух примерах с баллами, чтобы показать, что чек-лист реально различает хорошую и слабую работу.

🧠

Почему это работает

LLM хорошо умеет находить общие паттерны в тексте, но плохо знает неявные профессиональные нормы, которые нигде явно не прописаны — они просто «зашиты» в привычки практиков и передаются внутри профессии. Если спросить модель напрямую, она выдаст общие книжные представления о качестве, усреднённые по интернету.

Зато модель отлично справляется с задачей «сравни несколько текстов и найди, что в них общее» — это её сильная сторона, работа с шаблонами и повторами. Метод использует именно эту способность: вместо того чтобы просить модель «придумать» стандарты, ей дают реальный материал и просят извлечь закономерности из него — а не сгенерировать их из головы.

Рычаги управления: - Количество документов → чем больше и разнообразнее источники (разные авторы, разные компании), тем надёжнее найденные стандарты — минимум 3-4 документа от разных авторов, иначе рискуете скопировать стиль одного человека. - Порог частоты (в оригинале — 60%) → если хотите строгий чек-лист только из железных стандартов, повышайте требование «встречается почти во всех документах»; если нужно шире — снижайте. - Проверочный шаг (приложить к слабому примеру) → не пропускайте, иначе не узнаете, различает ли чек-лист хорошую и плохую работу вообще.

📋

Шаблон промпта

Помоги построить чек-лист качества для оценки {тип документа/работы}.

У меня есть {количество} реальных примеров такой работы от разных 
специалистов/компаний. Вставляю их по одному ниже.

Выполни по шагам:
1. Разбери каждый пример отдельно: структура, обязательные разделы, 
глубина анализа, профессиональные приёмы, что отличает сильную работу 
от слабой.
2. Сведи паттерны по всем примерам — оставь только то, что повторяется 
в большинстве, отбрось индивидуальные особенности одного автора.
3. Превратый паттерны в чек-лист из {число} конкретных, проверяемых 
пунктов (без общих фраз типа "качественно" или "глубоко"). Дай каждому 
пункту вес по важности и отдельно выдели стоп-условия — критичные ошибки.
4. Проверь чек-лист на одном из примеров и на слабой версии (можешь 
написать её сам) — покажи разницу в баллах.

[Пример 1]
[Пример 2]
...

Плейсхолдеры: {тип документа/работы} — что оцениваете (отчёт, коммерческое предложение, юридическое заключение), {количество} — сколько примеров вставляете, {число} — желаемый размер чек-листа (15-25 для простых задач, 40+ для сложных многостраничных документов).

🚀 Быстрый старт — вставь в чат:

Вот шаблон построения чек-листа качества из реальных примеров работы (RGRC). 
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какие именно документы вы можете предоставить и сколько их — потому что без реальных примеров метод не работает, это его ключевое отличие от обычного промпт-инжиниринга.

⚠️

Ограничения

⚠️ Нужны реальные примеры: без доступа к настоящим документам от практиков метод превращается в обычный промпт-инжиниринг — теряется вся его ценность.

⚠️ Для распространённых жанров выигрыш минимальный: если оцениваете что-то массовое и хорошо представленное в интернете (маркетинговый текст, типовое письмо), обычный промпт справится почти так же хорошо — разница проявляется именно на нишевых, узкопрофессиональных задачах.

⚠️ Нужно минимум 3-4 разных источника: один-два документа дают не стандарт профессии, а стиль конкретного автора — чек-лист выйдет искажённым.

🔗

Ресурсы

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables. Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang — Qwen DianJin Team, Alibaba Cloud Computing.


📋 Дайджест исследования

Ключевая суть

Спросишь у LLM «какие критерии у хорошего due diligence отчёта» — получишь общие книжные фразы, а не реальный профессиональный стандарт. Метод RGRC даёт возможность строить честный чек-лист оценки для узкоспециализированных задач — там, где стандарты нигде явно не прописаны, а живут только в головах практиков. Модель не придумывает критерии, а вытаскивает их из пачки настоящих документов — находит, что повторяется у разных авторов, и превращает в проверяемые пункты с весами. Результат: обычный промпт покрывает скрытые профессиональные нормы на 78%, метод на реальных документах — на 99%.

Принцип работы

Работает как детектив, а не теоретик: 4 разобранных документа → общие паттерны → чек-лист. LLM разбирает каждый документ отдельно, ищет что отличает сильную работу от слабой, потом сводит все находки и оставляет только то, что повторяется в большинстве — не индивидуальные причуды одного автора, а настоящий стандарт профессии. Прикол: LLM плохо придумывает нормы с нуля, но отлично находит общее в нескольких текстах — метод просто использует эту сильную сторону вместо слабой.

Почему работает

LLM не знает неявных профессиональных норм — они нигде не прописаны, просто передаются внутри цеха от практика к практику. Спросишь напрямую — получишь усреднённые по интернету книжные представления. Зато сравнивать несколько текстов и находить общее — это её конёк. Метод не просит модель придумать стандарты, а просит извлечь закономерности из реальных примеров — отсюда разница в покрытии скрытых норм: 78% против 99%.

Когда применять

Оценка качества профессиональной работы → конкретно для нишевых задач с неявными стандартами: due diligence отчёты, актуарные заключения, налоговые меморандумы, юридические заключения. Особенно когда общий промпт «оцени качество» выдаёт расплывчатые критерии типа «глубокий анализ». НЕ подходит для массовых жанров — маркетинговые тексты, типовые письма — там обычный промпт справится почти так же хорошо.

Мини-рецепт

1. Собери документы: минимум 3-4 реальных примера от разных авторов или компаний — иначе получишь стиль одного человека, а не стандарт профессии.
2. Разбери каждый отдельно: попроси LLM выделить структуру, глубину анализа, профессиональные приёмы — на каждый документ свой разбор.
3. Сведи в паттерны: оставь только то, что повторяется в большинстве документов, отбрось индивидуальные причуды.
4. Собери чек-лист: 15-25 конкретных проверяемых пунктов с весами и 2-3 стоп-условиями — критичные ошибки, которые обесценивают всю работу.
5. Проверь на контрасте: приложи чек-лист к сильному и слабому примеру — если баллы не отличаются, критерии слишком общие, возвращайся на шаг 4.

Примеры

[ПЛОХО] : Оцени качество этого due diligence отчёта и скажи, что нужно улучшить
[ХОРОШО] : Вот 4 реальных due diligence отчёта от разных консалтинговых компаний. Разбери каждый отдельно, найди паттерны, которые повторяются в большинстве, и собери из них чек-лист из 20 пунктов с весами и стоп-условиями
Источник: FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables
ArXiv ID: 2608.04077 | Сгенерировано: 2026-08-06 04:28

Проблемы LLM

ПроблемаСутьКак обойти
Модель не знает неявных профессиональных стандартовПопросишь оценить нишевый документ — заключение актуария, due diligence отчёт, налоговый меморандум. Модель выдаёт общие, усреднённые критерии из интернета. Внутрицеховые нормы, которые нигде явно не прописаны, она не знает. Чек-лист получается поверхностнымНе проси модель придумать критерии с нуля. Дай ей 3-5 реальных документов от практиков и попроси извлечь паттерны из них

Методы

МетодСуть
Чек-лист из реальных документов вместо чек-листа из головы моделиСобери 3-5+ реальных примеров работы от разных авторов. Попроси LLM разобрать каждый отдельно: структура, глубина анализа, профессиональные приёмы. Затем свести паттерны — оставить только то, что повторяется в большинстве документов, а не индивидуальные особенности одного автора. Превратить это в конкретный проверяемый чек-лист с весами и стоп-условиями. Разбери каждый документ сведи паттерны по частоте синтезируй чек-лист проверь на сильном/слабом примере. Почему работает: модель плохо знает скрытые нормы профессии, но отлично находит общее между несколькими текстами. Когда да: узкая профессиональная задача, есть 3+ реальных примера от разных источников. Когда нет: массовый распространённый жанр (обычный промпт справится не хуже), нет доступа к реальным документам (метод превращается в обычный промпт-инжиниринг)
📖 Простыми словами

FinProBench: Evaluating FinancialAIAgentswith Role-Grounded Rubrics Derived from Professional Deliverables

arXiv: 2608.04077

Суть метода RGRC в том, что нейросети наконец-то перестали спрашивать, как «правильно» делать работу, и начали смотреть, как её делают живые профи. Раньше оценка качества отчетов или аналитики была гаданием на кофейной гуще: мы просили модель оценить текст, и она выдавала вежливую, но бесполезную чушь, опираясь на свои усредненные знания из интернета. Теперь подход изменился — мы скармливаем модели пачку реальных документов, написанных крутыми спецами, и заставляем её вытащить оттуда неявные стандарты. Это позволяет создать жесткий чек-лист, который оценивает не грамотность, а профессиональную пригодность.

Это как если бы вы пытались научить стажера отличать хороший коньяк от плохого по учебнику химии. Формально всё верно, но вкус не передать. Вместо этого вы даете ему попробовать десять элитных образцов и просите составить список признаков, которые их объединяют. В итоге вместо абстрактного «должно быть вкусно» получается конкретный список: цвет, плотность, послевкусие. Модель перестает фантазировать о качестве и начинает видеть структуру там, где раньше был просто текст.

В основе лежат ролевые рубрики (Role-Grounded Rubrics). Метод работает просто: берется массив реальных профессиональных артефактов, и из них выжимаются повторяющиеся паттерны. Если в каждом успешном отчете по due diligence есть анализ скрытых рисков и оценка ликвидности, модель заносит это в чек-лист с высоким приоритетом. В итоге получается проверяемый список с весами, где за отсутствие критически важного раздела модель нещадно снижает баллы, даже если текст написан очень красиво.

Хотя метод обкатывали на финансах в рамках бенчмарка FinProBench, принцип абсолютно универсален. Его можно натравить на юридические договоры, медицинские заключения или даже технические задания для программистов. Везде, где есть «цеховые стандарты», которые не прописаны в учебниках, но понятны экспертам, RGRC сработает как фильтр. Это переход от оценки «нравится — не нравится» к объективному аудиту на основе реального опыта, а не галлюцинаций нейросети.

Главный вывод: хватит надеяться, что AI сам поймет, что такое «хороший результат». Нужно брать эталоны из реального мира и превращать их в автоматизированные чек-листы. Если вы оцениваете работу аналитиков или других нейросетей по общим промптам, вы получаете посредственность. RGRC позволяет зашить экспертизу лучших сотрудников в алгоритм оценки, чтобы отсеивать профессиональную лажу еще на подлете. Кто не внедрит такие жесткие фильтры, утонет в потоке убедительно написанного, но абсолютно пустого контента.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с