3,583 papers
arXiv:2610.05094 81 4 окт. 2026 г. PRO

LLM-судья: что в промпте оценщика реально меняет вердикт, а что нет

КЛЮЧЕВАЯ СУТЬ
Судья ошибается так же часто, но в другую сторону: сменил шкалу, и он начинает чаще пропускать неверные ответы как верные. Набор правил для промпта позволяет собрать LLM-судью (языковую модель, которая ставит оценки чужим текстам) с отклонением от людей меньше примерно на треть. Фишка: шкала 0–100 и три разные модели вместо одной снимают перекосы, которые один судья тащит за собой. Подробные якоря шкалы (описания, что значит каждый диапазон) и примеры нужны только на спорных критериях вроде токсичности.
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с