3,583 papers
arXiv:2609.26550 70 22 сент. 2026 г. FREE

JEV-as-a-Judge: дешёвый судья отвечает сам, когда уверен, и зовёт дорогого, когда сомневается

КЛЮЧЕВАЯ СУТЬ
Два судей вместо одного дают чуть большую точность, чем один дорогой, и стоят около 40% его цены. Метод позволяет проверять тысячи ответов бота или модели каждый день и не платить за рассуждения там, где они не нужны. Дешёвый судья вообще не рассуждает. Он сразу выдаёт вердикт и вероятность по каждому варианту. Фишка: уверенность дешёвого судьи сама показывает, где задача лёгкая, а где трудная. Высокая уверенность значит, что дешёвый и дорогой судьи почти всегда согласны. Низкая уверенность значит, что задачу нужно отдать сильному судье с рассуждением.
Адаптировать под запрос
⚡

TL;DR

JEV-as-a-Judge — это каскад из двух судей. Первый, дешёвый, не пишет рассуждение. Он сразу выдаёт вердикт и вероятность по каждому варианту ответа. Если самая высокая вероятность выше порога, вердикт принимается. Если ниже, задача уходит дорогому судье, который рассуждает.

Главная находка: дешёвый судья хорошо справляется там, где вердикт можно прочитать из текста. Это тон ответа, отказ на вредный запрос, соответствие ответа источнику, общее «какой из двух ответов лучше». Там он почти не уступает топовой модели. Но там, где вердикт нужно вывести, он ошибается: в математике, коде, логических задачах. Мысленно прогнать решение он не может, потому что рассуждения нет. При этом его уверенность сама показывает границу. Когда она высокая, дешёвый и дорогой судьи почти всегда согласны. Когда низкая, как раз начинаются те самые трудные случаи.

Суть метода в трёх шагах: дешёвый судья даёт вердикт и вероятности, порог уверенности подбирается по небольшой ручной разметке (около 100 примеров), всё, что ниже порога, уходит сильной модели. В исследовании такой каскад оказался чуть точнее одного дорогого судьи при примерно 40% его стоимости.


🔬

Схема метода

ШАГ 0 (разово): разметить ~100 примеров своей задачи вручную → эталон для порога
ШАГ 1: дешёвый судья → вердикт + вероятность каждой метки, без объяснений
ШАГ 2: уверенность (макс. вероятность) ≥ порога? → принять вердикт
ШАГ 3: уверенность < порога → отдать задачу сильному судью с рассуждением → его вердикт финальный

Для парных сравнений («какой ответ лучше») дешёвого судью просят дважды, меняя ответы местами. Уверенность усредняется по обоим порядкам. Если порядок меняет вердикт, это красный флаг.


🚀

Пример применения

Задача: Команда поддержки маркетплейса переписала промпт бота. Каждый день нужно сравнивать старые и новые ответы бота на тысячах обращений. Считать всё через «думающую» модель дорого. Большая часть обращений простая: вежливость, отказ на странную просьбу, ответ по правилам возврата. Но встречаются и расчётные: «сколько вернут за два товара с купоном и баллами».

Промпт (для дешёвой модели-судьи):

Ты судья качества ответов бота поддержки интернет-магазина.

Обращение клиента:
«Заказал две куртки по 6 400 ₽, одна не подошла. Оплатил с промокодом на 10% и баллами 500. Сколько мне вернут за одну?»

Ответ A: «Вернём стоимость куртки с учётом скидки по промокоду и списанных баллов. Точную сумму увидите в заказе после оформления возврата.»
Ответ B: «Вернём 6 400 ₽ на карту в течение 3 дней.»

Критерий: какой ответ точнее и честнее по правилам магазина (возврат считается с учётом промокода и баллов).

Верни ТОЛЬКО JSON, без объяснений:
{"verdict": "A" | "B", "prob_A": число от 0 до 1, "prob_B": число от 0 до 1}

Результат: Дешёвый судья ответит одной строкой JSON: вердикт и вероятности. Лёгкие сравнения вроде вежливости или отказа он закроет сам. Расчётные случаи вроде этого купона часто придут с низкой уверенностью. Они пойдут по правилу эскалации к сильной модели, которая посчитает пошагово.


🧠

Почему это работает

Слабость. Судья без рассуждения выдаёт ответ «с лёту». Если для вердикта нужно пересчитать, проверить код или пройти логическую цепочку, делать ему это негде. Он угадывает по внешним признакам. Отсюда провал в математике, коде и логике. Дорогой судья, который рассуждает, надёжнее, но платить за рассуждение на каждой простой задаче расточительно.

Сильная сторона. Большинство реальных задач оценки лёгкие. На примерах, где все остальные судьи были правы, дешёвый судья тоже почти не ошибается. А его уверенность неплохо отделяет лёгкое от трудного: в зоне высокой уверенности он практически равен топовой модели.

Как метод это использует. Каскад платит за рассуждение только там, где дешёвый судья сам «чувствует» неуверенность. Порог выбирают не по среднему значению, а по нижней границе доверительного интервала на небольшой разметке. Так меньше шанс случайно выставить слишком оптимистичный порог.

Рычаги управления: - Порог уверенности — выше: больше эскалаций, точнее, дороже. Ниже: дешевле, но риск ошибок растёт. - Свой порог на каждую задачу — отдельная калибровка по каждому типу задач снижает риск потерять больше двух пунктов точности с ~5% до менее 1%. - Два порядка ответов — усредняйте уверенность по двум порядкам. Если они расходятся, это сигнал эскалировать. - Объём разметки — около 100 размеченных примеров на задачу уже сильно снижают риск неудачного порога.


📋

Шаблон промпта

Ты — судья. Твоя задача — вынести вердикт, а не рассуждать.

<Контекст>
{описание_задачи_и_критерия}


<Варианты>
{список_допустимых_меток}


<Материал>
{вопрос_или_обращение}
{ответ_A}
{ответ_B}


<Формат_вывода>
Верни ТОЛЬКО JSON без текста вокруг:
{"verdict": "<одна из меток>", "probs": {"<метка_1>": число, "<метка_2>": число}}
Сумма вероятностей = 1. Вероятность — твоя честная уверенность в метке.

Правило эскалации (применяется вне промпта или в автоматизации):

Если max(probs) >= {порог}  → принять verdict
Если max(probs) <  {порог}  → отправить сильной модели с просьбой рассуждать по шагам
Для пар: запустить дважды, поменяв A и B местами; если вердикты расходятся → эскалация
  • {описание_задачи_и_критерия} — что именно считается «лучше»: точность, тон, соответствие правилам.
  • {список_допустимых_меток} — например, A / B, или «подтверждается» / «не подтверждается».
  • {порог} — стартуйте около 0,9. Затем подберите по своим ~100 размеченным примерам.

🚀 Быстрый старт — вставь в чат:

Вот шаблон судьи с вердиктом и вероятностями. Адаптируй под мою задачу: [твоя задача оценки]. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, что именно считается хорошим ответом, какие метки допустимы и бывают ли в задаче расчёты или проверка кода. Расчёты и код нужны, чтобы сразу решить, какие случаи отправлять сильной модели без попытки дёшево.


⚠️

Ограничения

⚠️ Вывод вместо чтения: на математике, коде, логических задачах и экспертных вопросах дешёвый судья заметно хуже сильного. Человеческая проверка спорных случаев в основном встала на сторону сильной модели.

⚠️ Красивый, но неверный ответ: когда неправильный ответ написан более развёрнуто и изящно, дешёвый судья ошибается чаще, а его уверенность хуже выявляет эти ошибки.

⚠️ Проза без эталона: оценка текста без опорного ответа или источника близка к случайной у всех протестированных судей, причём они остаются уверенными. Порог уверенности здесь не спасает.

⚠️ Вербализованные вероятности: в исследовании у большинства сравнивавшихся судей вероятности «проговаривались» текстом. Такая уверенность не откалибрована. У JEV вероятности возвращает сам сервис. Если вы просите вероятности у обычной модели в чате, проверяйте на своих данных, что высокая уверенность действительно значит высокую точность.

⚠️ Нужна разметка и код: порог нужно подбирать на ~100 примерах вашей задачи, а сам каскад нужно собрать в автоматизации или скрипте. JEV — закрытый платный сервис, а не обычный промпт.


🔍

Как исследовали

Исследователи собрали шестнадцать судей против JEV: четырнадцать генеративных моделей и две модели-награды (reward models). Все отвечали по одному контракту: вердикт и вероятности, без рассуждения. Проверяли на ~5 тысячах оценок: парные предпочтения (RewardBench, JudgeBench), проверка фактов по источнику (HaluEval) и итоговые ответы. Стоимость и задержку меряли отдельно на фиксированной выборке.

Результат получился неоднородным. На задачах «прочитать и решить» JEV отстаёт от GPT-6 примерно на два-три пункта, при этом он в сотни раз дешевле и в разы быстрее. На JudgeBench (математика, код, логика) разрыв около 15 пунктов. Слепая человеческая проверка спорных случаев подтвердила, что это не шум в разметке: выводы в пользу сильного судьи были убедительными.

Главный тест каскада: порог заморозили заранее по пилотной выборке и проверили на 1 610 новых парах. Каскад эскалировал около 31% пар и оказался на 0,9 пункта точнее GPT-6 при 41% его цены. Затем провели предрегистрированный живой тест на двух совершенно новых наборах (570 пар), где JEV один отстаёт на 14 пунктов. Каскад эскалировал 74% пар и сравнялся с GPT-6 по точности, сэкономив четверть стоимости. Инсайт для практики: порог по нижней границе доверия на малой разметке честно «признаёт», когда задача трудная, и эскалирует много, вместо того чтобы экономить в ущерб качеству.


💡

Адаптации и экстраполяции

🔧 Техника: убрать запрет на объяснения → отладка судьи

Замените в формате вывода «ТОЛЬКО JSON» на JSON плюс поле "reason" в одну строку. Это не для боевого режима: так вы увидите, почему дешёвый судья выбрал вердикт, и найдёте типы задач, где он системно ошибается.

Экстраполяция: правило маршрутизации без вероятностей. В автоматизации без кода (Make, n8n) можно заранее разделить входящие задачи по типу: «читаемые» отдавать дешёвой модели, «вычисляемые» (расчёты, код, логика) сразу сильной. Статья показывает, что граница проходит именно по этому признаку. Добавьте для пар двойной прогон с обменом порядка: расхождение само по себе отправляет задачу вверх.


🔗

Ресурсы

  • JEV-as-a-Judge: Accept When Confident, Escalate When Unsure — Yubo Li, Yidi Miao, Ramayya Krishnan, Rema Padman, Carnegie Mellon University.
  • Упомянутые бенчмарки: RewardBench, JudgeBench, HaluEval, RM-Bench, PPE.
  • Смежные работы: FrugalGPT (каскады моделей), RouteLLM, Autorubric (Rao & Callison-Burch).
  • Сервис: TypeSafe JEV (TypeSafe AI).

📋 Дайджест исследования

Ключевая суть

Два судей вместо одного дают чуть большую точность, чем один дорогой, и стоят около 40% его цены. Метод позволяет проверять тысячи ответов бота или модели каждый день и не платить за рассуждения там, где они не нужны. Дешёвый судья вообще не рассуждает. Он сразу выдаёт вердикт и вероятность по каждому варианту. Фишка: уверенность дешёвого судьи сама показывает, где задача лёгкая, а где трудная. Высокая уверенность значит, что дешёвый и дорогой судьи почти всегда согласны. Низкая уверенность значит, что задачу нужно отдать сильному судье с рассуждением.

Принцип работы

Работает как сортировка на входе. Дешёвый судья не пишет объяснений, только JSON с вердиктом и вероятностями. Берём самую высокую вероятность. Выше порога? Принимаем вердикт. Ниже? Задача уходит дорогой модели, которая считает пошагово. Для пар «какой ответ лучше» запускай судью дважды, поменяв A и B местами. Уверенность усредняется по двум запускам. Если вердикт поменялся от порядка, это красный флаг. Дешёвый судья молчит и ставит цифры, а его уверенность решает, кто судит дальше. Это как дежурный врач в приёмной. Простые случаи он закрывает сам. Сложные отправляет к профессору.

Почему работает

Дешёвый судья читает вердикт из текста. Тон, отказ на вредную просьбу, соответствие ответа источнику, общее «какой лучше». Тут он почти не уступает топовой модели. Когда вердикт нужно вывести, он плывёт. Математика, код, логика. Прогнать решение в уме ему негде, рассуждения нет. Он угадывает по внешним признакам. Большинство реальных задач оценки лёгкие, а трудные выдаёт низкая уверенность. Так платишь за рассуждение только там, где оно нужно. Порог берут не по среднему, а по нижней границе доверительного интервала на размеченных примерах. Так меньше шанс поставить слишком оптимистичный порог. Отдельный порог на каждый тип задач режет риск потерять больше двух пунктов точности с ~5% до менее 1%. Хватает около 100 размеченных примеров. Честно про минусы. Красиво написанный, но неверный ответ дешёвый судья пропускает чаще. Оценка прозы без эталона у всех судей близка к случайной, при этом они остаются уверенными. Порог тут не спасает.

Когда применять

Массовая проверка ответов ботов и ассистентов → сравнение старой и новой версии промпта на тысячах обращений, особенно когда большинство случаев простые: вежливость, отказ, ответ по правилам, соответствие источнику. НЕ подходит для математики, кода, логических задач и экспертных вопросов. Их лучше сразу отдавать сильной модели. Также не подходит для оценки прозы без эталона или источника.

Мини-рецепт

1. Разметь вручную около 100 примеров своей задачи. Это эталон для подбора порога.
2. Напиши немого судью: критерий, список допустимых меток, ответ только в JSON с вероятностями. Просить объяснения нельзя.
3. Для пар запускай дважды, поменяв ответы местами. Вердикты разошлись? Сразу эскалация.
4. Начни с порога 0,9. Потом подбери его по своей разметке и смотри на нижнюю границу точности, а не на среднюю.
5. Всё ниже порога отправляй сильной модели с просьбой рассуждать по шагам. Её вердикт финальный.
6. Расчёты и проверку кода отправляй сильной модели сразу, без попытки подешевле.
7. Проверь вероятности. У JEV их возвращает сам сервис. Если просишь вероятности у обычной чат-модели, убедись на своих данных, что высокая уверенность действительно значит высокую точность. Метод при этом закрытый и платный, поэтому каскад придётся собирать скриптом самому.

Примеры

[ПЛОХО] : Сравни два ответа бота поддержки и скажи, какой лучше. Объясни подробно.
[ХОРОШО] : Ты судья ответов бота поддержки. Не рассуждай, вынеси вердикт. Критерий: какой ответ точнее по правилам магазина (возврат считается с учётом промокода и баллов). Обращение: «Купил две куртки по 6 400 ₽, одна не подошла. Был промокод на 10% и 500 баллов. Сколько вернут за одну?» Ответ A: «Вернём стоимость с учётом промокода и баллов, точную сумму увидите в заказе.» Ответ B: «Вернём 6 400 ₽ в течение 3 дней.» Верни ТОЛЬКО JSON: {"verdict": "A" или "B", "prob_A": число от 0 до 1, "prob_B": число от 0 до 1} Дальше правило в скрипте: Если max(prob) >= 0.9, принять вердикт. Иначе отправить сильной модели с просьбой считать по шагам. Вежливость и отказы дешёвый судья закроет сам. Расчётные случаи вроде купона с баллами чаще придут с низкой уверенностью и уйдут к сильной модели.
Источник: JEV-as-a-Judge: Accept When Confident, Escalate When Unsure
ArXiv ID: 2609.26550 | Сгенерировано: 2026-10-07 09:00

Проблемы LLM

ПроблемаСутьКак обойти
Модель без рассуждений плохо проверяет то, что надо вывестиПросишь вердикт сразу, без объяснений. Если ответ лежит в тексте, всё хорошо. Это тон, отказ, соответствие источнику, общее «что лучше». Если ответ надо вычислить, проверить код или пройти логическую цепочку, модель угадывает по внешним признакам. Мысленно прогнать решение ей негде. Вердикт выглядит уверенно, но может быть невернымРаздели задачи на два типа: «прочитать» и «вывести». Для «прочитать» хватает дешёвой модели с коротким ответом. Для «вывести» (расчёты, код, логика) сразу бери сильную модель и проси рассуждать по шагам. Если типы смешаны, используй каскад из блока «Методы»
Оценка текста без эталона близка к случайной, а модель уверенаПросишь оценить прозу, у которой нет опорного ответа или источника. Модель всё равно выдаёт чёткий вердикт и высокую уверенность. Но совпадение с реальным качеством почти случайное. Порог уверенности тут не помогаетДай модели опору: эталонный ответ, исходный текст или чёткие критерии по пунктам. Без опоры не доверяй высокой уверенности. Проверяй часть вердиктов вручную

Методы

МетодСуть
Каскад «дешёвый судья → сильный судья» по порогу уверенности — та же точность за ~40% ценыЧто делать. Дешёвой модели дай задачу без рассуждений. Пусть вернёт вердикт и вероятность каждого варианта: {"verdict": "A", "prob_A": 0.93, "prob_B": 0.07}. Если максимальная вероятность не ниже порога, прими вердикт. Если ниже, отправь задачу сильной модели с просьбой рассуждать по шагам. Её вердикт финальный. Как подобрать порог. Размети вручную около 100 примеров своей задачи. Выбирай порог не по средней точности, а по нижней границе доверительного интервала. Так меньше шанс взять слишком оптимистичный порог. Стартовое значение — около 0,9. Для разных типов задач подбирай порог отдельно. Парные сравнения. Запусти дважды, поменяв ответы местами. Усредни уверенность. Если вердикт поменялся, отправляй сильной модели. Почему работает. Большинство задач оценки лёгкие, и там дешёвая модель почти не ошибается. Рассуждения нужны только на трудной части. Низкая уверенность как раз отмечает эту часть. Когда да: много однотипных оценок, часть из них простая, есть разметка для порога. Когда нет: почти все задачи на вывод (тогда сразу сильная модель). Задачи без эталона, где уверенность ничего не значит. Важно: вероятности, которые модель «проговаривает» в чате, часто не откалиброваны. Перед использованием проверь на своей разметке, что высокая уверенность правда значит высокую точность

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с