TL;DR
JEV-as-a-Judge — это каскад из двух судей. Первый, дешёвый, не пишет рассуждение. Он сразу выдаёт вердикт и вероятность по каждому варианту ответа. Если самая высокая вероятность выше порога, вердикт принимается. Если ниже, задача уходит дорогому судье, который рассуждает.
Главная находка: дешёвый судья хорошо справляется там, где вердикт можно прочитать из текста. Это тон ответа, отказ на вредный запрос, соответствие ответа источнику, общее «какой из двух ответов лучше». Там он почти не уступает топовой модели. Но там, где вердикт нужно вывести, он ошибается: в математике, коде, логических задачах. Мысленно прогнать решение он не может, потому что рассуждения нет. При этом его уверенность сама показывает границу. Когда она высокая, дешёвый и дорогой судьи почти всегда согласны. Когда низкая, как раз начинаются те самые трудные случаи.
Суть метода в трёх шагах: дешёвый судья даёт вердикт и вероятности, порог уверенности подбирается по небольшой ручной разметке (около 100 примеров), всё, что ниже порога, уходит сильной модели. В исследовании такой каскад оказался чуть точнее одного дорогого судьи при примерно 40% его стоимости.
Схема метода
ШАГ 0 (разово): разметить ~100 примеров своей задачи вручную → эталон для порога
ШАГ 1: дешёвый судья → вердикт + вероятность каждой метки, без объяснений
ШАГ 2: уверенность (макс. вероятность) ≥ порога? → принять вердикт
ШАГ 3: уверенность < порога → отдать задачу сильному судью с рассуждением → его вердикт финальный
Для парных сравнений («какой ответ лучше») дешёвого судью просят дважды, меняя ответы местами. Уверенность усредняется по обоим порядкам. Если порядок меняет вердикт, это красный флаг.
Пример применения
Задача: Команда поддержки маркетплейса переписала промпт бота. Каждый день нужно сравнивать старые и новые ответы бота на тысячах обращений. Считать всё через «думающую» модель дорого. Большая часть обращений простая: вежливость, отказ на странную просьбу, ответ по правилам возврата. Но встречаются и расчётные: «сколько вернут за два товара с купоном и баллами».
Промпт (для дешёвой модели-судьи):
Ты судья качества ответов бота поддержки интернет-магазина.
Обращение клиента:
«Заказал две куртки по 6 400 ₽, одна не подошла. Оплатил с промокодом на 10% и баллами 500. Сколько мне вернут за одну?»
Ответ A: «Вернём стоимость куртки с учётом скидки по промокоду и списанных баллов. Точную сумму увидите в заказе после оформления возврата.»
Ответ B: «Вернём 6 400 ₽ на карту в течение 3 дней.»
Критерий: какой ответ точнее и честнее по правилам магазина (возврат считается с учётом промокода и баллов).
Верни ТОЛЬКО JSON, без объяснений:
{"verdict": "A" | "B", "prob_A": число от 0 до 1, "prob_B": число от 0 до 1}
Результат: Дешёвый судья ответит одной строкой JSON: вердикт и вероятности. Лёгкие сравнения вроде вежливости или отказа он закроет сам. Расчётные случаи вроде этого купона часто придут с низкой уверенностью. Они пойдут по правилу эскалации к сильной модели, которая посчитает пошагово.
Почему это работает
Слабость. Судья без рассуждения выдаёт ответ «с лёту». Если для вердикта нужно пересчитать, проверить код или пройти логическую цепочку, делать ему это негде. Он угадывает по внешним признакам. Отсюда провал в математике, коде и логике. Дорогой судья, который рассуждает, надёжнее, но платить за рассуждение на каждой простой задаче расточительно.
Сильная сторона. Большинство реальных задач оценки лёгкие. На примерах, где все остальные судьи были правы, дешёвый судья тоже почти не ошибается. А его уверенность неплохо отделяет лёгкое от трудного: в зоне высокой уверенности он практически равен топовой модели.
Как метод это использует. Каскад платит за рассуждение только там, где дешёвый судья сам «чувствует» неуверенность. Порог выбирают не по среднему значению, а по нижней границе доверительного интервала на небольшой разметке. Так меньше шанс случайно выставить слишком оптимистичный порог.
Рычаги управления: - Порог уверенности — выше: больше эскалаций, точнее, дороже. Ниже: дешевле, но риск ошибок растёт. - Свой порог на каждую задачу — отдельная калибровка по каждому типу задач снижает риск потерять больше двух пунктов точности с ~5% до менее 1%. - Два порядка ответов — усредняйте уверенность по двум порядкам. Если они расходятся, это сигнал эскалировать. - Объём разметки — около 100 размеченных примеров на задачу уже сильно снижают риск неудачного порога.
Шаблон промпта
Ты — судья. Твоя задача — вынести вердикт, а не рассуждать.
<Контекст>
{описание_задачи_и_критерия}
Контекст>
<Варианты>
{список_допустимых_меток}
Варианты>
<Материал>
{вопрос_или_обращение}
{ответ_A}
{ответ_B}
Материал>
<Формат_вывода>
Верни ТОЛЬКО JSON без текста вокруг:
{"verdict": "<одна из меток>", "probs": {"<метка_1>": число, "<метка_2>": число}}
Сумма вероятностей = 1. Вероятность — твоя честная уверенность в метке.
Формат_вывода>
Правило эскалации (применяется вне промпта или в автоматизации):
Если max(probs) >= {порог} → принять verdict
Если max(probs) < {порог} → отправить сильной модели с просьбой рассуждать по шагам
Для пар: запустить дважды, поменяв A и B местами; если вердикты расходятся → эскалация
{описание_задачи_и_критерия}— что именно считается «лучше»: точность, тон, соответствие правилам.{список_допустимых_меток}— например, A / B, или «подтверждается» / «не подтверждается».{порог}— стартуйте около 0,9. Затем подберите по своим ~100 размеченным примерам.
🚀 Быстрый старт — вставь в чат:
Вот шаблон судьи с вердиктом и вероятностями. Адаптируй под мою задачу: [твоя задача оценки].
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, что именно считается хорошим ответом, какие метки допустимы и бывают ли в задаче расчёты или проверка кода. Расчёты и код нужны, чтобы сразу решить, какие случаи отправлять сильной модели без попытки дёшево.
Ограничения
⚠️ Вывод вместо чтения: на математике, коде, логических задачах и экспертных вопросах дешёвый судья заметно хуже сильного. Человеческая проверка спорных случаев в основном встала на сторону сильной модели.
⚠️ Красивый, но неверный ответ: когда неправильный ответ написан более развёрнуто и изящно, дешёвый судья ошибается чаще, а его уверенность хуже выявляет эти ошибки.
⚠️ Проза без эталона: оценка текста без опорного ответа или источника близка к случайной у всех протестированных судей, причём они остаются уверенными. Порог уверенности здесь не спасает.
⚠️ Вербализованные вероятности: в исследовании у большинства сравнивавшихся судей вероятности «проговаривались» текстом. Такая уверенность не откалибрована. У JEV вероятности возвращает сам сервис. Если вы просите вероятности у обычной модели в чате, проверяйте на своих данных, что высокая уверенность действительно значит высокую точность.
⚠️ Нужна разметка и код: порог нужно подбирать на ~100 примерах вашей задачи, а сам каскад нужно собрать в автоматизации или скрипте. JEV — закрытый платный сервис, а не обычный промпт.
Как исследовали
Исследователи собрали шестнадцать судей против JEV: четырнадцать генеративных моделей и две модели-награды (reward models). Все отвечали по одному контракту: вердикт и вероятности, без рассуждения. Проверяли на ~5 тысячах оценок: парные предпочтения (RewardBench, JudgeBench), проверка фактов по источнику (HaluEval) и итоговые ответы. Стоимость и задержку меряли отдельно на фиксированной выборке.
Результат получился неоднородным. На задачах «прочитать и решить» JEV отстаёт от GPT-6 примерно на два-три пункта, при этом он в сотни раз дешевле и в разы быстрее. На JudgeBench (математика, код, логика) разрыв около 15 пунктов. Слепая человеческая проверка спорных случаев подтвердила, что это не шум в разметке: выводы в пользу сильного судьи были убедительными.
Главный тест каскада: порог заморозили заранее по пилотной выборке и проверили на 1 610 новых парах. Каскад эскалировал около 31% пар и оказался на 0,9 пункта точнее GPT-6 при 41% его цены. Затем провели предрегистрированный живой тест на двух совершенно новых наборах (570 пар), где JEV один отстаёт на 14 пунктов. Каскад эскалировал 74% пар и сравнялся с GPT-6 по точности, сэкономив четверть стоимости. Инсайт для практики: порог по нижней границе доверия на малой разметке честно «признаёт», когда задача трудная, и эскалирует много, вместо того чтобы экономить в ущерб качеству.
Адаптации и экстраполяции
🔧 Техника: убрать запрет на объяснения → отладка судьи
Замените в формате вывода «ТОЛЬКО JSON» на JSON плюс поле "reason" в одну строку. Это не для боевого режима: так вы увидите, почему дешёвый судья выбрал вердикт, и найдёте типы задач, где он системно ошибается.
Экстраполяция: правило маршрутизации без вероятностей. В автоматизации без кода (Make, n8n) можно заранее разделить входящие задачи по типу: «читаемые» отдавать дешёвой модели, «вычисляемые» (расчёты, код, логика) сразу сильной. Статья показывает, что граница проходит именно по этому признаку. Добавьте для пар двойной прогон с обменом порядка: расхождение само по себе отправляет задачу вверх.
Ресурсы
- JEV-as-a-Judge: Accept When Confident, Escalate When Unsure — Yubo Li, Yidi Miao, Ramayya Krishnan, Rema Padman, Carnegie Mellon University.
- Упомянутые бенчмарки: RewardBench, JudgeBench, HaluEval, RM-Bench, PPE.
- Смежные работы: FrugalGPT (каскады моделей), RouteLLM, Autorubric (Rao & Callison-Burch).
- Сервис: TypeSafe JEV (TypeSafe AI).
