3,583 papers
arXiv:2608.07813 80 7 авг. 2026 г. FREE

EL-DGR (Evidence-Locked Derive-Gate-Repair): судья без права переписывать консенсус без доказательства

КЛЮЧЕВАЯ СУТЬ
Судье-ИИ дали полную власть выбирать лучший ответ из нескольких — и он почти не обошёл простое голосование большинством, а в одном тесте проиграл случайному первому ответу без всякой оценки. Метод EL-DGR позволяет запретить судье переопределять консенсус без доказательств — теперь он может победить только с 'сертификатом'. Судья должен буквально процитировать источник или пересчитать число — просто 'мне кажется этот вариант лучше' больше не работает.
Адаптировать под запрос

TL;DR

Когда просишь LLM выбрать лучший вариант ответа из нескольких, она чаще всего работает хуже простого голосования большинством — иногда даже на 10 пунктов хуже, при этом уверенно и убедительно. EL-DGR — правило, которое не улучшает самого судью, а ограничивает его полномочия: судья может переопределить мнение большинства только если приложит точную цитату-доказательство из источника, подтверждающую свой выбор.

Проблема в том, что когда просишь модель оценить ответ одной оценкой "хорошо/плохо" или "выбери лучший", она смешивает в одну цифру разные вещи: логичность рассуждения и фактическую точность. Из-за этого получается парадокс: цепочка "ЧМ-2022 прошёл в Катаре → столица Катара Дубай → ответ: Дубай" звучит логично и связно, хотя второй шаг фактически неверен (столица Катара — Доха). Судья ставит высокую оценку за "гладкость", а ошибку не видит — потому что оценка не показывает, из-за чего именно она получилась высокой.

EL-DGR решает это, вводя иерархию приоритетов вместо одной оценки: по умолчанию побеждает консенсус (большинство одинаковых ответов). Судья может его перебить — но только если приведёт точную цитату из источника, которая подтверждает его выбор, а у консенсуса такой цитаты нет. Если ни один вариант не подтверждён — генерируется новая, дополнительно проверенная попытка ("ремонт").

🔬

Схема метода

ШАГ 1: Сгенерировать N вариантов ответа на вопрос → пронумерованный список кандидатов
ШАГ 2: Для каждого кандидата проверить — есть ли точная (verbatim) цитата в источнике, подтверждающая его ответ → метка "подтверждён / не подтверждён"
ШАГ 3: Определить консенсус — какой ответ встречается чаще всего среди кандидатов
ШАГ 4: Применить правило по порядку (не суммировать критерии!):
   → консенсус подтверждён → берём консенсус
   → консенсус не подтверждён, но другой кандидат подтверждён → берём его (с цитатой)
   → никто не подтверждён → генерируем и проверяем новый ответ ("ремонт"); если он подтверждён — берём его, иначе — честно говорим "недостаточно доказательств"

Все шаги можно выполнить в рамках одного развёрнутого промпта или через 2-3 последовательных запроса в чате.


🚀

Пример применения

Задача: Юрист или предприниматель заливает в чат договор аренды офиса (или ипотечный договор) и спрашивает: "Какая неустойка за просрочку платежа?" — модель при повторных попытках иногда путается и даёт разные цифры.

Промпт:

Вот текст договора:
{текст_договора}

Вопрос: какая неустойка предусмотрена за просрочку арендной платы?

Шаг 1. Дай 3 независимые попытки ответить на вопрос, используя только текст договора. Назови их Кандидат_1, Кандидат_2, Кандидат_3.

Шаг 2. Для каждого кандидата проверь: есть ли в тексте договора БУКВАЛЬНАЯ цитата, подтверждающая его ответ. Приведи цитату или отметь "не подтверждён".

Шаг 3. Определи, какой ответ повторяется чаще (консенсус).

Шаг 4. Реши, какой ответ выдать, строго по порядку:
- если консенсус подтверждён цитатой — верни консенсус
- если консенсус не подтверждён, а другой кандидат подтверждён — верни его с цитатой
- если никто не подтверждён — перечитай договор ещё раз, дай новый ответ и проверь его цитатой. Если и он не подтверждён — напиши "в договоре нет чёткого ответа"

Не выбирай ответ только потому что он звучит увереннее — выбирай только по наличию точной цитаты.

Результат: Модель покажет три варианта ответа, для каждого — цитату из договора или отметку "не найдено", определит, какой ответ повторялся чаще, и по чёткому правилу выдаст финальный ответ с указанием, на какую именно строчку договора она опирается. Если текст договора расплывчатый, модель честно скажет об этом, а не выдумает уверенную неправильную цифру.


🧠

Почему это работает

Когда LLM просят "оцени и выбери лучший вариант" одной шкалой, она сваливает в одно число разные вещи: насколько текст звучит убедительно и насколько он фактически верен. Это создаёт слепую зону — модель ставит высокий балл за красноречие, даже если факт неверный, и ошибка становится невидимой.

Зато модель хорошо умеет делать конкретную, проверяемую операцию — искать точное совпадение текста в источнике (это не оценочное суждение, а сопоставление). EL-DGR использует именно эту сильную сторону: вместо абстрактной оценки "какой ответ лучше" модель делает конкретную проверку "есть ли в тексте такая фраза буквально".

Рычаги управления: - Число кандидатов (N) — больше вариантов = выше шанс найти подтверждённый ответ, но дороже по времени/токенам. Для простых вопросов хватит 2-3. - Строгость сертификата (точная цитата vs пересказ смысла) — жёстче критерий = меньше ошибок, но больше отказов "недостаточно доказательств". Смягчи для творческих/пересказывающих задач. - Что default (консенсус или первый ответ) — можно поменять базовый вариант под свою задачу. - Шаг "ремонт" можно убрать для простых вопросов, где достаточно консенсуса + проверки судьи.


📋

Шаблон промпта

Источник/документ: {текст}
Вопрос: {вопрос}

Шаг 1 — Кандидаты:
Дай {N} независимых попыток ответить на вопрос, используя только текст источника. Назови их Кандидат_1, Кандидат_2...

Шаг 2 — Сертификация:
Для каждого кандидата проверь: есть ли в источнике БУКВАЛЬНАЯ цитата, подтверждающая ответ. Приведи цитату или отметь "не подтверждён".

Шаг 3 — Консенсус:
Найди ответ, который повторяется у большинства кандидатов.

Шаг 4 — Правило выбора (строго по порядку, не смешивай критерии в одну оценку):
- Консенсус подтверждён → верни консенсус.
- Консенсус не подтверждён, но другой кандидат подтверждён → верни его, с цитатой.
- Никто не подтверждён → сгенерируй и проверь новый ответ. Верни его только если он подтверждён, иначе напиши "недостаточно доказательств в источнике".

Никогда не выбирай ответ только за убедительность звучания — выбирай только по наличию цитаты.

Плейсхолдеры: {текст} — документ/статья/отчёт, по которому нужен точный ответ. {вопрос} — сам вопрос. {N} — сколько вариантов ответа генерировать (обычно 3).

🚀 Быстрый старт — вставь в чат:

Вот шаблон правила отбора ответов EL-DGR. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит какой у тебя источник и вопрос, сколько вариантов нужно сгенерировать — потому что без источника и явного вопроса правило "цитата = доказательство" не сработает. Она возьмёт логику страт (консенсус → подтверждённый выбор → ремонт) и подстроит под твою задачу.


⚠️

Ограничения

⚠️ Только для проверяемых фактов: метод работает там, где есть источник с конкретными фактами или числами (договор, отчёт, статья). Для творческих или субъективных задач (оценка стиля текста, идей) цитаты-доказательства не существует — метод неприменим.

⚠️ Строгая цитата теряет верные пересказы: если модель ответила правильно, но своими словами, а не точной цитатой — метод отклонит этот ответ. Это осознанная цена за надёжность.

⚠️ Не улучшает саму генерацию: метод только выбирает среди уже сгенерированных вариантов. Если все варианты изначально плохие — метод не спасёт.

⚠️ Не работает как обучающий сигнал: если попытаться просуммировать все критерии оценки в один вес для "тренировки" модели — эффект нулевой. Работает только как правило отбора после генерации, не как способ сделать модель умнее в целом.


🔍

Как исследовали

Исследователи заморозили пул готовых ответов от четырёх разных обученных моделей на задачах GSM8K (математика) и HotpotQA (вопросы по документам) и сравнили четыре способа выбора финального ответа из этого пула: первый попавшийся, голосование большинством, судья с полной властью и EL-DGR. Судьёй была модель DeepSeek-R1-7B, которая никогда не видела правильный ответ.

Самое неожиданное: на контрольной выборке из 30 вопросов судья с полной властью оказался хуже, чем если бы его вообще не спрашивали — на 10 пунктов ниже голосования большинством, при этом уверенно выставляя оценки каждому варианту. Стоило дать тому же судье те же данные, но ограничить его право переопределять консенсус только доказательством — результат подскочил и стал лучшим среди всех вариантов.

Отдельно исследователи проверили, работает ли разбивка на несколько критериев оценки (логика, факты, уверенность и т.д.) как обучающий сигнал для модели — и это оказалось пустым результатом: точность не изменилась, а проверка "какой критерий важнее" показала, что ни один критерий не является обязательным сам по себе. Вывод: разбивка критериев помогает только когда используется как фильтр допуска, а не когда сводится в одну итоговую цифру для тренировки.


🔗

Ресурсы

When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines — Yiyao Zhang, Diksha Goel, Hussain Ahmad, Shixun Huang, Jun Shen. University of Wollongong, CSIRO's Data61, Adelaide University. NeurIPS 2026 Workshop "Can We Trust the Judge?".


📋 Дайджест исследования

Ключевая суть

Судье-ИИ дали полную власть выбирать лучший ответ из нескольких — и он почти не обошёл простое голосование большинством, а в одном тесте проиграл случайному первому ответу без всякой оценки. Метод EL-DGR позволяет запретить судье переопределять консенсус без доказательств — теперь он может победить только с 'сертификатом'. Судья должен буквально процитировать источник или пересчитать число — просто 'мне кажется этот вариант лучше' больше не работает.

Принцип работы

Правило простое: по умолчанию побеждает ответ большинства. Судья имеет право перебить его — но только если найдёт точную цитату в тексте (для фактов) или сам пересчитает и проверит результат (для математики). Это как в суде — мнение судьи не считается доказательством, нужна улика. Сертификация — не общая оценка 'нравится/не нравится', а бинарная проверка: нашлась цитата или нет.

Почему работает

Модель выставляет одну общую оценку ответу — и в этом числе смешиваются два разных вопроса: звучит ли рассуждение логично, и правда ли это. Классика из статьи: 'ЧМ-2022 в Катаре → столица Катара Дубай' — цепочка звучит гладко, а второй шаг просто неверен (столица — Доха). Судья с одной оценкой не видит разницы между 'логично' и 'правильно' — вот почему он уверенно ошибается. Зато с узкой конкретной проверкой типа 'нашлась цитата или нет' модель справляется отлично — это её реальная сильная сторона, просто её нужно использовать вместо общей оценки.

Когда применять

Работа с фактами и расчётами → извлечение точных цифр из документов (налоговые ставки, юридические тексты, финансовые отчёты), проверка математических вычислений, факт-чекинг по источнику. Особенно важно там, где ошибка стоит денег или репутации. НЕ подходит для творческих задач, оценки стиля или субъективных мнений — там просто нечего цитировать, сертификат не из чего построить.

Мини-рецепт

1. Сгенерируй варианты: попроси модель дать 3-5 независимых ответов на вопрос, каждый на основе разных частей источника.
2. Найди консенсус: какой ответ совпал у большинства — это кандидат по умолчанию.
3. Дай судье слово: пусть модель выберет вариант, который считает лучшим, даже если он отличается от консенсуса.
4. Проверь сертификат: для каждого кандидата (и консенсуса, и выбора судьи) — есть ли точная цитата в тексте или проверяемый пересчёт?
5. Примени порядок: сертифицированный консенсус побеждает первым, судья с сертификатом — вторым, если ничего не подтвердилось — пробуй пересчёт с нуля (ремонт), а если и это не сработало — верни консенсус с пометкой нужна проверка человеком.

Примеры

[ПЛОХО] : Вот 3 варианта ответа на вопрос по тексту закона. Какой из них самый точный?
[ХОРОШО] : Дай 3 варианта ставки налога из текста закона. Определи консенсус (совпавший вариант). Затем выбери как судья лучший вариант. Для каждого варианта найди ТОЧНУЮ цитату из закона, подтверждающую его. Примени правило: сертифицированный консенсус > сертифицированный судья > пересчёт с нуля > консенсус с пометкой 'нужна проверка человеком'.
Источник: When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines
ArXiv ID: 2608.07813 | Сгенерировано: 2026-08-11 05:50

Проблемы LLM

ПроблемаСутьКак обойти
Судья не различает "звучит логично" и "правда"Просишь модель оценить ответ одним числом или дать общее предпочтение. Модель смешивает в этой оценке два разных вопроса: логична ли цепочка рассуждений и верна ли она по факту. Если рассуждение звучит гладко, но содержит фактическую ошибку в середине — модель всё равно ставит высокий балл. Расхождение между "убедительно" и "верно" одним числом не показать. Это работает для любой задачи с оценкой качества: ранжирование ответов, выбор лучшего варианта, фильтрация по "уверенности"Не давай судье права решать единолично. Проверяй его выбор через отдельный узкий критерий: точная цитата из источника или проверяемый пересчёт. Если подтверждения нет — используй ответ большинства (консенсус), а не мнение судьи

Методы

МетодСуть
Заблокированное доказательство (Evidence-Locked Gate) — судья может победить консенсус только с цитатойСгенерируй несколько независимых ответов на вопрос. Найди среди них ответ большинства — это вариант по умолчанию. Отдельно попроси модель выступить судьёй и выбрать лучший вариант, даже если он не совпадает с большинством. Затем проверь каждый вариант (и консенсус, и выбор судьи) на "сертификат": точная цитата из источника для фактов, проверяемый пересчёт для чисел. Правило по порядку: 1) если консенсус подтверждён цитатой — бери его; 2) если консенсус не подтверждён, а выбор судьи подтверждён — бери судью; 3) если ничего не подтверждено — попробуй "ремонт" (пересчитай/перечитай с нуля) и бери его результат, если он подтвердится; 4) иначе — всё равно бери консенсус, но с пометкой "нужна проверка человеком". Почему работает: модель плохо даёт общую оценку "хорошо/плохо", но хорошо делает узкую бинарную проверку "нашлась цитата или нет". Метод отбирает только сильную часть модели. Работает: есть текстовый источник для цитирования или расчёт, который можно перепроверить, нужна защита от уверенных, но неверных ответов. Не работает: творческие задачи, субъективная оценка стиля, задачи без проверяемого источника — там сертификат взять не из чего
📖 Простыми словами

When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection BoundsLLM-Judge Failure in Reasoning Pipelines

arXiv: 2608.07813

Когда ты просишь топовую нейронку выбрать лучший ответ из нескольких вариантов, она ведет себя как самовлюбленный эксперт, который путает уверенный тон с истиной. Проблема в том, что LLM-судьи оценивают контент «взахлеб»: они смешивают в одну кучу грамотную речь, вежливый тон и фактическую точность. В итоге модель ставит высший балл за красивый текст, даже если внутри него зашита полная лажа. Это фундаментальный баг — галлюцинации красноречия, из-за которых умный «судья» работает на 10% хуже, чем обычное голосование большинством.

Это как если бы ты пришел в суд, где вместо изучения улик смотрят на то, насколько у адвоката дорогой костюм и поставленный голос. Красиво излагает — значит, прав. В итоге мошенник в смокинге выигрывает дело у честного работяги в трениках, просто потому что судья поленился заглянуть в кодекс. В мире нейронок это приводит к тому, что модель уверенно выбирает ошибочный, но стилистически безупречный бред, игнорируя сухие, но верные факты.

Чтобы прекратить этот беспредел, придумали метод EL-DGR. Суть простая: мы лишаем нейронку права голоса «по ощущениям» и вводим жесткое ограничение. Теперь судья может пойти против мнения большинства только в одном случае — если он предоставит жесткую цитату-доказательство из исходного текста. Если модель не может ткнуть пальцем в конкретную строчку договора или статьи, подтверждающую ее выбор, ее мнение аннулируется. Мы буквально надеваем на нейронку наручники, заставляя ее работать не критиком, а архивариусом.

Этот принцип — спасение для любых задач, где цена ошибки высока: от разбора юридических договоров до анализа медицинских протоколов. Тестировали на сложных логических цепочках, но схема универсальна для любого RAG-сервиса. Если твой ИИ-помощник ищет неустойку в ипотечном договоре, он больше не имеет права «предполагать» или «интерпретировать». Либо есть цитата с цифрой, либо модель молчит и соглашается с большинством. Это превращает ненадежного советчика в строгого аудитора, который отвечает за базар.

Короче: доверять LLM-судье на слово — это гарантированный провал и риск словить ошибку там, где ее не ждешь. Хочешь адекватных результатов — внедряй доказательную базу и ограничивай полномочия модели. Либо нейронка находит конкретный пруф, либо ее оценка не стоит и ломаного гроша. Только так можно выжать из AI реальную пользу, а не просто слушать убедительные сказки о том, как все якобы работает.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с