3,583 papers
arXiv:2608.09706 71 10 авг. 2026 г. FREE

Consensus Selection: выбор лучшего варианта из нескольких без отдельного «судьи»

КЛЮЧЕВАЯ СУТЬ
Просить LLM выбрать «лучший» вариант — плохая идея. Судья-модель тянется к тому, что похоже на её собственный стиль, а не к правде. Метод consensus selection даёт возможность выбрать надёжный результат из нескольких генераций — без отдельной оценки качества, без судьи. Модель сравнивает варианты друг с другом, а не судит каждый в одиночку — берёт тот, что ближе всего к «среднему» по всем прогонам. Ошибки в каждой генерации случайны и не совпадают, а правильные куски повторяются — так рождается самый надёжный ответ без единого судьи.
Адаптировать под запрос

TL;DR

Consensus selection — способ выбрать лучший результат из нескольких сгенерированных LLM вариантов без отдельной оценки качества. Вместо того чтобы спрашивать модель «какой из этих вариантов лучше», берём тот вариант, который больше всего похож на остальные — самый «типичный» в пуле.

Проблема, которую решает метод: если попросить LLM сгенерировать несколько решений одной задачи, они будут отличаться — где-то случайная ошибка, где-то пропущенная деталь. Если потом попросить отдельную модель-судью выбрать лучший вариант, оценка часто непоследовательна: модель может предпочитать варианты, похожие на свои же ответы, или путаться в критериях. Иными словами — судья добавляет ещё один источник случайности вместо того, чтобы её убрать.

Метод предлагает не судить, а сравнивать варианты между собой: сгенерировать N решений, посчитать, насколько каждое похоже на остальные, и выбрать то, у которого суммарное «расстояние» до всех других — минимально. Логика простая: правильные элементы повторяются в разных генерациях чаще, а случайные ошибки — уникальны и не совпадают друг с другом.


🔬

Схема метода

ШАГ 1: Сгенерировать N независимых вариантов решения задачи → N черновиков
ШАГ 2: Сравнить каждый вариант с каждым другим → таблица «похожести»
ШАГ 3: Выбрать вариант с наименьшим средним расстоянием до остальных → финальный ответ

Все три шага можно выполнить в одном диалоге с LLM: сначала попросить N вариантов, потом — сравнение и выбор.


🚀

Пример применения

Задача: Нужно быстро оценить бюджет ремонта квартиры для клиента, но у LLM «то 80 тысяч, то 150 тысяч» за одну и ту же позицию при разных запросах — разброс мешает доверять одной генерации.

Промпт:

Составь смету на ремонт двухкомнатной квартиры 60 кв.м под ключ, 
эконом-класс, Москва. Сделай это 5 раз подряд, каждый раз как отдельный 
независимый расчёт, с разбивкой по позициям (материалы, работа, 
электрика, сантехника и т.д.).

Пронумеруй сметы 1–5.

Теперь сравни все пять смет между собой по каждой позиции. 
Определи, какая смета в целом ближе всего к остальным четырём 
(то есть её цифры по большинству позиций совпадают со «средним» 
значением по всем пяти). Выбери эту смету как финальную и объясни, 
по каким позициям было наибольшее согласие.

Результат: Модель выдаст пять разных смет с разбросом цифр, затем таблицу сравнения по позициям и финальный выбор — смету, которая не самая дешёвая и не самая подробная, а наиболее «согласованную» с остальными. Это надёжнее, чем полагаться на одну случайную генерацию.


🧠

Почему это работает

LLM генерирует числа и факты вероятностно — при повторных попытках она чаще выдаёт наиболее вероятный (обычно верный) вариант, а ошибки в каждой попытке разные и случайные. Модель при этом хорошо умеет сравнивать тексты между собой — находить общее и различия — даже если плохо умеет объективно оценивать «качество» одного варианта в изоляции.

Метод использует эту сильную сторону: вместо просьбы «оцени качество» просит «найди совпадения между вариантами». Правильные элементы, которые повторяются в большинстве генераций, всплывают сами — без отдельного шага оценки, который может быть непоследовательным.

Рычаги управления: - Число вариантов N — больше вариантов для задач с высоким разбросом (сложные расчёты, творческие форматы), меньше — для простых задач, чтобы не тратить лишние запросы. - Критерий сравнения — можно сравнивать по смыслу целиком или только по конкретным цифрам/фактам, в зависимости от того, что важно проверить. - Проверка на «застрявшую» ошибку — если все варианты содержат одну и ту же ошибку, консенсус её закрепит; стоит явно попросить модель отдельно выделить, если какой-то пункт вызвал разногласия.


📋

Шаблон промпта

Сгенерируй {число} разных вариантов решения задачи: {задача}.
Делай каждый вариант как независимый черновик — не подгоняй под предыдущие.
Пронумеруй их 1, 2, 3... {число}.

Теперь сравни все варианты между собой попарно. Определи, какой из них 
содержит элементы, которые повторяются в большинстве других вариантов 
(наиболее «типичный», а не самый детальный или самый смелый).

Выбери этот вариант как финальный ответ. 
Отдельно укажи, по каким пунктам было наибольшее расхождение между 
вариантами — это места, где стоит перепроверить вручную.

Подставь в {задача} конкретный запрос (смета, план, расчёт, формулировка условия договора), в {число} — от 3 до 7 вариантов в зависимости от важности задачи.

🚀 Быстрый старт — вставь в чат:

Вот шаблон метода consensus selection (выбор через согласие большинства 
вариантов). Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, сколько вариантов сгенерировать и по каким критериям их сравнивать — потому что именно от этого зависит, какую ошибку метод отловит: разброс в цифрах, в структуре или в формулировках.


⚠️

Ограничения

⚠️ Общая ошибка закрепляется: если все N вариантов содержат одну и ту же неточность (например, модель системно не помнит актуальные цены), консенсус выберет вариант с этой же ошибкой — метод её не видит.

⚠️ Пропуск лучшего, но нетипичного варианта: метод тянется к «среднему» по пулу. Если один вариант объективно лучше, но сильно отличается от остальных, он проиграет более «типичному», но менее качественному.

⚠️ Нужно несколько генераций: метод требует 3–7 отдельных прогонов задачи плюс шаг сравнения — для мелких и быстрых вопросов это избыточно, разумно применять на задачах с высокой ценой ошибки (расчёты, юридические формулировки, важные оценки).


🔍

Как исследовали

Команда из Siemens проверяла метод на генерации параметрических CAD-моделей — программ, которые описывают 3D-объект (типа детали или кронштейна) кодом, который потом компилируется в готовую 3D-форму. Отдельная LLM-генерация часто выдаёт кривую деталь: не те размеры, лишние или отсутствующие элементы.

Исследователи сравнили три способа выбора лучшего варианта из одного и того же пула: случайный выбор, выбор через отдельную модель-судью (эталонный метод EvoCAD) и свой consensus selection — по геометрическому сходству (насколько формы похожи друг на друга) и по топологии (совпадает ли структура — число граней, вершин). Consensus по геометрии обошёл судью по всем геометрическим метрикам, а по топологии сравнялся с ним — и всё это без единого вызова модели-оценщика.

Отдельно проверили, как метод масштабируется с числом вариантов: выигрыш появляется уже при 3 вариантах и выходит на плато к 9 — дальше почти не растёт. Протестировали на четырёх разных LLM — выигрыш от консенсуса был везде, но у слабых моделей больше (8–10% точности), у сильных меньше (1–3%), потому что сильные модели и без консенсуса реже ошибаются.

Любопытная деталь: во всех сценариях «идеальный выбор» (если знать заранее, какой вариант лучший) обходит consensus selection с большим отрывом — то есть в пуле почти всегда есть более удачные варианты, чем те, что выбирает согласие большинства. Это показывает границу метода: он хорош в отсеве случайных ошибок, но не находит лучший вариант, если тот сильно отличается от остальных.


🔗

Ресурсы

Test-Time Scaling for CAD Generation via Verifier-Free Consensus Selection — Aaron Haag, Altay Kaçan, Bertram Fuchs, Oliver Lohse, Siemens AG, Foundational Technologies, Мюнхен. Метод основан на принципе minimum Bayes risk decoding (Kumar & Byrne, 2004) и идее self-consistency (Wang et al., 2023) — статья переносит их из текста и кода в область 3D-генерации.


📋 Дайджест исследования

Ключевая суть

Просить LLM выбрать «лучший» вариант — плохая идея. Судья-модель тянется к тому, что похоже на её собственный стиль, а не к правде. Метод consensus selection даёт возможность выбрать надёжный результат из нескольких генераций — без отдельной оценки качества, без судьи. Модель сравнивает варианты друг с другом, а не судит каждый в одиночку — берёт тот, что ближе всего к «среднему» по всем прогонам. Ошибки в каждой генерации случайны и не совпадают, а правильные куски повторяются — так рождается самый надёжный ответ без единого судьи.

Принцип работы

Три шага без обучения и без отдельного судьи: сгенерировать N черновиков → сравнить каждый с каждым → взять тот, что ближе к среднему. Побеждает не самый умный ответ, а самый повторяющийся. Это как голосование жюри без председателя — выигрывает не тот, кто выступил ярче, а тот, кого большинство узнало в себе.

Почему работает

LLM генерирует факты и цифры вероятностно. При повторных попытках самый вероятный (обычно правильный) вариант всплывает чаще — а ошибки в каждой попытке разные и случайные, они не совпадают друг с другом. Модель отлично находит совпадения между текстами, хотя плохо судит качество одного текста в одиночку — метод бьёт именно в эту сильную сторону, а не в слабую.

Когда применять

Задачи с высокой ценой ошибки — расчёты, юридические формулировки, важные оценки → особенно когда один запуск LLM каждый раз даёт разные цифры. НЕ подходит для быстрых мелких вопросов: 5-7 прогонов плюс сравнение — слишком дорого для простой задачи.

Мини-рецепт

1. Сгенерируй черновики: попроси 3-7 независимых вариантов решения, явно указав «не подгоняй под предыдущие».
2. Сравни попарно: попроси модель построить таблицу — что повторяется в вариантах, а что уникально.
3. Выбери типичный: бери вариант с наименьшим средним расстоянием до остальных — не самый смелый и не самый подробный.
4. Отметь разногласия: попроси отдельно выделить пункты с наибольшим разбросом — это места для ручной проверки.

Примеры

[ПЛОХО] : Оцени, какой из пяти вариантов сметы лучше?
[ХОРОШО] : Сгенерируй 5 независимых смет ремонта квартиры. Сравни их между собой по каждой позиции и выбери ту, что ближе всего к "среднему" значению по всем пяти. Отдельно укажи позиции с наибольшим разбросом.
Источник: Test-Time Scaling for CAD Generation via Verifier-Free Consensus Selection
ArXiv ID: 2608.09706 | Сгенерировано: 2026-08-11 05:39

Проблемы LLM

ПроблемаСутьКак обойти
Модель-судья непоследовательна при выборе лучшего вариантаПросишь LLM выбрать лучший из нескольких вариантов ответа. Модель путается в критериях или тянется к вариантам, похожим на её же типичный стиль. Судья добавляет случайность вместо того, чтобы её убрать. Это ломает любую попытку выбрать надёжный ответ через отдельную оценкуНе проси оценивать качество. Проси сравнить варианты между собой и найти самый «типичный» — тот, что больше всего совпадает с остальными

Методы

МетодСуть
Consensus selection — выбор через сходство с большинствомСгенерируй N независимых вариантов решения одной задачи. Сравни каждый вариант с каждым другим. Выбери тот, у которого суммарное отличие от остальных минимально — не самый детальный и не самый смелый, а самый согласованный с большинством. Сравни все варианты попарно. Выбери тот, что содержит элементы, повторяющиеся в большинстве других. Работает: задачи с числовым или фактическим разбросом (расчёты, оценки, формулировки), где нужна не «оценка качества», а «поиск совпадений». Не работает: если все варианты содержат одну и ту же системную ошибку (модель её не увидит), или если лучший ответ сильно отличается от остальных (метод его отбросит как нетипичный). Число вариантов — 3–7, больше для задач с высоким разбросом, меньше для простых

Тезисы

ТезисКомментарий
Правильные элементы повторяются в разных генерациях, ошибки — случайны и уникальныМодель генерирует текст вероятностно: при повторных попытках чаще выпадает наиболее вероятный (обычно верный) вариант, а сбои у каждой попытки свои. Из-за этого совпадение между генерациями — хороший индикатор правильности, а несовпадение — индикатор случайной ошибки. Применяй: если нужно выбрать надёжный ответ без внешнего критерия правильности, генерируй несколько версий и ищи совпадения, а не проси модель оценить одну версию саму по себе
📖 Простыми словами

Test-Time Scaling for CAD Generation via Verifier-Free Consensus Selection

arXiv: 2608.09706

Суть тут в том, что современные нейронки при всей своей крутости остаются патологическими лжецами, которые каждый раз выдают новый результат на один и тот же вопрос. Проблема в вероятностной природе LLM: она не считает, а подбирает слова, и если её «заносит», она выдает полную чушь. Метод Consensus selection решает это через коллективный разум одной и той же модели. Вместо того чтобы верить первому встречному ответу, мы заставляем нейронку генерировать десяток вариантов и выбираем тот, который максимально похож на большинство. Это чистая статистика: правильные ответы обычно кучкуются в одном месте, а галлюцинации и ошибки разлетаются в разные стороны, как случайный шум.

Это как если бы ты спросил дорогу у десяти прохожих в незнакомом городе. Один скажет «налево», второй — «прыгай в колодец», а восемь человек уверенно махнут направо. Ты не знаешь наверняка, кто из них местный эксперт, но здравый смысл подсказывает, что восемь человек вряд ли сговорились тебя обмануть. Ты выбираешь «средний» маршрут, игнорируя городских сумасшедших. В этом и прикол: нам не нужен строгий судья или отдельная сложная система проверки, нам достаточно просто найти самый типичный ответ в толпе.

В техническом плане всё держится на сравнении текстов. Мы берем пачку генераций и смотрим, какая из них имеет наибольшее сходство со всеми остальными. Если модель считает бюджет ремонта и в пяти случаях из десяти выдает цифру около 100 тысяч, а в остальных — то миллион, то три копейки, метод просто выкинет аномалии. Работает это потому, что модель хорошо умеет находить общее, даже если она лажает в объективной оценке качества. Мы просто берем «центр масс» всех ответов, и это оказывается точнее, чем любая попытка заставить нейронку саму проверить свои ошибки.

Изначально это тестировали на генерации чертежей и сложного кода, но принцип универсален. Его можно натянуть на любую задачу, где нет однозначного «правильно/неправильно», которое можно проверить формулой. Будь то написание юридических договоров, расчет смет или создание маркетинговых стратегий — везде, где есть риск, что нейронку «поведет», консенсус-выбор спасает ситуацию. Это превращает нестабильную игрушку в рабочий инструмент, который выдает предсказуемый результат без привлечения живого эксперта для проверки каждой запятой.

Короче, хватит надеяться на удачу и одну-единственную генерацию — это путь к факапам. Нужно масштабировать вычисления не за счет усложнения модели, а за счет количества попыток и выбора самого адекватного среднего. Consensus selection доказывает, что «мнение большинства» внутри одной нейронки работает лучше, чем попытки достучаться до её логики. Кто не внедрит этот фильтр, так и будет разгребать галлюцинации и гадать, почему в этот раз AI выдал бред вместо решения.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с