3,583 papers
arXiv:2608.15303 83 15 авг. 2026 г. FREE

Divergent-Convergent Reasoning (DCR): как отдать модели роль строгого рецензента вместо голосования по большинству

КЛЮЧЕВАЯ СУТЬ
Голосование по большинству — это суд присяжных, где выигрывает тот, кто кричит громче, а не тот, кто прав. Метод Divergent-Convergent Reasoning (DCR) позволяет находить верный ответ даже если его дала всего 1 попытка из 5, а остальные 4 ошиблись одинаково. Модель не голосует, а разбирает аргументы — ищет что совпадает у большинства, где расходится, и специально проверяет, не право ли решение-одиночка. Точность растёт именно там, где простое большинство голосов проваливается.
Адаптировать под запрос

TL;DR

DCR — это метод в два шага: сначала модель генерирует много независимых вариантов решения одной задачи, потом отдельным запросом её просят выступить в роли строгого рецензента — найти, что совпадает у большинства решений, где они расходятся, и собрать финальный ответ, специально проверяя, не содержит ли решение из меньшинства правильную поправку, которую пропустило большинство.

Обычное голосование по большинству (генерируешь несколько ответов, берёшь самый частый) — проваливается именно там, где правильный ответ достался малой части попыток, а неправильный — большинству. На сложных задачах это происходит часто: модель может 20 раз ошибиться одинаково и 5 раз решить верно, и голосование в этот момент выберет неправильный ответ, потому что просто считает голоса, а не проверяет логику.

DCR решает это через разбор аргументов, а не подсчёт голосов: модель-рецензент ищет консенсусные шаги, точки разногласий и явно сверяет, не права ли "белая ворона" среди вариантов. Рекурсивная версия повторяет этот разбор раунд за раундом, пока рецензенты не придут к полному согласию — это даёт выше точность при меньшем числе запросов, потому что лёгкие задачи сходятся быстро, а сложные получают больше внимания.


🔬

Схема метода

ШАГ 1 (Divergent Exploration, отдельный запрос):
Сгенерировать N независимых решений задачи → пул вариантов

ШАГ 2 (Convergent Reconciliation, отдельный запрос):
Модель-рецензент анализирует пул:
  1. Находит консенсусные шаги (совпадают у большинства)
  2. Находит точки разногласий (где решения расходятся)
  3. Синтезирует финальный ответ, явно проверяя, 
     не прав ли вариант из меньшинства
→ один финальный ответ

ШАГ 3 (опционально, Recursive DCR):
Повторить ШАГ 2, подавая предыдущий реконсилированный вывод 
как новый пул → до единогласия рецензентов или до лимита попыток

🚀

Пример применения

Задача: Готовишься к собеседованию аналитиком в банк (Т-Банк, Альфа, Сбер) и решаешь комбинаторную задачку-головоломку с числами — тип задач, которые дают на техсобесах. Легко ошибиться в промежуточном подсчёте, и разные попытки решения одной и той же задачи могут дать разные числа.

Промпт (шаг 1):

Реши следующую задачу 5 независимыми способами. 
Для каждого способа начинай с нуля, не смотри на предыдущие 
попытки, используй разные подходы к рассуждению если возможно. 
Покажи полное решение для каждого варианта.

Задача: [текст задачи]

Промпт (шаг 2, после получения 5 решений):

Ты выступаешь в роли строгого рецензента. Ниже — 5 независимых 
решений одной задачи. Твоя работа:

1. НАЙДИ КОНСЕНСУС: какие шаги повторяются в большинстве решений — 
скорее всего они верны, проверь их бегло.
2. НАЙДИ РАЗНОГЛАСИЯ: точно определи, где решения расходятся — 
это самые спорные места, разбери их глубоко.
3. СИНТЕЗИРУЙ ФИНАЛЬНЫЙ ОТВЕТ: собери новое решение из проверенных 
шагов + своего разбора спорных мест. Важно: проверь, не содержит 
ли решение из МЕНЬШИНСТВА правильную поправку, которую упустило 
большинство. Не отбрасывай его просто потому что оно в меньшинстве.

Решения:
[вставить все 5 решений]

Дай финальный обоснованный ответ.

Результат: Модель сначала выделит совпадающие шаги как надёжные, потом разберёт конкретные точки разногласия — покажет, в чём именно расходятся подходы и почему. В финале даст один ответ с объяснением, почему выбран именно он, включая проверку, не право ли было решение-одиночка.


🧠

Почему это работает

LLM может ошибиться в промежуточном шаге сложной многошаговой задачи, и из-за случайности генерации разные попытки решения одной задачи дают разные ответы. Если просто взять самый частый ответ — а правильный случайно оказался у меньшинства попыток — получишь неправильный результат.

Но модели легче узнать правильный аргумент среди готовых вариантов, чем придумать его с нуля — сравнивать и находить противоречия она умеет лучше, чем решать вслепую.

DCR даёт модели роль рецензента с явной инструкцией не голосовать, а разбирать логику каждого варианта. Это позволяет вытащить правильный ответ, даже если его дала только одна попытка из пяти.

Рычаги управления: - Число вариантов (N) → для простых задач хватит 3-5, для сложных — больше, но это дороже - Число раундов рекурсии → для рутинных задач 1 раунд, для действительно сложных — повторяй разбор пока модель не даст одинаковый ответ два раза подряд - Условие остановки → в оригинале «единогласие рецензентов»; можно смягчить до «уверенный консенсус» для менее критичных задач - Инструкция про меньшинство → это ключевой рычаг. Без явного «проверь, не право ли решение из меньшинства» модель просто найдёт консенсус и амплификации не будет


📋

Шаблон промпта

ШАГ 1 — генерация вариантов:
Реши следующую задачу {N} независимыми способами. Для каждого 
начинай с нуля, не подглядывай в предыдущие попытки, используй 
разные подходы если возможно. Покажи полное рассуждение.

Задача: {задача}

---

ШАГ 2 — реконсиляция (после получения решений):
Ты — строгий рецензент. Ниже {N} независимых решений одной задачи.

1. НАЙДИ КОНСЕНСУС: шаги, повторяющиеся в большинстве решений — 
проверь их бегло.
2. НАЙДИ РАЗНОГЛАСИЯ: точки, где решения расходятся — разбери 
их глубоко.
3. СИНТЕЗИРУЙ ОТВЕТ: собери решение из проверенных шагов + разбора 
спорных мест. Явно проверь, не право ли решение из МЕНЬШИНСТВА — 
не отбрасывай его только потому что оно одно.

Решения:
{вставить все N решений}

Дай финальный обоснованный ответ.

Подставь {N} — число независимых попыток (3-7 для большинства задач), {задача} — сама задача с чётким правильным ответом (расчёт, логика, аналитика).

🚀 Быстрый старт — вставь в чат:

Вот шаблон Divergent-Convergent Reasoning. Адаптируй под мою задачу: 
[твоя задача]. Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, сколько вариантов решения нужно сгенерировать и насколько критична точность — это определяет, сколько раундов реконсиляции стоит делать.


⚠️

Ограничения

⚠️ Смешение слабых и сильных источников: если объединить решения слабой модели (или своих неудачных попыток) с качественными, слабые варианты могут «заразить» разбор и увести сильное решение в сторону ошибки. Метод работает лучше, когда поднимает слабых до уровня консенсуса, а не наоборот.

⚠️ Нужно реальное разнообразие: если все попытки решения похожи друг на друга, реконсиляция ничего не даст — эффект тем сильнее, чем сильнее расходятся исходные варианты.

⚠️ Не для творческих задач: метод проверен на задачах с одним точным правильным ответом — математика, логика, тесты с выбором. Для текстов, идей, креатива, где «правильных» вариантов много, логика консенсуса/разногласий не применима так же прямо.

⚠️ Дороже одного запроса: метод требует нескольких отдельных вызовов (генерация + разбор, иногда несколько раундов) — разумно применять там, где ошибка дорого стоит, а не для рутинных вопросов.


🔍

Как исследовали

Исследователи взяли четыре сложные бенчмарка — математические задачи уровня олимпиады (AIME 2024/2025, MATH500) и тесты с множественным выбором (MMLU-PRO) — и прогнали их через четыре модели разной силы, от слабых до топовых. Для каждой задачи модель генерировала 25 независимых попыток решения, а затем реконсилировала их через запрос-рецензию. Сравнивали с обычным голосованием по большинству и с методом «дебатов» между равными агентами (ReConcile).

Оказалось, что DCR почти всегда превосходит голосование — особенно там, где правильный ответ достался малой части попыток. Именно в этой зоне голосование проваливается, а реконсиляция спасает ситуацию. Рекурсивная версия — с повторными раундами разбора до единогласия — добилась ещё выше точности, используя примерно на 27% меньше вызовов: лёгкие задачи сходились за один раунд, сложные получали дополнительные круги разбора.

Самая интересная деталь: метод «дебатов» между равными агентами показал результат почти на 40 процентных пунктов хуже DCR. Разница в том, что DCR явно разделяет роль автора и строгого рецензента, а не просит модели просто «договориться» между собой как равные — жёсткая иерархия ролей оказалась критически важна.


🔗

Ресурсы

"Test-Time Scaling of Divergent-Convergent Reasoning" — Bo Wen, Yuhao Chen и др. Enkira.ai, Queen's University, IBM T.J. Watson Research Center, University of Chicago, Tensormesh Inc. Связанная работа для сравнения: ReConcile (Chen et al., 2024a).


📋 Дайджест исследования

Ключевая суть

Голосование по большинству — это суд присяжных, где выигрывает тот, кто кричит громче, а не тот, кто прав. Метод Divergent-Convergent Reasoning (DCR) позволяет находить верный ответ даже если его дала всего 1 попытка из 5, а остальные 4 ошиблись одинаково. Модель не голосует, а разбирает аргументы — ищет что совпадает у большинства, где расходится, и специально проверяет, не право ли решение-одиночка. Точность растёт именно там, где простое большинство голосов проваливается.

Принцип работы

Шаг 1: модель генерирует N решений независимо друг от друга — без подглядывания в предыдущие попытки. Шаг 2: отдельным запросом та же модель включается в роль строгого рецензента — не считает голоса, а разбирает логику каждого варианта. Ключевой момент: явная команда — не отбрасывай решение из меньшинства просто потому что оно одно. Без этой фразы в промпте эффект пропадает — модель просто найдёт консенсус и повторит ошибку большинства.

Почему работает

Модели легче узнать правильный аргумент среди готовых вариантов, чем придумать его с нуля. Сравнивать и находить противоречия она умеет лучше, чем решать вслепую. Пример: 20 попыток дали одну и ту же ошибку, 5 попыток — правильный ответ. Обычное голосование выберет неправильный вариант, потому что просто считает руки. DCR даёт модели роль рецензента с инструкцией разбирать аргументы, а не считать голоса — и правильный ответ из меньшинства всплывает наверх.

Когда применять

Задачи с одним точным правильным ответом → математика, логика, комбинаторные головоломки на собеседованиях, аналитические расчёты, тесты с выбором — особенно когда ошибка дорого стоит. НЕ подходит для творческих задач: текстов, идей, брейнштормов, где правильных вариантов много и логика консенсуса/разногласий не работает так же прямо.

Мини-рецепт

1. Сгенерируй пул: попроси модель решить задачу N независимыми способами (3-7 штук), без подглядывания в предыдущие попытки.
2. Смени роль: отдельным запросом отправь все решения и попроси модель выступить строгим рецензентом.
3. Дай ключевую команду: явно напиши — проверь, не право ли решение из меньшинства, не отбрасывай его только потому что оно одно. Без этой строчки метод не сработает.
4. Для сложных задач повтори: подавай результат разбора как новый пул, пока рецензент не даст одинаковый ответ два раза подряд.

Примеры

[ПЛОХО] : Реши задачу и дай ответ. (одна попытка — как повезёт с логикой, так и получишь)
[ХОРОШО] : Реши задачу 5 независимыми способами, не подглядывая в предыдущие попытки. Затем выступи строгим рецензентом: найди консенсус, разбери точки разногласий, проверь, не право ли решение из меньшинства.
Источник: Divergent-Convergent Reasoning: Scaling Test-Time Compute through Structured Solution Synthesis
ArXiv ID: 2608.15303 | Сгенерировано: 2026-08-18 05:29

Проблемы LLM

ПроблемаСутьКак обойти
Голосование по большинству теряет верный ответ из меньшинстваГенерируешь несколько ответов на сложную задачу, берёшь самый частый. Если модель ошибается одинаково в большинстве попыток, а верный ответ выпал только паре попыток — голосование выбирает неверный вариант. Это касается любой техники где несколько попыток объединяют через подсчёт голосовНе считай голоса. Отдельным запросом попроси модель разобрать все варианты как рецензент: найти совпадения, найти точки разногласий, и явно проверить — не прав ли ответ из меньшинства

Методы

МетодСуть
Дивергентно-конвергентное рассуждение — рецензент вместо счётчика голосовШаг 1: отдельным запросом сгенерируй N (3-7) независимых решений одной задачи, каждое с нуля, без подглядывания в другие. Шаг 2: другим запросом попроси модель выступить строгим рецензентом — найти шаги-консенсус, найти точки разногласий, и синтезировать финальный ответ, специально проверяя не право ли решение из меньшинства. Можно повторять шаг 2 рекурсивно, подавая предыдущий вывод как новый пул, пока рецензент не даст одинаковый ответ два раза подряд. Почему работает: модели легче узнать правильный аргумент среди готовых вариантов, чем придумать его с нуля — сравнивать текст она умеет лучше, чем решать вслепую. Когда применять: задачи с одним точным правильным ответом — математика, логика, расчёты, аналитика — где ошибка дорого стоит. Когда не работает: творческие задачи без единственно верного ответа; рутинные вопросы где точность не критична; исходные решения слишком похожи между собой (нет разнообразия — реконсиляции нечего разбирать)

Тезисы

ТезисКомментарий
Модель лучше узнаёт правильный ответ среди готовых вариантов, чем придумывает его с нуляСравнивать и находить противоречия в уже написанных решениях легче, чем самой решать задачу без опоры. Оценка готового текста требует меньше шагов рассуждения чем генерация с нуля — ошибку проще заметить со стороны, чем не допустить её изначально. Применяй: если задача сложная и важна точность — не проси модель решить один раз. Дай ей несколько собственных вариантов и попроси сравнить их между собой, а не выбирать самый частый ответ
📖 Простыми словами

Divergent-Convergent Reasoning: Scaling Test-TimeComputethrough Structured Solution Synthesis

arXiv: 2608.15303

Суть метода Divergent-Convergent Reasoning (DCR) в том, что нейросети, как и люди, часто лажают на ровном месте в сложных вычислениях. Если ты попросишь модель решить задачу один раз, она может споткнуться на втором шаге и уверенно довести ошибку до финала. DCR меняет правила игры: вместо одного «правильного» ответа мы заставляем модель нагенерировать кучу независимых черновиков, а потом включаем режим строгого рецензента, который не просто считает голоса, а вчитывается в логику каждого варианта.

Это как если бы ты решал сложную задачу по математике вместе с десятью одногруппниками. Вместо того чтобы просто проголосовать за самый популярный ответ, вы выбираете одного «судью», который смотрит на все решения сразу. Этот судья ищет, где мнения разошлись, и — что самое важное — проверяет, не оказался ли тот единственный парень, чей ответ отличается от всех, единственным правым. Большинство не всегда право, и DCR умеет выцеплять крупицы истины из решений меньшинства, которые обычно просто выбрасываются в мусор.

В жизни это работает так: представь, что ты готовишься к техсобесу в банк и решаешь зубодробительную задачу по комбинаторике. Ты решаешь её пять раз на разных листках. В трёх случаях у тебя получилось 42, в одном 45, а в последнем — 44. Обычная логика скажет: «пиши 42, это же чаще выпадало». Но метод DCR заставит тебя пересмотреть все пять листков и заметить, что в варианте с ответом 44 ты учел скрытое условие, которое проигнорировал в остальных попытках. В итоге структурированный синтез позволяет собрать финальный ответ, который учитывает все нюансы, а не просто идет на поводу у толпы.

Метод тестировали на сложных логических и математических задачах, но принцип универсален для любой ситуации, где цена ошибки высока. Это применимо в программировании, аналитике данных или даже при написании сложных юридических документов — везде, где масштабирование вычислений на этапе вывода (test-time compute) позволяет модели «подумать подольше» и перепроверить саму себя. SEO для смыслов уходит в прошлое, наступает эра глубокой верификации логики.

Короче: хватит надеяться на один удачный «промпт» — заставляй модель генерировать варианты и критически их пересобирать. DCR доказывает, что правильный ответ часто прячется в деталях, которые большинство попыток просто проспало. Кто научит свои системы не просто генерировать текст, а рецензировать собственные мысли, тот получит точность, недоступную обычным чат-ботам. Остальные продолжат получать уверенную чушь в ответ на сложные вопросы.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с