TL;DR
DCR — это метод в два шага: сначала модель генерирует много независимых вариантов решения одной задачи, потом отдельным запросом её просят выступить в роли строгого рецензента — найти, что совпадает у большинства решений, где они расходятся, и собрать финальный ответ, специально проверяя, не содержит ли решение из меньшинства правильную поправку, которую пропустило большинство.
Обычное голосование по большинству (генерируешь несколько ответов, берёшь самый частый) — проваливается именно там, где правильный ответ достался малой части попыток, а неправильный — большинству. На сложных задачах это происходит часто: модель может 20 раз ошибиться одинаково и 5 раз решить верно, и голосование в этот момент выберет неправильный ответ, потому что просто считает голоса, а не проверяет логику.
DCR решает это через разбор аргументов, а не подсчёт голосов: модель-рецензент ищет консенсусные шаги, точки разногласий и явно сверяет, не права ли "белая ворона" среди вариантов. Рекурсивная версия повторяет этот разбор раунд за раундом, пока рецензенты не придут к полному согласию — это даёт выше точность при меньшем числе запросов, потому что лёгкие задачи сходятся быстро, а сложные получают больше внимания.
Схема метода
ШАГ 1 (Divergent Exploration, отдельный запрос):
Сгенерировать N независимых решений задачи → пул вариантов
ШАГ 2 (Convergent Reconciliation, отдельный запрос):
Модель-рецензент анализирует пул:
1. Находит консенсусные шаги (совпадают у большинства)
2. Находит точки разногласий (где решения расходятся)
3. Синтезирует финальный ответ, явно проверяя,
не прав ли вариант из меньшинства
→ один финальный ответ
ШАГ 3 (опционально, Recursive DCR):
Повторить ШАГ 2, подавая предыдущий реконсилированный вывод
как новый пул → до единогласия рецензентов или до лимита попыток
Пример применения
Задача: Готовишься к собеседованию аналитиком в банк (Т-Банк, Альфа, Сбер) и решаешь комбинаторную задачку-головоломку с числами — тип задач, которые дают на техсобесах. Легко ошибиться в промежуточном подсчёте, и разные попытки решения одной и той же задачи могут дать разные числа.
Промпт (шаг 1):
Реши следующую задачу 5 независимыми способами.
Для каждого способа начинай с нуля, не смотри на предыдущие
попытки, используй разные подходы к рассуждению если возможно.
Покажи полное решение для каждого варианта.
Задача: [текст задачи]
Промпт (шаг 2, после получения 5 решений):
Ты выступаешь в роли строгого рецензента. Ниже — 5 независимых
решений одной задачи. Твоя работа:
1. НАЙДИ КОНСЕНСУС: какие шаги повторяются в большинстве решений —
скорее всего они верны, проверь их бегло.
2. НАЙДИ РАЗНОГЛАСИЯ: точно определи, где решения расходятся —
это самые спорные места, разбери их глубоко.
3. СИНТЕЗИРУЙ ФИНАЛЬНЫЙ ОТВЕТ: собери новое решение из проверенных
шагов + своего разбора спорных мест. Важно: проверь, не содержит
ли решение из МЕНЬШИНСТВА правильную поправку, которую упустило
большинство. Не отбрасывай его просто потому что оно в меньшинстве.
Решения:
[вставить все 5 решений]
Дай финальный обоснованный ответ.
Результат: Модель сначала выделит совпадающие шаги как надёжные, потом разберёт конкретные точки разногласия — покажет, в чём именно расходятся подходы и почему. В финале даст один ответ с объяснением, почему выбран именно он, включая проверку, не право ли было решение-одиночка.
Почему это работает
LLM может ошибиться в промежуточном шаге сложной многошаговой задачи, и из-за случайности генерации разные попытки решения одной задачи дают разные ответы. Если просто взять самый частый ответ — а правильный случайно оказался у меньшинства попыток — получишь неправильный результат.
Но модели легче узнать правильный аргумент среди готовых вариантов, чем придумать его с нуля — сравнивать и находить противоречия она умеет лучше, чем решать вслепую.
DCR даёт модели роль рецензента с явной инструкцией не голосовать, а разбирать логику каждого варианта. Это позволяет вытащить правильный ответ, даже если его дала только одна попытка из пяти.
Рычаги управления: - Число вариантов (N) → для простых задач хватит 3-5, для сложных — больше, но это дороже - Число раундов рекурсии → для рутинных задач 1 раунд, для действительно сложных — повторяй разбор пока модель не даст одинаковый ответ два раза подряд - Условие остановки → в оригинале «единогласие рецензентов»; можно смягчить до «уверенный консенсус» для менее критичных задач - Инструкция про меньшинство → это ключевой рычаг. Без явного «проверь, не право ли решение из меньшинства» модель просто найдёт консенсус и амплификации не будет
Шаблон промпта
ШАГ 1 — генерация вариантов:
Реши следующую задачу {N} независимыми способами. Для каждого
начинай с нуля, не подглядывай в предыдущие попытки, используй
разные подходы если возможно. Покажи полное рассуждение.
Задача: {задача}
---
ШАГ 2 — реконсиляция (после получения решений):
Ты — строгий рецензент. Ниже {N} независимых решений одной задачи.
1. НАЙДИ КОНСЕНСУС: шаги, повторяющиеся в большинстве решений —
проверь их бегло.
2. НАЙДИ РАЗНОГЛАСИЯ: точки, где решения расходятся — разбери
их глубоко.
3. СИНТЕЗИРУЙ ОТВЕТ: собери решение из проверенных шагов + разбора
спорных мест. Явно проверь, не право ли решение из МЕНЬШИНСТВА —
не отбрасывай его только потому что оно одно.
Решения:
{вставить все N решений}
Дай финальный обоснованный ответ.
Подставь {N} — число независимых попыток (3-7 для большинства задач), {задача} — сама задача с чётким правильным ответом (расчёт, логика, аналитика).
🚀 Быстрый старт — вставь в чат:
Вот шаблон Divergent-Convergent Reasoning. Адаптируй под мою задачу:
[твоя задача]. Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, сколько вариантов решения нужно сгенерировать и насколько критична точность — это определяет, сколько раундов реконсиляции стоит делать.
Ограничения
⚠️ Смешение слабых и сильных источников: если объединить решения слабой модели (или своих неудачных попыток) с качественными, слабые варианты могут «заразить» разбор и увести сильное решение в сторону ошибки. Метод работает лучше, когда поднимает слабых до уровня консенсуса, а не наоборот.
⚠️ Нужно реальное разнообразие: если все попытки решения похожи друг на друга, реконсиляция ничего не даст — эффект тем сильнее, чем сильнее расходятся исходные варианты.
⚠️ Не для творческих задач: метод проверен на задачах с одним точным правильным ответом — математика, логика, тесты с выбором. Для текстов, идей, креатива, где «правильных» вариантов много, логика консенсуса/разногласий не применима так же прямо.
⚠️ Дороже одного запроса: метод требует нескольких отдельных вызовов (генерация + разбор, иногда несколько раундов) — разумно применять там, где ошибка дорого стоит, а не для рутинных вопросов.
Как исследовали
Исследователи взяли четыре сложные бенчмарка — математические задачи уровня олимпиады (AIME 2024/2025, MATH500) и тесты с множественным выбором (MMLU-PRO) — и прогнали их через четыре модели разной силы, от слабых до топовых. Для каждой задачи модель генерировала 25 независимых попыток решения, а затем реконсилировала их через запрос-рецензию. Сравнивали с обычным голосованием по большинству и с методом «дебатов» между равными агентами (ReConcile).
Оказалось, что DCR почти всегда превосходит голосование — особенно там, где правильный ответ достался малой части попыток. Именно в этой зоне голосование проваливается, а реконсиляция спасает ситуацию. Рекурсивная версия — с повторными раундами разбора до единогласия — добилась ещё выше точности, используя примерно на 27% меньше вызовов: лёгкие задачи сходились за один раунд, сложные получали дополнительные круги разбора.
Самая интересная деталь: метод «дебатов» между равными агентами показал результат почти на 40 процентных пунктов хуже DCR. Разница в том, что DCR явно разделяет роль автора и строгого рецензента, а не просит модели просто «договориться» между собой как равные — жёсткая иерархия ролей оказалась критически важна.
Ресурсы
"Test-Time Scaling of Divergent-Convergent Reasoning" — Bo Wen, Yuhao Chen и др. Enkira.ai, Queen's University, IBM T.J. Watson Research Center, University of Chicago, Tensormesh Inc. Связанная работа для сравнения: ReConcile (Chen et al., 2024a).
