3,583 papers
arXiv:2608.09898 70 10 авг. 2026 г. FREE

Consilience: почему уверенный ответ модели на сложную задачу — плохой знак

КЛЮЧЕВАЯ СУТЬ
Быстрая уверенность на сложной задаче — это красный флаг, а не хороший знак. Исследователи заметили: правильные ответы на трудных задачах начинаются с сомнений, модель прощупывает разные подходы, и только потом сходится к выводу. Неправильные ответы уверены с первого токена — модель просто не заметила, что задача сложная, и вцепилась в первую идею. Consilience выбирает лучший вариант из нескольких, глядя не на среднюю уверенность, а на разницу между уверенностью в конце рассуждения и в начале. Чем больше этот рост — тем чаще ответ верный.
Адаптировать под запрос

TL;DR

Когда языковая модель отвечает на сложный вопрос быстро и уверенно — это чаще признак ошибки, а не правоты. Исследователи измерили внутреннюю "уверенность" модели (насколько сильно она сосредоточена на одном варианте токена вместо нескольких) на каждом шаге рассуждения и заметили закономерность: правильные ответы на трудные задачи начинаются с низкой уверенности (модель прощупывает разные подходы) и заканчиваются высокой (сходится к выводу). А неправильные ответы часто уверены с первого токена — модель хватается за первую попавшуюся идею и не сомневается в ней до конца.

Это ломает привычный подход "выбери самый уверенный из нескольких ответов модели" — он отлично работает на лёгких задачах, но на сложных начинает систематически выбирать уверенно неправильные ответы. Причина простая: модель, которая сразу закрыла для себя все альтернативы, просто не увидела, что задача сложная.

Метод Consilience решает это, оценивая не среднюю уверенность ответа, а траекторию: он специально штрафует высокую уверенность в начале рассуждения и требует высокую уверенность в конце. Из нескольких сгенерированных вариантов ответа выбирается тот, у которого разница "уверенность в конце минус уверенность в начале" максимальна.

🔬

Схема метода (оригинал, техническая часть)

ШАГ 1: Сгенерировать n вариантов ответа на один и тот же промпт (параллельно) → n текстов
ШАГ 2: В каждом варианте отделить фазу рассуждения от фазы финального ответа
       (по маркеру типа ) → две части текста
ШАГ 3: Посчитать среднюю "уверенность" (на основе log-вероятностей токенов) 
       первых W токенов рассуждения → C_initial
ШАГ 4: Посчитать среднюю уверенность последних W токенов рассуждения → C_final
ШАГ 5: Вычислить итоговый счёт: S = C_final − α × C_initial
ШАГ 6: Выбрать вариант с максимальным S как финальный ответ

⚠️ Все шаги требуют доступа к логитам/log-вероятностям токенов — это API-функция, а не то, что видно в обычном чате ChatGPT или Claude. Посчитать это руками в диалоге нельзя.


📌

Что из этого реально применимо в чате

Прямой метод (с формулой и log-вероятностями) требует программирования и API с доступом к логитам — недоступно обычному пользователю чата.

Но из находки можно вытащить рабочий принцип промптинга: если задача сложная, не позволяй модели скатиться в мгновенную уверенность. Заставь её сначала явно "расщепить" пространство решений — рассмотреть несколько разных подходов — и только потом сходиться к одному ответу. Это имитирует ту самую "правильную" траекторию (низкая уверенность → высокая), но делается текстовой инструкцией, а не измерением вероятностей.

Задача: Вы просите Claude или ChatGPT решить нетривиальную бизнес-задачу — например, придумать стратегию выхода на рынок доставки в Казахстане для российского фудтех-стартапа, где очевидного решения нет.

Промпт:

Реши задачу: {опиши сложную задачу}.

Не давай сразу один ответ. Сначала предложи 3 РАЗНЫХ подхода к решению, 
принципиально отличающихся друг от друга (не вариации одного и того же).
Для каждого подхода честно укажи, в чём он слабый и где может провалиться.

Только после этого — сравни все три и выбери один, объяснив,
почему именно он выдерживает критику лучше остальных.
Финальный ответ дай отдельным блоком с чёткой уверенностью в решении.

Результат: Модель выдаст три содержательно разных варианта решения с их слабыми местами, затем — сравнение и один финальный выбор с аргументацией. Это структурно похоже на паттерн "разведка → сходимость", который в исследовании коррелирует с правильными ответами.


🧠

Почему это работает

Модель генерирует текст токен за токеном, и её "уверенность" на каждом шаге — это просто степень того, насколько предыдущий текст сузил выбор следующего слова. Это не индикатор истинности, а индикатор того, насколько сильно модель уже закрыла альтернативы.

На простых задачах закрыть альтернативы сразу — это нормально: там правильный путь один и очевиден. На сложных задачах мгновенное закрытие альтернатив означает, что модель не заметила сложность и выбрала первую попавшуюся линию рассуждения, даже если она ошибочна.

Явная инструкция "сначала предложи разные подходы, потом выбери" заставляет модель текстуально проиграть тот же процесс, который в исследовании измеряли через вероятности: сначала расширение пространства решений, потом сужение. Рычаг управления здесь — число подходов (3 в примере) и требование, чтобы они были содержательно разными, а не вариациями одной идеи — без этого условия модель может сгенерировать три похожих ответа и не получить эффекта разведки.


⚠️

Ограничения

⚠️ Оригинальный метод недоступен в чате: формула Consilience считается по log-вероятностям токенов через API — это требует кода и доступа к внутренним данным модели, не доступным в обычном интерфейсе ChatGPT/Claude.

⚠️ На лёгких задачах метод не нужен: если модель и так уверенно и правильно отвечает с первой попытки, требование "разведки" — лишняя трата токенов и времени.

⚠️ Текстовая имитация — не то же самое, что измерение: просьба "предложи 3 разных подхода" заставляет модель писать текст в нужной структуре, но не гарантирует, что внутренняя уверенность модели действительно распределилась — это косвенная аналогия, не строгое воспроизведение метода.


🔍

Как исследовали

Команда из AWS AI Labs проверяла гипотезу на моделях GPT-OSS-120B/20B, DeepSeek-R1-Distill и Qwen3 — на задачах по математике (HMMT), знаниям уровня аспирантуры (GPQA), генерации кода (LiveCodeBench) и агентных правках кода (SWE-bench). Для каждого запроса генерировали пул из 256 ответов и выбирали лучший разными методами — сравнивали с простым выбором "самого уверенного ответа" целиком.

Ключевое наблюдение: на всём датасете уверенность неплохо предсказывает правильность, но если отфильтровать только трудные задачи (где модель угадывает правильно меньше 20% раз), картина разворачивается — неправильные ответы становятся более уверенными, чем правильные, и распределения перестают разделяться. Это и натолкнуло на идею смотреть не на уровень уверенности, а на её изменение во времени.

Результаты подтвердили гипотезу: на генерации кода метод поднял точность модели GPT-OSS-120B с 65.7% до 69.7% (там, где голосование большинством вообще неприменимо, так как ответы — это код, а не варианты из списка). На SWE-bench (реальные правки кода агентом) метод дал прирост в решённых задачах на несколько процентных пунктов.


📋 Дайджест исследования

Ключевая суть

Быстрая уверенность на сложной задаче — это красный флаг, а не хороший знак. Исследователи заметили: правильные ответы на трудных задачах начинаются с сомнений, модель прощупывает разные подходы, и только потом сходится к выводу. Неправильные ответы уверены с первого токена — модель просто не заметила, что задача сложная, и вцепилась в первую идею. Consilience выбирает лучший вариант из нескольких, глядя не на среднюю уверенность, а на разницу между уверенностью в конце рассуждения и в начале. Чем больше этот рост — тем чаще ответ верный.

Принцип работы

Забудь правило 'выбери самый уверенный из нескольких ответов' — на сложных задачах оно работает наоборот и систематически подсовывает уверенно неправильные варианты. Важна не итоговая уверенность, а её траектория по ходу рассуждения. Правильный путь: сомнение в начале, убеждённость в конце — а не постоянная уверенность от первого до последнего токена.

Почему работает

Уверенность модели на каждом шаге — это просто мера того, сколько альтернатив она уже отбросила. Это не индикатор правды, а индикатор того, как быстро сузился выбор слов. На лёгких задачах закрыть альтернативы сразу — нормально, там путь один и очевидный. На сложных задачах мгновенное закрытие альтернатив значит, что модель не заметила сложность и увязла в первой попавшейся линии рассуждения. Метод ловит именно рост уверенности от старта к финишу, а не сам факт высокой уверенности.

Когда применять

Масштабирование во время вывода (test-time scaling) → для задач где генерируешь несколько вариантов ответа и выбираешь лучший без эталона для проверки, особенно на сложных рассуждениях — математика, код, многошаговая логика. НЕ подходит для простых задач, где модель и так отвечает верно с первой попытки — разведка альтернатив там просто трата токенов.

Мини-рецепт

1. Оцени сложность задачи: если решение неочевидно и есть несколько путей — метод нужен, для простых вопросов пропусти этот шаг
2. Заставь модель разведать пространство решений: Предложи 3 разных подхода, принципиально отличающихся друг от друга (не вариации одной идеи)
3. Вытяни честную критику: Для каждого подхода укажи, в чём он слабый и где может провалиться
4. Только потом сходимость: Сравни все три и выбери один, объяснив почему он выдерживает критику лучше остальных
5. Для тех кто пишет код: если есть доступ к API с log-вероятностями токенов — считай формулу напрямую (S = уверенность в конце минус альфа × уверенность в начале), без текстовой имитации

Примеры

[ПЛОХО] : Реши задачу: как российскому фудтех-стартапу выйти на рынок доставки в Казахстане?
[ХОРОШО] : Реши задачу: ... Не давай сразу один ответ. Сначала предложи 3 разных подхода, принципиально отличающихся друг от друга. Для каждого честно укажи слабые места. Потом сравни все три и выбери один с аргументацией, почему именно он лучше держит критику. Финальный ответ дай отдельным блоком.
Источник: Consilience for Verifier-Free Test-Time Scaling
ArXiv ID: 2608.09898 | Сгенерировано: 2026-08-11 06:22

Проблемы LLM

ПроблемаСутьКак обойти
Мгновенная уверенность на сложной задаче — плохой знакМодель хватается за первую идею и сразу отвечает уверенно. На сложных задачах это чаще значит: модель не заметила сложность и не рассмотрела альтернативы. Правильные ответы на трудные задачи обычно начинаются с сомнения — модель прощупывает разные подходы, а потом сходится к выводу. Из-за этого метод "выбери самый уверенный из нескольких вариантов" на сложных задачах систематически выбирает уверенно неправильный ответНе позволяй модели сразу давать финальный ответ на сложную задачу. Попроси её сначала предложить несколько принципиально разных подходов, указать слабые места каждого, и только потом сойтись к одному решению с аргументацией

Методы

МетодСуть
Разведка сходимость — структура промпта для сложных задачПопроси модель: сначала 3 разных подхода к решению (не вариации одного, а принципиально разные направления), для каждого — честный разбор слабых мест, потом сравнение и выбор одного с аргументацией. Сначала предложи 3 РАЗНЫХ подхода... укажи слабое место каждого... затем выбери один и объясни почему. Почему работает: заставляет модель текстуально пройти путь "расширение вариантов сужение до одного", а не хватать первую идею. Работает: сложные, неочевидные задачи (стратегия, дизайн решения, спорные вопросы). Не работает: простые задачи с одним очевидным ответом — разведка там лишняя трата токенов и не даёт эффекта, потому что нет реальной альтернативы
📖 Простыми словами

Consilience for Verifier-Free Test-Time Scaling

arXiv: 2608.09898

Когда языковая модель выдает ответ на сложную задачу мгновенно и с каменным лицом, это не признак гениальности, а скорее симптом того, что она несет чушь. Суть в том, что правильные рассуждения в LLM имеют специфическую динамику: они начинаются с дикого сомнения, когда модель буквально «щупает» разные варианты продолжения мысли, и только к финалу приходят к жесткой уверенности. Если же нейронка с первого слова прет как танк, не рассматривая альтернатив, она почти наверняка галлюцинирует или просто угадала паттерн, не вникая в логику.

Это как если бы ты спросил дорогу у прохожего: один на секунду зависнет, прикинет маршруты в голове и только потом начнет объяснять, а второй — не задумываясь махнет рукой в сторону леса. Уверенность первого растет по мере объяснения, а второй просто уверен в своей правоте с самого начала, хотя понятия не имеет, где ты находишься. В мире нейросетей этот «зависший» момент в начале — критически важный маркер качества, без которого любой ответ превращается в лотерею.

Механика тут простая: исследователи измерили внутреннюю уверенность (энтропию) на каждом шаге генерации. Оказалось, что на трудных задачах модель должна «пройти через долину сомнений». Если на старте рассуждений у нее низкая уверенность — это хорошо, значит, она перебирает варианты. Если же распределение вероятностей токенов сразу схлопывается в один вариант, модель просто «залипла» на первой пришедшей в голову идее и игнорирует всё остальное. Это когнитивное искажение в коде, которое заставляет AI ошибаться с очень умным видом.

Этот принцип Consilience (согласованности) тестировали на математических задачах и коде, но он применим к любому сложному выводу. Вместо того чтобы строить дорогущие внешние «проверяльщики» (верификаторы), можно просто смотреть на график уверенности самой модели во время теста. Если кривая идет от хаоса к порядку — ответу можно верить. Это меняет подход к Test-Time Scaling: теперь мы можем отсеивать мусорные ответы, просто глядя на то, как модель «сомневалась» в процессе их написания.

Короче: высокая уверенность на старте — это красный флаг и почти гарантированный облом. Чтобы выжать из AI максимум, нужно заставлять его сомневаться, а не радоваться быстрым ответам. Динамика уверенности оказалась точнее любых внешних фильтров, потому что она показывает не что модель говорит, а как она до этого додумалась. Кто научится калибровать этот процесс, тот получит действительно надежный интеллект, а не просто уверенно врущий калькулятор.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с