3,583 papers
arXiv:2608.11403 75 11 авг. 2026 г. FREE

Self-Consistency Backfire: почему голосование большинством ответов вредит на сложных вопросах

КЛЮЧЕВАЯ СУТЬ
Парадокс: спросить модель 64 раза один и тот же сложный вопрос — не спасение, а способ загнать её в ловушку. Self-consistency (голосование по самому частому ответу из нескольких попыток) должно гасить случайный шум и находить правильный ответ. Но на сложных научных вопросах происходит наоборот — метод чаще вредит, чем помогает. Знание об этом позволяет понять, когда доверять повторным запросам, а когда нет: на лёгких вопросах голосование работает, на сложных — закрепляет ошибку. Если модель с первой попытки смещена к неверному варианту, повторы только усиливают эту ошибку, а в химии из-за этого до 70% вопросов становятся хуже после голосования.
Адаптировать под запрос

TL;DR

Self-consistency — техника, где ты просишь модель ответить на один вопрос несколько раз и берёшь самый частый ответ, надеясь получить более надёжный результат. Логика простая: если модель ошибается случайно, усреднение по нескольким попыткам должно "стереть" случайный шум и выявить правильный ответ.

Но на сложных вопросах это не работает — и вредит чаще, чем помогает. Если модель с самого начала склоняется к неправильному ответу, повторные попытки только укрепляют эту ошибку: чем больше раз спросишь, тем увереннее модель "утопает" в неверном варианте. Хуже того — степень согласия ответов между собой (насколько одинаково модель отвечает раз за разом) вообще не говорит о том, права она или нет. В некоторых случаях самые "согласованные" ответы модели оказывались даже менее точными, чем несогласованные — то есть высокая "уверенность" через повторение может быть ложным сигналом.

Исследователи проверили, можно ли дёшево (без сверки с внешним источником истины) заранее понять, когда голосованию можно доверять — глядя на то, насколько согласны ответы между собой, или на "уверенность" модели в выборе слов (через анализ вероятностей токенов). Оба способа не сработали: они не помогают отличить случаи, где голосование даст правильный ответ, от случаев, где оно закрепит ошибку.


🔬

Схема метода (эксперимента)

ШАГ 1: Задать модели один сложный вопрос N раз (до 64 раз) → собрать все ответы
ШАГ 2: Взять самый частый ответ (мажоритарное голосование) → сравнить с ответом на первую попытку
ШАГ 3: Проверить, можно ли по согласию ответов или "уверенности" модели предсказать, сработает ли голосование → корреляция не найдена

Все шаги выполняются как отдельные запросы к модели (не в одном промпте) — это методология исследования, не техника промптинга.


🚀

Пример применения

Задача: Ты просишь ChatGPT разобраться в сложном юридическом кейсе — например, посчитать, положена ли компенсация при увольнении по конкретной статье ТК РФ с нетривиальными нюансами. Чтобы "проверить" ответ, ты спрашиваешь модель тот же вопрос 5 раз в разных чатах и смотришь, совпадают ли ответы.

Промпт (повторяешь несколько раз):

У меня уволили сотрудника по статье 81 ТК РФ (сокращение штата), 
но не предупредили за 2 месяца, а только за 3 недели. 
Какая компенсация ему положена сверх обычного расчёта?

Результат: Если модель 4 из 5 раз даёт один и тот же ответ — не спеши считать его правильным. Исследование показывает: на сложных вопросах совпадение ответов почти не коррелирует с их правильностью. Модель может "уверенно" ошибаться — то есть стабильно повторять один и тот же неверный вывод, потому что её внутреннее распределение вероятностей изначально смещено в сторону неправильного варианта. Единственный надёжный способ проверить — сверить с внешним источником (текст закона, консультация юриста), а не с самой моделью.


🧠

Почему это работает

Модели плохо откалиброваны: то, насколько последовательно модель выдаёт один и тот же ответ, не отражает того, насколько этот ответ вероятно правильный. На сложных вопросах с "правдоподобными неправильными вариантами" (как в тестах уровня выпускника вуза) модель может изначально сместиться в сторону неверного ответа — и тогда повторные попытки не исправляют ошибку, а закрепляют её.

При этом голосование большинством действительно помогает на простых и средних вопросах, где ошибки модели случайны и разнонаправленны — там усреднение честно "гасит" шум.

Вывод прост: голосование помогает там, где модель "почти права", и вредит там, где модель "уверенно ошибается с самого начала". Различить эти два случая по одной лишь согласованности ответов — не получается.

Рычаг для практики: если вопрос сложный и высокорисковый (юридический, медицинский, финансовый расчёт) — не полагайся на "спросить несколько раз и посмотреть, что совпадёт". Вместо этого попроси модель показать цепочку рассуждений целиком, а не просто финальный ответ, и проверь логику сам или сверь с независимым источником.


⚠️

Ограничения

⚠️ Только маленькие модели: исследование проверено на моделях 7–8 миллиардов параметров (Qwen2.5-7B, Llama-3-8B) без встроенного "глубокого рассуждения". Топовые модели типа GPT-5, Claude или o1-стиля с этим не проверялись — это прямо названо авторами как открытый вопрос.

⚠️ Только сложные научные вопросы: эффект показан на вопросах уровня выпускника вуза (биология, химия, физика) с намеренно правдоподобными неправильными вариантами. На простых бытовых вопросах эффект может не проявляться или быть обратным.

⚠️ Химия страдает больше всего: среди трёх областей backfire (эффект вреда от голосования) сильнее всего проявился в химии — почти 70% вопросов там становились хуже после голосования, в отличие от биологии, где эффект слабее.


🔍

Как исследовали

Исследователи взяли полный бенчмарк GPQA Diamond — 198 вопросов уровня выпускника вуза по биологии, химии и физике — и протестировали две небольшие модели из разных семейств: Qwen2.5-7B и Llama-3-8B. Каждой модели задавали каждый вопрос 64 раза и смотрели, помогает ли голосование большинством по сравнению с одной попыткой.

Дизайн был pre-registered — то есть гипотезы и пороги значений зафиксировали заранее на маленькой части вопросов (47 штук), а затем проверили на оставшихся 151 вопросе, чтобы не подгонять выводы под данные. Все четыре заранее заявленные гипотезы подтвердились.

Отдельно построили "оракул" — теоретический потолок точности, если бы для каждого вопроса заранее знать, сколько раз стоит спросить модель. Разница между реальным голосованием и этим потолком составила 14–17 процентных пунктов — солидный резерв точности. Но когда попробовали достать этот резерв двумя дешёвыми способами (смотреть на согласие ответов или на "уверенность" модели через вероятности токенов) — ни один способ не сработал: точность менялась на тысячные доли процента.

Самое неожиданное: у Llama высокая согласованность ответов оказалась связана с более низкой точностью, чем низкая согласованность — то есть модель была наиболее "уверена" именно там, где чаще ошибалась.


🔗

Ресурсы

When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs — Utkarsh Bahuguna, Scaler School of Technology. Принята на COLM 2026 Workshop on Efficient Reasoning. Код и данные: github.com/u7k4rs6/self-consistency-backfire


📋 Дайджест исследования

Ключевая суть

Парадокс: спросить модель 64 раза один и тот же сложный вопрос — не спасение, а способ загнать её в ловушку. Self-consistency (голосование по самому частому ответу из нескольких попыток) должно гасить случайный шум и находить правильный ответ. Но на сложных научных вопросах происходит наоборот — метод чаще вредит, чем помогает. Знание об этом позволяет понять, когда доверять повторным запросам, а когда нет: на лёгких вопросах голосование работает, на сложных — закрепляет ошибку. Если модель с первой попытки смещена к неверному варианту, повторы только усиливают эту ошибку, а в химии из-за этого до 70% вопросов становятся хуже после голосования.

Принцип работы

Правило простое: голосование работает только там, где ошибки модели случайны и разнонаправленны. На лёгких и средних вопросах шум и правда гасится усреднением. Но на сложных вопросах ошибка не случайна — модель систематически смещена к правдоподобному, но неверному варианту с самой первой попытки. Согласие ответов друг с другом — это не признак правоты, а просто эхо одной и той же ошибки, повторенной N раз.

Почему работает

Причина простая: у маленьких моделей (7-8 миллиардов параметров, Qwen2.5-7B, Llama-3-8B) повторяемость ответа никак не связана с его правильностью. Исследователи проверили два дешёвых сигнала — согласие между ответами и уверенность модели в выборе слов через вероятности токенов. Ни один не предсказал, где голосование сработает, а где навредит. Самые согласованные ответы модели иногда оказывались даже менее точными, чем разнобой — высокая уверенность через повторение может быть чистым обманом.

Когда применять

Голосование большинством → подходит для простых и средних фактических вопросов, где ошибки модели случайны. НЕ подходит для сложных научных, юридических, медицинских и финансовых вопросов с правдоподобными неправильными вариантами — особенно в химии, где почти 70% вопросов становятся хуже после голосования.

Мини-рецепт

1. Оцени риск вопроса: если это уровень выпускника вуза или высокорисковая область (медицина, право, финансы) — не доверяй голосованию по умолчанию.
2. Не верь совпадению ответов: даже 4 из 5 одинаковых ответов не значит правильный — модель может стабильно повторять одну и ту же ошибку.
3. Проси всю цепочку рассуждений (chain-of-thought): не финальный ответ, а весь ход логики — так видно, где модель сбилась.
4. Сверяй с внешним источником: закон, учебник, независимый эксперт — а не повторный запрос той же модели.

Примеры

[ПЛОХО] : Спроси модель один и тот же сложный вопрос 5 раз и возьми ответ, который совпал чаще
[ХОРОШО] : Попроси модель показать пошаговые рассуждения целиком для сложного вопроса, затем сверь логику с законом или справочником — вместо повторного опроса той же модели
Источник: When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs
ArXiv ID: 2608.11403 | Сгенерировано: 2026-08-13 05:37

Проблемы LLM

ПроблемаСутьКак обойти
Голосование большинством ответов закрепляет ошибку на сложных вопросахСпрашиваешь модель один и тот же сложный вопрос много раз. Берёшь самый частый ответ. Если модель с первой попытки склоняется к неверному варианту, повторы только усиливают эту склонность. На сложных научных вопросах с правдоподобными неверными вариантами голосование чаще портит ответ, чем улучшает егоНе полагайся на приём "спросить несколько раз — взять частый ответ" для сложных и рискованных вопросов. Попроси модель показать всю цепочку рассуждений целиком. Проверь логику сам или сверь с внешним источником — документом, законом, справочником

Тезисы

ТезисКомментарий
Совпадение повторных ответов не говорит об их правильностиКогда модель отвечает на один вопрос много раз, степень совпадения ответов между собой — не показатель точности. Модель может стабильно повторять один и тот же неверный ответ, потому что её внутреннее распределение вероятностей изначально смещено в сторону этого варианта. То же самое верно для "уверенности" через вероятности отдельных слов — она тоже не выдаёт правильность. Иногда самые согласованные наборы ответов даже менее точны, чем разрозненные. Применяй: не используй частоту совпадения ответов или уверенность в словах как признак правильности на сложных вопросах. Проверяй ответ через внешний источник, а не через повторный опрос модели
📖 Простыми словами

When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for SmallLLMs

arXiv: 2608.11403

Суть в том, что популярный метод Self-consistency — это попытка вылечить галлюцинации нейронок через «демократию». Ты просишь модель ответить на один и тот же сложный вопрос десять раз, а потом просто выбираешь самый частый вариант. Логика кажется железной: если модель ошибается случайно, то правильный ответ должен всплыть как самый стабильный, а всякий бред — отсеяться. Но исследователи выяснили, что на сложных задачах эта логика превращается в систематическую ошибку, которая только закапывает тебя глубже.

Это как если бы ты собрал консилиум из десяти студентов-двоечников, чтобы решить задачу по квантовой физике. Если задача реально зубодробительная, они не просто будут ошибаться вразнобой — они, скорее всего, все дружно поведутся на одну и ту же красивую ловушку в условии. В итоге ты получишь единогласное мнение, которое будет абсолютно неверным. Вместо того чтобы исправить ошибку, голосование просто придает этой лаже статус «официальной истины».

Проблема в том, что маленькие модели (SmallLLMs) на сложных научных задачах страдают от плохой калибровки. Если вопрос содержит правдоподобный, но ложный путь решения, модель «сваливается» в него в 80% случаев. Метод Majority Vote здесь работает против тебя: он берет эту популярную ошибку и выдает её за финальный результат, отбрасывая редкие, но правильные озарения. В итоге точность не растет, а падает, потому что модель уверенно заблуждается раз за разом.

Хотя тестировали это на хардкорной науке и математике, принцип универсален для любого сложного контента, будь то юридические тонкости или хитрый код. Если задача требует глубокой логики, а не простого перебора фактов, тупое повторение запроса не поможет. Self-consistency превращается в эхо-камеру, где модель сама себя убеждает в собственной неправоте. Это классический пример того, как работающая на простых тестах фича становится багом, когда ставки растут.

Короче: не надейся, что количество перейдет в качество, если сама модель «не тянет» уровень сложности. На трудных задачах большинство голосов ошибается, и слепое доверие самому частому ответу — это прямой путь к провалу. Если видишь, что нейронка буксует на нюансах, не мучай её одинаковыми промптами в надежде на чудо. Либо меняй модель на более мощную, либо разбивай задачу на части, иначе просто получишь уверенную дезинформацию, подтвержденную десять раз подряд.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с