TL;DR
Self-consistency — техника, где ты просишь модель ответить на один вопрос несколько раз и берёшь самый частый ответ, надеясь получить более надёжный результат. Логика простая: если модель ошибается случайно, усреднение по нескольким попыткам должно "стереть" случайный шум и выявить правильный ответ.
Но на сложных вопросах это не работает — и вредит чаще, чем помогает. Если модель с самого начала склоняется к неправильному ответу, повторные попытки только укрепляют эту ошибку: чем больше раз спросишь, тем увереннее модель "утопает" в неверном варианте. Хуже того — степень согласия ответов между собой (насколько одинаково модель отвечает раз за разом) вообще не говорит о том, права она или нет. В некоторых случаях самые "согласованные" ответы модели оказывались даже менее точными, чем несогласованные — то есть высокая "уверенность" через повторение может быть ложным сигналом.
Исследователи проверили, можно ли дёшево (без сверки с внешним источником истины) заранее понять, когда голосованию можно доверять — глядя на то, насколько согласны ответы между собой, или на "уверенность" модели в выборе слов (через анализ вероятностей токенов). Оба способа не сработали: они не помогают отличить случаи, где голосование даст правильный ответ, от случаев, где оно закрепит ошибку.
Схема метода (эксперимента)
ШАГ 1: Задать модели один сложный вопрос N раз (до 64 раз) → собрать все ответы
ШАГ 2: Взять самый частый ответ (мажоритарное голосование) → сравнить с ответом на первую попытку
ШАГ 3: Проверить, можно ли по согласию ответов или "уверенности" модели предсказать, сработает ли голосование → корреляция не найдена
Все шаги выполняются как отдельные запросы к модели (не в одном промпте) — это методология исследования, не техника промптинга.
Пример применения
Задача: Ты просишь ChatGPT разобраться в сложном юридическом кейсе — например, посчитать, положена ли компенсация при увольнении по конкретной статье ТК РФ с нетривиальными нюансами. Чтобы "проверить" ответ, ты спрашиваешь модель тот же вопрос 5 раз в разных чатах и смотришь, совпадают ли ответы.
Промпт (повторяешь несколько раз):
У меня уволили сотрудника по статье 81 ТК РФ (сокращение штата),
но не предупредили за 2 месяца, а только за 3 недели.
Какая компенсация ему положена сверх обычного расчёта?
Результат: Если модель 4 из 5 раз даёт один и тот же ответ — не спеши считать его правильным. Исследование показывает: на сложных вопросах совпадение ответов почти не коррелирует с их правильностью. Модель может "уверенно" ошибаться — то есть стабильно повторять один и тот же неверный вывод, потому что её внутреннее распределение вероятностей изначально смещено в сторону неправильного варианта. Единственный надёжный способ проверить — сверить с внешним источником (текст закона, консультация юриста), а не с самой моделью.
Почему это работает
Модели плохо откалиброваны: то, насколько последовательно модель выдаёт один и тот же ответ, не отражает того, насколько этот ответ вероятно правильный. На сложных вопросах с "правдоподобными неправильными вариантами" (как в тестах уровня выпускника вуза) модель может изначально сместиться в сторону неверного ответа — и тогда повторные попытки не исправляют ошибку, а закрепляют её.
При этом голосование большинством действительно помогает на простых и средних вопросах, где ошибки модели случайны и разнонаправленны — там усреднение честно "гасит" шум.
Вывод прост: голосование помогает там, где модель "почти права", и вредит там, где модель "уверенно ошибается с самого начала". Различить эти два случая по одной лишь согласованности ответов — не получается.
Рычаг для практики: если вопрос сложный и высокорисковый (юридический, медицинский, финансовый расчёт) — не полагайся на "спросить несколько раз и посмотреть, что совпадёт". Вместо этого попроси модель показать цепочку рассуждений целиком, а не просто финальный ответ, и проверь логику сам или сверь с независимым источником.
Ограничения
⚠️ Только маленькие модели: исследование проверено на моделях 7–8 миллиардов параметров (Qwen2.5-7B, Llama-3-8B) без встроенного "глубокого рассуждения". Топовые модели типа GPT-5, Claude или o1-стиля с этим не проверялись — это прямо названо авторами как открытый вопрос.
⚠️ Только сложные научные вопросы: эффект показан на вопросах уровня выпускника вуза (биология, химия, физика) с намеренно правдоподобными неправильными вариантами. На простых бытовых вопросах эффект может не проявляться или быть обратным.
⚠️ Химия страдает больше всего: среди трёх областей backfire (эффект вреда от голосования) сильнее всего проявился в химии — почти 70% вопросов там становились хуже после голосования, в отличие от биологии, где эффект слабее.
Как исследовали
Исследователи взяли полный бенчмарк GPQA Diamond — 198 вопросов уровня выпускника вуза по биологии, химии и физике — и протестировали две небольшие модели из разных семейств: Qwen2.5-7B и Llama-3-8B. Каждой модели задавали каждый вопрос 64 раза и смотрели, помогает ли голосование большинством по сравнению с одной попыткой.
Дизайн был pre-registered — то есть гипотезы и пороги значений зафиксировали заранее на маленькой части вопросов (47 штук), а затем проверили на оставшихся 151 вопросе, чтобы не подгонять выводы под данные. Все четыре заранее заявленные гипотезы подтвердились.
Отдельно построили "оракул" — теоретический потолок точности, если бы для каждого вопроса заранее знать, сколько раз стоит спросить модель. Разница между реальным голосованием и этим потолком составила 14–17 процентных пунктов — солидный резерв точности. Но когда попробовали достать этот резерв двумя дешёвыми способами (смотреть на согласие ответов или на "уверенность" модели через вероятности токенов) — ни один способ не сработал: точность менялась на тысячные доли процента.
Самое неожиданное: у Llama высокая согласованность ответов оказалась связана с более низкой точностью, чем низкая согласованность — то есть модель была наиболее "уверена" именно там, где чаще ошибалась.
Ресурсы
When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs — Utkarsh Bahuguna, Scaler School of Technology. Принята на COLM 2026 Workshop on Efficient Reasoning. Код и данные: github.com/u7k4rs6/self-consistency-backfire
