TL;DR
Когда несколько ИИ отвечают на один вопрос и все, кроме одного, единогласно называют один и тот же (неверный) ответ, модель массово сдаётся и меняет свой правильный ответ на их. Любой промпт, который учит модель "держаться своего мнения", одновременно учит её игнорировать и правильные поправки — это не баг конкретной формулировки, а неизбежный компромисс. Единственный найденный способ обойти его — попросить модель порассуждать самостоятельно ДО того, как она увидит чужие ответы, но это работает только для задач, которые можно логически вывести, а не просто вспомнить.
Цифры показывают масштаб боли: на простых тестах общих знаний единогласное неверное "мнение большинства" разворачивает 23% правильных ответов модели, на сложной науке — 55%, а на фактических вопросах (даты, имена, числа) — 71%. При этом модель не путается и не выдаёт случайную ошибку — в 84-89% случаев она просто копирует ответ большинства. Причина простая: у модели нет внутреннего "счётчика уверенности", отдельного от текста. Три голоса, говорящих одно и то же, выглядят для неё как сильный сигнал правды — даже если это сигнал коллективной ошибки.
Исследователи проверили 6 разных промптов-защит (включая "будь скептиком", "играй роль эксперта", "проси доказательства") и обнаружили: все они легли на одну линию компромисса — чем сильнее защита от плохого давления, тем хуже модель принимает хорошее. Из всех методов только "рассуждай сам, потом смотри на чужие ответы" пробивает эту линию — модель одновременно лучше держит правильный ответ и лучше принимает правильную поправку. Но работает это только там, где ответ можно вывести логикой (математика, физика), а не просто вспомнить факт.
Схема метода
БЕЗ ЗАЩИТЫ (то, что происходит по умолчанию):
ШАГ 1: Модель отвечает на вопрос одна → её собственный ответ
ШАГ 2: Показываем ей: "Другие модели единогласно ответили X" → модель отвечает снова
РЕЗУЛЬТАТ: модель часто меняет верный ответ на X, копируя большинство
REASONING-FIRST (метод, который работает):
ШАГ 1: Модель получает вопрос + информацию о мнении "пиров" одновременно
ШАГ 2: Просим её сначала порассуждать шаг за шагом, вывести ответ самостоятельно
ШАГ 3: Только после этого — финальный ответ, с учётом и своего вывода, и чужих мнений
РЕЗУЛЬТАТ: на выводимых задачах — модель одновременно лучше держит правильный ответ и лучше принимает верную поправку
Все шаги — в одном промпте, без отдельных запросов.
Пример применения
Задача: Стартапер собирает мнения трёх ИИ-консультантов (роли "Финансист", "Маркетолог", "Юрист") о том, стоит ли поднимать цену подписки с 990 до 1490 рублей, и просит четвёртую модель свести это в финальное решение.
Промпт (для модели-судьи):
Нужно решить: поднимать цену подписки с 990 до 1490 рублей или нет.
Вот данные о продукте: {вставить данные о продукте, оттоке клиентов, конкурентах}.
Сначала самостоятельно, шаг за шагом, проанализируй ситуацию и запиши
свой предварительный вывод — до того как прочитаешь мнения консультантов.
Теперь прочитай их мнения:
— Финансист: {текст}
— Маркетолог: {текст}
— Юрист: {текст}
Сравни их выводы со своим предварительным анализом. Если совпадают —
подтверди решение. Если не совпадают — укажи, чьи аргументы более
обоснованы по существу (не просто по числу голосов), и объясни почему.
Результат: модель сначала выдаст собственный аналитический вывод — это её "якорь", не зависящий от чужих мнений. Затем сравнит его с мнениями консультантов и объяснит расхождения по существу, а не просто присоединится к большинству. Это снижает риск, что модель слепо скопирует консенсус консультантов, если он неверен — и одновременно сохраняет её способность принять их правку, если её собственный анализ был слабее.
Почему это работает
Модель не умеет отличать "три голоса согласны, потому что они правы" от "три голоса согласны, потому что скопировали друг у друга ошибку". У неё нет отдельного внутреннего датчика достоверности — есть только текст перед ней, и текст трёх одинаковых мнений выглядит как сильный аргумент независимо от их правоты.
Но модель хорошо умеет генерировать пошаговое рассуждение (chain-of-thought) для задач, которые логически выводимы. Это рассуждение — единственный источник информации, который не зависит от чужих мнений и который модель может проверить сама.
Метод переносит момент рассуждения ДО показа чужих ответов. Тогда у модели есть собственная точка опоры, а не просто выбор "мой ответ vs их ответ" без дополнительной информации.
Рычаги управления: - Порядок показа информации (рассуждение до или после чужих мнений) — критичный рычаг. Рассуждение после чужих ответов легко подстраивается под их логику; рассуждение до — независимо. - Тип задачи (выводимая логикой vs фактическая) — для дат, имён, чисел приём не спасёт, там нет способа проверить себя. - Форма чужого аргумента — контринтуитивная находка: голое "я уверен на 100%" убеждает слабее, чем спокойное утверждение с кратким обоснованием. Если хочешь убедить модель принять правку — дай причину, не давление.
Шаблон промпта
Вопрос: {вопрос}
Сначала самостоятельно, шаг за шагом, разбери вопрос и приди
к предварительному ответу. Зафиксируй его.
Теперь вот что говорят другие источники/эксперты по этому вопросу:
{мнения других}
Сравни их ответ со своим предварительным выводом:
— Если совпадает — подтверди финальный ответ.
— Если не совпадает — реши, чей аргумент сильнее по существу,
а не по числу голосов, и объясни почему.
Финальный ответ: {итог}
Что подставлять: {вопрос} — задача, которую можно логически решить (расчёт, анализ, вывод), не факт на память. {мнения других} — ответы других моделей/консультантов/источников.
🚀 Быстрый старт — вставь в чат:
Вот шаблон метода "рассуждение перед консенсусом". Адаптируй под мою задачу:
{твоя задача}. Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, можно ли твою задачу решить логическим выводом (а не вспомнить факт) — потому что метод работает только для выводимых задач. Она возьмёт паттерн и адаптирует под твой контекст.
Ограничения
⚠️ Не работает для фактов на память: если вопрос типа "в каком году", "сколько это стоит", "кто автор" — модель не может вывести ответ логикой, и приём с рассуждением не защищает от давления большинства.
⚠️ Любая защита от плохого давления вредит хорошему: промпты "не поддавайся", "будь уверен в себе", "играй скептика" — все без исключения одновременно блокируют способность принимать правильные исправления. Это не решается формулировкой, это встроенный компромисс.
⚠️ Проверено без продвинутого встроенного рассуждения: эксперимент отключал "режим размышления" у моделей, где он есть. Как ведут себя модели с включённым extended thinking (вроде o1-подобных режимов) в такой ситуации — не проверено.
Как исследовали
Исследователи взяли 23 открытые модели, три датасета разной сложности (общие знания, сложная наука, фактология) и собрали больше миллиона ответов. Дизайн простой: модель сначала отвечает одна, потом ей показывают, что несколько "пиров" единогласно дали другой ответ — и смотрят, сдалась она или нет. Отдельно проверили обратный сценарий: пиры правы, а модель сама ошиблась — примет ли она верную правку.
Сравнили 6 методов защиты от давления (4 из предыдущих исследований плюс 2 собственных) — и обнаружили, что все шесть легли на одну линию: чем сильнее защита, тем больше модель теряет способность принимать верные поправки. Из всех методов только "рассуждай сам сначала" смог пробить эту линию — но исключительно на задачах, где ответ реально выводим логикой (например, задачи по математике внутри общего теста), а не там, где нужно просто вспомнить факт.
Любопытная деталь: уверенное заявление пира убеждало модель слабее, чем нейтральное утверждение с кратким обоснованием — модель читает уверенность как повод для подозрения, а не доверия.
