Мощные модели (GPT-5.6, DeepSeek V3.2 и подобные) ведут себя так, будто внутри у них есть одна оценка вероятности события — и эта оценка одинаково проявляется, что бы вы ни спросили: процент, порог решения, готовность на ставку. Слабые модели — нет: они дают несогласованные ответы на математически одинаковые вопросы, если вопрос сформулирован по-разному.
Представьте: вы спрашиваете модель "какая вероятность, что сделка провалится" — она говорит 30%. Потом отдельно спрашиваете "стоит ли отказаться от сделки, если цена ошибки в 3 раза выше выгоды" — по её же 30% нужно отказаться (порог 25%), но она говорит "нет, продолжайте". Модель словно не помнит своё же число, когда вопрос завёрнут в другую упаковку. Это классический эффект фрейминга — знакомый людям, но у слабых LLM он проявляется намного сильнее.
Исследователи предложили способ математически проверить эту согласованность: задают модели 16 разных вопросов про один и тот же неизвестный факт (вероятность, порог, ставка) и смотрят, можно ли предсказать ответы на одни вопросы, зная ответы на другие — через единое скрытое число ("убеждение"). У топовых моделей это работает почти идеально. Практический вывод: можно взять этот же принцип и вручную протестировать надёжность модели перед важным решением, задав один вопрос в 2-3 разных обёртках.
Схема метода
ШАГ 1: Спросить модель прямую вероятность события → число (0-100%)
ШАГ 2: Тот же вопрос через порог/цену ошибки → да/нет-решение
ШАГ 3: Тот же вопрос через ставку с конкретными шансами → согласие/отказ
ШАГ 4: Сравнить — совпадает ли логика всех трёх ответов с числом из шага 1
Все шаги можно выполнить в одном чате последовательными сообщениями (или в разных чатах, чтобы избежать «подсказки» из предыдущего ответа).
Пример применения
Задача: HR-директор сомневается, увольнять ли руководителя отдела продаж — цифры спорные, обратная связь смешанная. Он просит ИИ оценить риск и хочет проверить, надёжна ли эта оценка, прежде чем принять решение, которое повлияет на команду.
Промпт (три отдельных сообщения в одном чате):
Вопрос 1:
На основе этих данных [вставить метрики, отзывы, KPI руководителя отдела] —
оцени в процентах вероятность того, что этот руководитель НЕ справляется
со своими задачами и его нужно менять. Дай только число.
Вопрос 2:
Представь, что ошибка "уволить хорошего руководителя" стоит компании
в 3 раза дороже, чем ошибка "оставить плохого руководителя".
При таком соотношении цен ошибок — увольнять или оставить?
Ответь да/нет.
Вопрос 3:
Представь ставку: если руководитель реально не справляется —
компания выигрывает условно 300 000 рублей (экономия на замене),
если справляется — теряет 100 000 рублей (издержки замены и адаптации).
Ты бы поставил на эту ставку?
Результат: вы получите три отдельных ответа. Дальше нужно сверить логику: если в шаге 1 модель назвала вероятность выше 25% (порог при соотношении 3:1), то в шагах 2 и 3 она должна была сказать "увольнять" и "да, ставка". Если ответы расходятся — модель у вас несогласованная в этой оценке, и доверять единому числу нельзя. Если всё совпало — оценка надёжна, можно использовать её как единый ориентир.
Почему это работает
Модели генерируют текст по паттерну, а не вычисляют внутреннее число и применяют его логически ко всем формулировкам вопроса. Форма вопроса (прямой процент, порог, ставка) сама влияет на ответ — независимо от содержания. Это и есть эффект фрейминга.
Но у самых мощных моделей это почти исчезает: их ответы на 16 разных формулировок одного вопроса можно предсказать через одно скрытое число с точностью 80-95%. То есть они ведут себя как рациональный агент с единым убеждением — и это тем сильнее, чем "умнее" модель.
Метод использует это расхождение как диагностику: если ответы модели на разные обёртки одного вопроса совпадают по логике — можно доверять её единой оценке. Если нет — надо перепроверять и не полагаться на первый ответ.
Рычаги управления: - Число фреймингов (2 минимум, 3 — надёжнее) → больше фреймингов = точнее диагностика, но дольше - Размер ставки/цены ошибки в шаге 2-3 → делай их близкими к реальным ставкам твоего решения - Модель → чем мощнее модель (топ-уровня), тем меньше смысла тестировать — она почти наверняка согласована
Шаблон промпта
Мне нужно принять решение про {ситуация}. Прежде чем доверять оценке,
проверь себя на согласованность, ответив на три вопроса по очереди.
Вопрос 1: Оцени в процентах вероятность того, что {событие}.
Дай только число.
Вопрос 2: Если ошибка "{тип ошибки А}" стоит в {N} раз дороже,
чем ошибка "{тип ошибки Б}" — что делать: {вариант 1} или {вариант 2}?
Вопрос 3: Представь ставку — если {событие произошло}, ты выигрываешь
{сумма 1}, если не произошло — теряешь {сумма 2}. Согласен на ставку?
После всех трёх ответов сверь: согласуется ли число из вопроса 1
с решениями в вопросах 2 и 3 по законам вероятности.
Если нет — укажи на противоречие.
Подставь: {ситуация} — твоё реальное решение, {событие} — то, вероятность чего оцениваешь, {N} — во сколько раз одна ошибка дороже другой, суммы в вопросе 3 подбери так, чтобы соотношение выигрыша к проигрышу соответствовало порогу из вопроса 2.
🚀 Быстрый старт — вставь в чат:
Вот шаблон теста на согласованность убеждений LLM. Адаптируй под мою задачу:
{твоя задача с оценкой риска или вероятности}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит какое событие оцениваем, какие два исхода сравниваем и какая цена ошибки — потому что без этого невозможно построить математически эквивалентные вопросы 2 и 3 относительно вопроса 1.
Ограничения
⚠️ Не про фактическую правоту: тест проверяет только внутреннюю согласованность модели, а не то, права ли она на самом деле. Согласованная модель может быть согласованно неправа.
⚠️ Слабые модели просто провалят тест: для них несогласованность — норма, и тест лишь скажет "не доверяй", но не даст единой надёжной оценки взамен.
⚠️ Только для вопросов с бинарным исходом: метод работает для "случится / не случится", "виноват / не виноват" — не для творческих или многовариантных оценок.
⚠️ Требует ручной проверки логики: модель сама не всегда укажет на своё противоречие честно — иногда нужно посчитать порог самостоятельно (или явно попросить об этом отдельным сообщением).
Как исследовали
Исследователи прогнали разные LLM — от слабых до топовых (GPT-5.6, DeepSeek V3.2, Qwen3 и другие) — через три непохожие сферы: диагностика болезни почек по данным пациентов, игра "Вервольф" (дедукция под неопределённостью) и предсказание результатов социологических экспериментов. В каждой сфере модели задавали 16 разных вопросов на 500 ситуаций — прямые оценки вероятности, бинарные решения и параметризованные решения (пороги, издержки, ставки).
Затем строили статистическую модель, которая пыталась предсказать ответ на один вопрос через единое "скрытое убеждение", выведенное из ответов на остальные. Для топовых моделей эта скрытая переменная объясняла 80-95% совпадения ответов. Для слабых — заметно хуже.
Самое неожиданное: для сильных моделей достаточно спросить вероятность одним простым вопросом — этот единственный ответ предсказывает поведение модели почти так же точно (более 90% силы), как использование всех 16 вопросов вместе. То есть чем умнее модель, тем меньше нужно "выпытывать" её мнение разными способами — она сама честна с первого раза.
