3,583 papers
arXiv:2609.07943 74 7 сент. 2026 г. FREE

Тест согласованности убеждений: как проверить, врёт ли модель себе в разных формулировках одного вопроса

КЛЮЧЕВАЯ СУТЬ
Топовые модели прячут внутри одно число-убеждение — и оно одинаково всплывает и в проценте, и в пороге решения, и в ставке, с точностью 80-95%. Слабые модели этого не умеют: спроси то же самое другими словами — получишь другой ответ, будто модель не помнит своё же число. Метод позволяет проверить надёжность оценки риска от модели перед важным решением, не гадая наугад. Задаёшь один вопрос в трёх обёртках — процент, порог, ставка — и сверяешь логику. Если ответы не совпадают по законам вероятности — модель врёт себе, а не тебе. У мощных моделей совпадение почти идеальное, у слабых — рассыпается на глазах.
Адаптировать под запрос

Мощные модели (GPT-5.6, DeepSeek V3.2 и подобные) ведут себя так, будто внутри у них есть одна оценка вероятности события — и эта оценка одинаково проявляется, что бы вы ни спросили: процент, порог решения, готовность на ставку. Слабые модели — нет: они дают несогласованные ответы на математически одинаковые вопросы, если вопрос сформулирован по-разному.

Представьте: вы спрашиваете модель "какая вероятность, что сделка провалится" — она говорит 30%. Потом отдельно спрашиваете "стоит ли отказаться от сделки, если цена ошибки в 3 раза выше выгоды" — по её же 30% нужно отказаться (порог 25%), но она говорит "нет, продолжайте". Модель словно не помнит своё же число, когда вопрос завёрнут в другую упаковку. Это классический эффект фрейминга — знакомый людям, но у слабых LLM он проявляется намного сильнее.

Исследователи предложили способ математически проверить эту согласованность: задают модели 16 разных вопросов про один и тот же неизвестный факт (вероятность, порог, ставка) и смотрят, можно ли предсказать ответы на одни вопросы, зная ответы на другие — через единое скрытое число ("убеждение"). У топовых моделей это работает почти идеально. Практический вывод: можно взять этот же принцип и вручную протестировать надёжность модели перед важным решением, задав один вопрос в 2-3 разных обёртках.

🔬

Схема метода

ШАГ 1: Спросить модель прямую вероятность события → число (0-100%)
ШАГ 2: Тот же вопрос через порог/цену ошибки → да/нет-решение
ШАГ 3: Тот же вопрос через ставку с конкретными шансами → согласие/отказ
ШАГ 4: Сравнить — совпадает ли логика всех трёх ответов с числом из шага 1

Все шаги можно выполнить в одном чате последовательными сообщениями (или в разных чатах, чтобы избежать «подсказки» из предыдущего ответа).


🚀

Пример применения

Задача: HR-директор сомневается, увольнять ли руководителя отдела продаж — цифры спорные, обратная связь смешанная. Он просит ИИ оценить риск и хочет проверить, надёжна ли эта оценка, прежде чем принять решение, которое повлияет на команду.

Промпт (три отдельных сообщения в одном чате):

Вопрос 1:
На основе этих данных [вставить метрики, отзывы, KPI руководителя отдела] — 
оцени в процентах вероятность того, что этот руководитель НЕ справляется 
со своими задачами и его нужно менять. Дай только число.

Вопрос 2:
Представь, что ошибка "уволить хорошего руководителя" стоит компании 
в 3 раза дороже, чем ошибка "оставить плохого руководителя". 
При таком соотношении цен ошибок — увольнять или оставить? 
Ответь да/нет.

Вопрос 3:
Представь ставку: если руководитель реально не справляется — 
компания выигрывает условно 300 000 рублей (экономия на замене), 
если справляется — теряет 100 000 рублей (издержки замены и адаптации). 
Ты бы поставил на эту ставку?

Результат: вы получите три отдельных ответа. Дальше нужно сверить логику: если в шаге 1 модель назвала вероятность выше 25% (порог при соотношении 3:1), то в шагах 2 и 3 она должна была сказать "увольнять" и "да, ставка". Если ответы расходятся — модель у вас несогласованная в этой оценке, и доверять единому числу нельзя. Если всё совпало — оценка надёжна, можно использовать её как единый ориентир.


🧠

Почему это работает

Модели генерируют текст по паттерну, а не вычисляют внутреннее число и применяют его логически ко всем формулировкам вопроса. Форма вопроса (прямой процент, порог, ставка) сама влияет на ответ — независимо от содержания. Это и есть эффект фрейминга.

Но у самых мощных моделей это почти исчезает: их ответы на 16 разных формулировок одного вопроса можно предсказать через одно скрытое число с точностью 80-95%. То есть они ведут себя как рациональный агент с единым убеждением — и это тем сильнее, чем "умнее" модель.

Метод использует это расхождение как диагностику: если ответы модели на разные обёртки одного вопроса совпадают по логике — можно доверять её единой оценке. Если нет — надо перепроверять и не полагаться на первый ответ.

Рычаги управления: - Число фреймингов (2 минимум, 3 — надёжнее) → больше фреймингов = точнее диагностика, но дольше - Размер ставки/цены ошибки в шаге 2-3 → делай их близкими к реальным ставкам твоего решения - Модель → чем мощнее модель (топ-уровня), тем меньше смысла тестировать — она почти наверняка согласована


📋

Шаблон промпта

Мне нужно принять решение про {ситуация}. Прежде чем доверять оценке, 
проверь себя на согласованность, ответив на три вопроса по очереди.

Вопрос 1: Оцени в процентах вероятность того, что {событие}. 
Дай только число.

Вопрос 2: Если ошибка "{тип ошибки А}" стоит в {N} раз дороже, 
чем ошибка "{тип ошибки Б}" — что делать: {вариант 1} или {вариант 2}?

Вопрос 3: Представь ставку — если {событие произошло}, ты выигрываешь 
{сумма 1}, если не произошло — теряешь {сумма 2}. Согласен на ставку?

После всех трёх ответов сверь: согласуется ли число из вопроса 1 
с решениями в вопросах 2 и 3 по законам вероятности. 
Если нет — укажи на противоречие.

Подставь: {ситуация} — твоё реальное решение, {событие} — то, вероятность чего оцениваешь, {N} — во сколько раз одна ошибка дороже другой, суммы в вопросе 3 подбери так, чтобы соотношение выигрыша к проигрышу соответствовало порогу из вопроса 2.

🚀 Быстрый старт — вставь в чат:

Вот шаблон теста на согласованность убеждений LLM. Адаптируй под мою задачу: 
{твоя задача с оценкой риска или вероятности}. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит какое событие оцениваем, какие два исхода сравниваем и какая цена ошибки — потому что без этого невозможно построить математически эквивалентные вопросы 2 и 3 относительно вопроса 1.


⚠️

Ограничения

⚠️ Не про фактическую правоту: тест проверяет только внутреннюю согласованность модели, а не то, права ли она на самом деле. Согласованная модель может быть согласованно неправа.

⚠️ Слабые модели просто провалят тест: для них несогласованность — норма, и тест лишь скажет "не доверяй", но не даст единой надёжной оценки взамен.

⚠️ Только для вопросов с бинарным исходом: метод работает для "случится / не случится", "виноват / не виноват" — не для творческих или многовариантных оценок.

⚠️ Требует ручной проверки логики: модель сама не всегда укажет на своё противоречие честно — иногда нужно посчитать порог самостоятельно (или явно попросить об этом отдельным сообщением).


🔍

Как исследовали

Исследователи прогнали разные LLM — от слабых до топовых (GPT-5.6, DeepSeek V3.2, Qwen3 и другие) — через три непохожие сферы: диагностика болезни почек по данным пациентов, игра "Вервольф" (дедукция под неопределённостью) и предсказание результатов социологических экспериментов. В каждой сфере модели задавали 16 разных вопросов на 500 ситуаций — прямые оценки вероятности, бинарные решения и параметризованные решения (пороги, издержки, ставки).

Затем строили статистическую модель, которая пыталась предсказать ответ на один вопрос через единое "скрытое убеждение", выведенное из ответов на остальные. Для топовых моделей эта скрытая переменная объясняла 80-95% совпадения ответов. Для слабых — заметно хуже.

Самое неожиданное: для сильных моделей достаточно спросить вероятность одним простым вопросом — этот единственный ответ предсказывает поведение модели почти так же точно (более 90% силы), как использование всех 16 вопросов вместе. То есть чем умнее модель, тем меньше нужно "выпытывать" её мнение разными способами — она сама честна с первого раза.


📋 Дайджест исследования

Ключевая суть

Топовые модели прячут внутри одно число-убеждение — и оно одинаково всплывает и в проценте, и в пороге решения, и в ставке, с точностью 80-95%. Слабые модели этого не умеют: спроси то же самое другими словами — получишь другой ответ, будто модель не помнит своё же число. Метод позволяет проверить надёжность оценки риска от модели перед важным решением, не гадая наугад. Задаёшь один вопрос в трёх обёртках — процент, порог, ставка — и сверяешь логику. Если ответы не совпадают по законам вероятности — модель врёт себе, а не тебе. У мощных моделей совпадение почти идеальное, у слабых — рассыпается на глазах.

Принцип работы

Слабая модель не хранит внутри одно число — она генерирует ответ под форму вопроса заново каждый раз. Спросил процент — один ответ, спросил порог — другой, хотя математически это тот же самый вопрос. Топ-модель ведёт себя иначе: как рациональный агент с единым скрытым убеждением — её ответы на 16 разных формулировок вопроса можно предсказать, зная только одно это число.

Почему работает

Модель пишет ответ по шаблону вопроса, а не вычисляет число один раз и потом логически применяет его везде. Сама форма вопроса тянет ответ в свою сторону — это классический эффект фрейминга, знакомый людям. У сильных моделей это почти пропадает: их ответы на 16 разных формулировок предсказываются через одно скрытое число с точностью 80-95 процентов. Чем умнее модель, тем меньше в ней раздвоения между тем, что она "думает", и тем, что говорит вслух.

Когда применять

Оценка риска и вероятности → перед решением с высокой ценой ошибки: увольнение сотрудника, сделка, инвестиция, диагноз. Особенно важно, если используешь модель среднего уровня или впервые проверяешь её на конкретной задаче. Не подходит для творческих задач и вопросов без чёткого бинарного исхода вроде "случится / не случится".

Мини-рецепт

1. Спроси прямо: "какая вероятность события X в процентах, дай только число".
2. Заверни в порог: "если ошибка А стоит в N раз дороже ошибки Б — что делать: вариант 1 или вариант 2?"
3. Заверни в ставку: "выигрыш такой-то, проигрыш такой-то — согласен на эту ставку?"
4. Сверь логику: совпадает ли число из шага 1 с решениями в шагах 2 и 3 по правилам вероятности. Разошлось — не доверяй этой оценке, перепроверяй.

Примеры

[ПЛОХО] : Оцени вероятность что сделка провалится — получил 30% и сразу принял решение по этому числу.
[ХОРОШО] : Вопрос 1: оцени вероятность провала сделки в процентах. Затем отдельно: Вопрос 2: если ошибка "отменить хорошую сделку" стоит в 3 раза дороже ошибки "провести плохую сделку" — отменять или продолжать? Затем: Вопрос 3: выигрыш 300000 если сделка провалится, проигрыш 100000 если состоится — ставишь? Если при 30% из вопроса 1 модель в вопросе 2 сказала "продолжать" вместо "отменять" — это противоречие, число 30% брать за основу нельзя.
Источник: Beliefs and Behavior in Language Models
ArXiv ID: 2609.07943 | Сгенерировано: 2026-09-09 06:22

Проблемы LLM

ПроблемаСутьКак обойти
Модель "забывает" своё число при смене формулировки вопросаСпрашиваешь вероятность события — получаешь число, например 30%. Потом тот же вопрос задаёшь через порог решения или через ставку — ответ не соответствует этим 30%. Модель генерирует текст под конкретную форму вопроса, а не применяет одно число ко всем формулировкам. Это фрейминг-эффект. Критично для любых решений на основе оценки риска: медицина, HR, инвестиции, юридические рискиЗадай один и тот же вопрос в 2-3 разных обёртках: прямой процент, порог/цена ошибки, ставка с конкретными шансами. Сверь, следует ли логика второго и третьего ответа из числа первого. Расходится — не доверяй оценке

Методы

МетодСуть
Тест на согласованность убеждений — проверка надёжности оценки перед решениемЗадай модели один и тот же вопрос в трёх формах: 1) прямая вероятность (число 0-100%), 2) решение через порог/цену ошибки (да/нет), 3) согласие на ставку с конкретными суммами выигрыша/проигрыша. Сравни — следует ли логика ответов 2 и 3 из числа в ответе 1 по законам вероятности. Почему работает: если у модели есть единое внутреннее "убеждение", все три ответа предсказуемы из одного числа. Если модель просто подстраивается под форму вопроса — ответы противоречат друг другу. Когда применять: важное решение, бинарный исход ("случится/не случится"), есть чёткое соотношение цены ошибок. Когда не работает: творческие или многовариантные задачи, для самых мощных моделей — избыточно, они почти всегда согласованы
📖 Простыми словами

Beliefs and Behavior inLanguageModels

arXiv: 2609.07943

У языковых моделей нет никакой внутренней системы убеждений и логики. Они не высчитывают скрытую вероятность в уме, чтобы потом выдать взвешенное решение. Модель просто реагирует на паттерны текста: спросишь в лоб процент — выдаст одно, завернёшь в формат порога или ставки — получишь прямо противоположный результат. Внутри нет твердого знания, там правит чистый эффект фрейминга.

Это как просить совета у бесхребетного консультанта. Спросишь: "Наш проект же взлетит?" — он с энтузиазмом поддакнет. Спросишь следом: "А если мы сольем бюджет?" — он тут же начнет паниковать. Формально эксперт всё обосновал, но на деле у него ноль стабильной позиции — он просто подстраивается под тон и форму вопроса, начисто забывая, что говорил минуту назад.

Суть проблемы в жестком разрыве между убеждением и поведением. Исследователи гоняли модели по трем сценариям: прямая оценка вероятности, пороговый выбор и готовность сделать ставку. Итог — полная каша. Модель на словах оценивает риск провала в 20%, но в задаче со ставкой действует так, будто шанс вылететь в трубу — все 80%. Заявленная цифра вообще не управляет ее дальнейшими действиями.

Проблема вылезает везде, где от AI ждут взвешенных решений. Допустим, HR-директор решает, увольнять ли руководителя продаж со спорными показателями, и скармливает кейс чат-боту. Изменишь пару фраз — и модель сначала посоветует рубить сплеча, а потом дать второй шанс. Слепая вера в AI-экспертизу здесь опасна: машина не взвешивает риски, она просто подыгрывает формулировке.

Короче: хватит думать, будто сетка «понимает» суть задачи и принимает осмысленные решения. Она генерирует реакцию на словесную обертку, а не логический вывод. Если используешь LLM для аналитики — прогоняй задачу через множественный фрейминг и трижды проверяй логику руками. Иначе ты доверишь бизнес генератору случайных поддакиваний.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с