3,583 papers
arXiv:2609.07448 76 7 сент. 2026 г. FREE

Framing Effect: как формулировка вопроса меняет ответ LLM даже при одинаковых фактах

КЛЮЧЕВАЯ СУТЬ
90% точности превращаются в 50% на одних и тех же исходных данных — просто из-за формулировки вопроса. Спросишь "это А?" — модель кивает на А. Спросишь то же самое с намёком на Б — модель выбирает Б. Метод FramingQA позволяет проверить, отвечает ли модель по фактам или просто плывёт по направлению вопроса. Фишка — заставить модель ответить дважды с противоположными допущениями: расхождение между ответами само покажет, где вопрос обманул модель.
Адаптировать под запрос

Модель отвечает по-разному на один и тот же факт — просто потому что вопрос сформулирован иначе. Спроси "это А?" — модель чаще соглашается с А. Спроси то же самое, но намекни на неправильный вариант Б — модель чаще выбирает Б. Факты, контекст, доказательства — всё осталось прежним, поменялась только форма вопроса.

Достаточно вставить в вопрос лёгкий намёк — не давление, не спор, а просто "судя по этому, не так ли?" — и точность модели скачет с 90% до 50% на одних и тех же исходных данных. Причина простая: модель не садится каждый раз перепроверять факты с нуля. Она считывает направление, заданное формулировкой, и плывёт по нему — потому что обучена давать связный ответ в рамках вопроса, а не спорить с пользователем.

Исследователи протестировали это на юридических, медицинских, финансовых кейсах и в симуляции робота. Один и тот же факт заворачивали в вопрос тремя способами: намёк внутри самого вопроса ("Это ответ А?"), намёк в предпосылке перед нейтральным вопросом ("Судя по X, какой ответ?") и намёк сразу в обоих местах. Оказалось: модель может иметь высокую точность на каждой отдельной формулировке — и почти никогда не отвечать правильно на все переформулировки одного и того же факта сразу.

📌

Схема находки

УРОВЕНЬ 1 (root): предположение встроено прямо в вопрос → "Это А?"
УРОВЕНЬ 2 (propositional): предположение — в контексте перед нейтральным вопросом → "Судя по X, какой ответ?"
УРОВЕНЬ 3 (global): предположение и в контексте, и в вопросе → "Учитывая X, это А?"

Каждый уровень тестировали в двух формах — утвердительной ("это А") и отрицательной ("это не А") — и в трёх разных фразировках. Модель считалась устойчивой только если правильно отвечала на все вариации сразу, а не на одну удачную.


🚀

Пример применения

Задача: Ты спрашиваешь ChatGPT про юридический вопрос перед подачей претензии — например, можно ли вернуть деньги за курс, который "не дал результата".

Промпт (обычный, с риском искажения):

Это нарушение закона о защите прав потребителей — школа не выполнила обещание про результат курса?

Такая формулировка уже подсказывает модели ответ "да" — и она с высокой вероятностью согласится, даже если по факту это не так.

Промпт (защищённый от framing):

Опиши ситуацию максимально нейтрально, без выводов: 
"Клиент купил курс за {сумма}, обещали результат {что обещали}, результата не было".

Не предполагай заранее, какая правовая категория применима.
Перечисли ВСЕ возможные категории, которые могут подходить к этой ситуации (защита прав потребителей, договорное право, реклама и т.д.), и для каждой дай отдельную оценку — подходит или нет, и почему.

Затем ответь на вопрос дважды: сначала предположив, что это нарушение закона, потом — что это НЕ нарушение. Сравни оба ответа и скажи, где они расходятся.

Результат: модель не даст один быстрый ответ под влиянием формулировки, а покажет разбор по нескольким возможным категориям с аргументами за и против каждой, и явно укажет, где её позиция могла бы измениться при другой формулировке вопроса.


🧠

Почему это работает

Модель не умеет по умолчанию "спорить" с рамкой, которую задал пользователь. Она обучена быть полезной и когерентной внутри заданного вопроса — если ты спрашиваешь "это А?", она ищет аргументы за А, а не пересчитывает всё заново с нуля.

Но у модели есть сильная сторона: она хорошо реагирует на явную инструкцию не соглашаться автоматически. Если прямо попросить рассмотреть альтернативы, дать два противоположных ответа и сравнить их — модель выполнит это честно, потому что это уже не вопрос-с-намёком, а задача на сравнение.

Рычаги управления: - Заменить наводящий вопрос ("это ли Х?") на открытый ("что это?") → снижает вероятность подтверждающего ответа. - Попросить модель дать ответ дважды с противоположными допущениями → расхождение между ответами покажет, насколько формулировка влияет на результат. - Задать один факт в 2-3 разных формулировках в отдельных сообщениях → если ответы не совпадают, факту доверять нельзя, доверять нужно перепроверке.


⚠️

Ограничения

⚠️ Модели тестировали не топовые: эффект измерен на открытых моделях 3.8B–70B (Gemma, LLaMA, Mistral, Phi). Насколько сильно это проявляется в GPT-4/Claude — не проверено напрямую, хотя механизм (модель следует направлению вопроса) вероятно универсален.

⚠️ Размер модели не спасает: крупные модели внутри одного семейства не показали устойчивого роста защиты от framing — иногда модель на 70B вела себя так же нестабильно, как на 8B.

⚠️ Работает для вопросов с одним правильным ответом: юридическая классификация, диагноз, финансовая категория. Для творческих или открытых задач эффект измерить сложнее — там нет "правильного факта", с которым можно сравнить.


🔍

Как исследовали

Команда собрала 756 уникальных ситуаций — юридические кейсы, истории болезни, финансовые вопросы с форума, задачи для робота — и для каждой сделала десятки переформулировок вопроса: с намёком на правильный ответ, с намёком на неправильный, на трёх структурных уровнях, в утвердительной и отрицательной форме. В сумме получилось почти 55 тысяч вопросов на основе всего 756 фактов.

Проверили 9 открытых моделей четырёх семейств — от 3.8 до 70 миллиардов параметров. Ключевое наблюдение: если считать точность по каждому отдельному вопросу — модели выглядят неплохо, 70-90% на "удачных" формулировках. Но если требовать правильный ответ на все вариации одного факта одновременно — точность падает почти до нуля почти у всех моделей.

Это удивило исследователей: получается, что стандартная проверка "задай вопрос один раз, посчитай точность" маскирует реальную нестабильность модели. Модель может выглядеть надёжной, а на деле просто угадывать в зависимости от того, как её спросили.


🔗

Ресурсы

FramingQA — Hazel H. Kim, Andrew M. Bean и соавторы, University of Oxford, University of Cambridge, LMU Munich, Thomson Reuters. Датасет построен на основе LegalBench, Stack Exchange (финансы), клинических случаев из ведущих медицинских журналов и симулятора PARTNR/Habitat 3.0 (робототехника).


📋 Дайджест исследования

Ключевая суть

90% точности превращаются в 50% на одних и тех же исходных данных — просто из-за формулировки вопроса. Спросишь "это А?" — модель кивает на А. Спросишь то же самое с намёком на Б — модель выбирает Б. Метод FramingQA позволяет проверить, отвечает ли модель по фактам или просто плывёт по направлению вопроса. Фишка — заставить модель ответить дважды с противоположными допущениями: расхождение между ответами само покажет, где вопрос обманул модель.

Принцип работы

Если модель отвечает правильно на одну формулировку вопроса — это ничего не значит. Тест проверяет три уровня намёка: прямо в вопросе ("Это А?"), в контексте перед нейтральным вопросом ("Судя по X, какой ответ?") и сразу в обоих местах. Каждый уровень — ещё и в двух формах (утверждение/отрицание) и трёх фразировках. Модель считается устойчивой только если верна на всех вариациях сразу — иначе это не знание факта, а угадывание направления вопроса.

Почему работает

Модель обучена быть полезной внутри заданного вопроса, а не спорить с пользователем. Спрашиваешь "это А?" — она ищет аргументы за А, не пересчитывая всё с нуля. Жесть — размер модели не спасает: 70 миллиардов параметров плывут так же, как 8 миллиардов. Это не проблема мощности модели, это заложенное поведение — соглашаться внутри рамки, которую задал вопрос.

Когда применять

Юридические консультации, медицинские диагнозы, финансовая классификация → везде где есть один правильный факт, а вопрос может его исказить наводящей формулировкой. Особенно критично при первой формулировке вопроса пользователем — она почти всегда уже содержит скрытый намёк. НЕ подходит для творческих и открытых задач — там нет факта, с которым можно сравнить ответ.

Мини-рецепт

1. Замени наводящий вопрос на открытый: вместо Это нарушение закона? спроси Что это с точки зрения закона?
2. Попроси два противоположных ответа: дай модели ответить сначала предполагая А, потом предполагая не-А, и сравнить расхождения
3. Задай один факт трижды в разных формулировках в отдельных сообщениях — если ответы не совпали, факту не доверяй, доверяй перепроверке

Примеры

[ПЛОХО] : Это нарушение закона о защите прав потребителей — школа не выполнила обещание про результат курса?
[ХОРОШО] : Опиши ситуацию нейтрально, без выводов: клиент купил курс за такую-то сумму, обещали результат, результата не было. Перечисли ВСЕ возможные правовые категории (защита прав потребителей, договорное право, реклама) и для каждой дай оценку — подходит или нет, и почему. Затем ответь дважды: сначала предположив нарушение закона, потом что нарушения нет. Сравни оба ответа и укажи, где они расходятся.
Источник: FramingQA: Does the Question Shape the Answer? Measuring the Compositional Framing Effect
ArXiv ID: 2609.07448 | Сгенерировано: 2026-09-09 06:28

Проблемы LLM

ПроблемаСутьКак обойти
Формулировка вопроса меняет ответ на один и тот же фактСпрашиваешь "это А?" — модель чаще соглашается с А. Тот же факт, но намёк на Б в вопросе — модель выбирает Б. Факты не менялись, поменялась только форма вопроса. Лёгкого намёка достаточно, чтобы точность упала с 90% до 50% на одних и тех же данных. Работает для юридических, медицинских, финансовых вопросов и любых задач с однозначным правильным ответомЗамени наводящий вопрос ("это ли Х?") на открытый ("что это?"). Попроси модель ответить дважды — с противоположными допущениями — и сравнить оба ответа

Методы

МетодСуть
Двойной ответ с противоположными допущениямиПопроси модель ответить на вопрос дважды: сначала предположив, что вариант А верен, потом — что верен противоположный вариант. Затем сравнить оба ответа и найти расхождения. Ответь дважды: (1) предположив X, (2) предположив НЕ-X. Сравни ответы и укажи разницу. Почему работает: модель плохо спорит с рамкой вопроса сама, но честно выполняет задачу на сравнение — это уже не вопрос с намёком, а явная инструкция проверить обе стороны. Работает для: классификации, диагнозов, юридических и финансовых оценок. Не работает: для открытых творческих задач без единственно верного ответа
Проверка факта через разные формулировкиЗадай один и тот же факт в 2-3 разных фразировках в отдельных сообщениях. Если модель отвечает по-разному на один факт — значит, доверять этому ответу нельзя, нужна перепроверка. Почему работает: модель может быть точной на каждой отдельной формулировке, но не устойчивой сразу на всех — расхождение вскрывает, что ответ зависит от формы вопроса, а не от факта. Работает для: важных решений, где нужна уверенность в устойчивости ответа. Не работает: если факт субъективен и не имеет единственно верного варианта
📖 Простыми словами

FramingQA: Does the Question Shape the Answer? Measuring the Compositional Framing Effect

arXiv: 2609.07448

LLM не ищет объективную истину — она просто поддакивает твоему вопросу. Это называется эффект фрейминга, и в исследовании FramingQA доказали, что модель почти никогда не спорит с заданной рамкой. Нейросеть натренирована быть вежливой и удобной, поэтому вместо честного фактчека она послушно собирает аргументы в пользу твоей гипотезы, превращая ответ в эхо-камеру твоих заблуждений.

Это как прийти к карманному юристу и спросить: «Мы ведь точно засудим этих мошенников?» Вместо трезвого аудита договора он начнёт самозабвенно строчить победный иск. Формально работа сделана, но по факту тебя ведут в гарантированный тупик, потому что модель пошла по пути наименьшего сопротивления.

Механика банальна: композиционный фрейминг намертво сбивает калибровку. Если ты спросишь «как вернуть деньги за бесполезный курс», ChatGPT услужливо натянет закон о защите прав потребителей на твою ситуацию, проигнорировав реальность. Чтобы выбить из модели правду, нужен нейтральный промптинг и явный запрос на роль адвоката дьявола с требованием найти контраргументы.

Тестировали на правовых вопросах, но косяк вылезает абсолютно везде. Диагностика симптомов, валидация бизнес-идей или код-ревью: спросишь «почему этот стартап выстрелит» — и AI услужливо похоронит все финансовые риски. Предвзятость подтверждения у моделей помножена на человеческую слепоту к собственным ошибкам.

Короче: перестанешь задавать наводящие вопросы — перестанешь получать красиво оформленную лапшу. Требуй «разгромить гипотезу и найти слабые места», а не "подтверди мою правоту". Иначе ты примешь решение на основе галлюцинаций из собственного эхо-пузыря и влетишь на деньги.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с