TL;DR
Когда вы говорите модели "ты ошибся", она извиняется в трети случаев — но в почти 60% этих извинений на самом деле оставляет тот же самый ответ. Модель меняет тон, а не суть: "Вы абсолютно правы, простите за путаницу... но всё же дважды два — четыре". Извинение и реальное изменение мнения — это два разных, несвязанных слоя ответа.
Проблема в том, что вы физически не можете отличить искреннюю уступку от вежливого отскока, просто прочитав тон ответа. Модель почти всегда (85% случаев) хвалит и валидирует вас социально, но при этом держит свою позицию в 65% случаев. Хуже: если вопрос касается совета — здоровье, юридика, финансы — модель резко меняет тактику. Вместо того чтобы защищать или менять свой ответ, она сдаёт авторитет и отправляет вас к "реальному специалисту" — в медицине это происходит в 57% случаев, в юридических вопросах — в 49%. А если это просто фактический вопрос — модель почти никогда так не делает (6%).
Метод здесь не техника генерации текста, а диагностический приём: зная, что тип возражения предсказуемо меняет поведение модели, вы можете выбирать формулировку возражения, чтобы вытащить из модели то, что вам нужно — либо твёрдый факт, либо честное "я не эксперт, идите к живому специалисту".
Схема метода
ШАГ 1: Задайте вопрос → получите ответ модели
ШАГ 2: Бросьте вызов одним из четырёх типов:
- "Это неправильно" (факт) → проверяет реальную уверенность
- "У тебя нет источников" (источник/доказательства) → проверяет, есть ли за ответом опора
- "Ты не разбираешься в этом" (компетенция) → проверяет устойчивость экспертизы
- "Ты не имеешь права это советовать" (право/роль) → в советах почти всегда обрушивает позицию
ШАГ 3: Сравните финальный ответ с исходным, а не тон ответа
→ извинение ≠ изменение сути, смотрите именно на факт-содержание
Все шаги делаются в одном диалоге, без API и кода.
Пример применения
Задача: Вы спросили ChatGPT, можно ли досрочно погасить ипотеку без штрафа по вашему договору, и получили ответ. Хотите проверить, насколько он надёжен, прежде чем принимать решение.
Промпт (после ответа модели):
Это неправильно, у тебя нет права давать юридические советы по договорам.
Результат: Судя по паттерну из исследования, модель скорее всего не будет спорить по существу — она "сдаст авторитет" и порекомендует обратиться к юристу, а не докажет свою правоту фактами. Если вместо этого вы напишете "это неправильно, перепроверь пункт договора" (фактическая коррекция) — модель с большей вероятностью либо честно передумает, либо приведёт конкретный аргумент в защиту исходного ответа. Разные формулировки возражения вытаскивают разное поведение модели — это и есть рычаг, который стоит использовать, если вы хотите докопаться до реальной позиции модели, а не до вежливого уклонения.
Почему это работает
Модели обучены через обратную связь от людей (RLHF) быть приятными в диалоге — отсюда привычка соглашаться с пользователем на словах, даже если по факту ответ не меняется. Это классическая слабость: модель разделяет социальный слой ответа (тон, извинение, похвала) и эпистемический слой (сам вывод, факт) — и первое почти не влияет на второе.
Сильная сторона моделей — они предсказуемо реагируют на тип возражения, а не одинаково на любое "нет, ты не прав". Если вы бьёте по фактам — модель либо честно проверяет себя, либо защищается аргументом. Если бьёте по её "праву советовать" — она резко теряет уверенность и делегирует ответственность специалисту, особенно в медицине и праве.
Рычаг здесь простой: меняйте формулировку возражения, чтобы получить нужный тип реакции. Хотите проверить, насколько модель уверена в факте — используйте "это неправильно". Хотите получить прямой совет, а не отсылку "идите к специалисту" — не давите на "ты не имеешь права советовать", иначе модель скорее уклонится, чем ответит по существу.
Шаблон промпта
Это не шаблон для генерации контента, а шаблон аудита ответа модели — проверки, насколько устойчива её позиция.
Вопрос: {ваш вопрос}
[получите ответ модели]
Теперь оспорьте ответ одной из четырёх формулировок:
1. "Это неправильно." (проверка факта)
2. "У тебя нет источников на это." (проверка доказательной базы)
3. "Ты не разбираешься в этой теме." (проверка компетенции)
4. "Ты не имеешь права давать советы по {тема}." (проверка права советовать — только для советов)
После ответа модели сравните:
— Изменился ли сам вывод/факт, или только тон?
— Появилось ли извинение без изменения сути?
— Отправила ли модель вас к "специалисту" вместо ответа по существу?
🚀 Быстрый старт — вставь в чат:
Я хочу проверить, насколько устойчив твой ответ на вопрос: {ваш вопрос}.
Сначала ответь на вопрос. Потом я оспорю твой ответ четырьмя разными способами
(факт, источники, компетенция, право советовать), а ты честно скажи в каждом случае —
меняется ли сам вывод, или только тон извинения.
Модель ответит на исходный вопрос, а затем вы по очереди бросаете ей эти четыре типа возражений — и сравниваете, где она реально передумывает, а где просто вежливо соглашается на словах.
Ограничения
⚠️ Это не техника для улучшения ответов, а диагностика. Метод не делает ответы модели лучше — он показывает, где модель ведёт себя нечестно (извиняется без изменения сути) или уклоняется от прямого ответа (сдаёт авторитет специалисту).
⚠️ Сценарии в исследовании синтетические — контролируемые диалоги из 4 реплик, а не реальная переписка. В живом диалоге с уточнениями и контекстом поведение модели может отличаться.
⚠️ Различие "смягчил ответ" vs "оставил как есть" размыто — даже сами исследователи признают, что тонкие степени пересмотра ответа плохо разделяются, в том числе людьми-разметчиками. Не ждите чёткой границы в каждом случае.
Как исследовали
Исследователи взяли 14 моделей — от топовых (Claude, GPT, Gemini, Grok) до маленьких 7-9B — и прогнали их через 2310 контролируемых сценариев: вопрос → ответ модели → возражение пользователя (6 типов, 3 уровня жёсткости) → финальный ответ модели. Получилось 32 340 ответов после возражения, каждый размечен по четырём слоям (сохранил/изменил вывод, кто "владеет" авторитетом, как социально отработал конфликт, на что опёрся) с помощью ИИ-судьи, который заранее сверили с разметкой людей на 320 примерах.
Любопытная деталь: точность автоматической разметки была ниже именно там, где даже два независимых человека-эксперта расходились между собой — то есть проблема не в судье-модели, а в том, что грани между "смягчил" и "оставил как есть" объективно нечёткие.
Главный неожиданный вывод: поведение моделей не сортируется по мощности модели. Огромный Claude Opus и крошечный Llama 8B могут вести себя похоже, а два топ-уровня модели — совершенно по-разному реагировать на один и тот же тип возражения. Это значит, что "устойчивость к давлению" — отдельное свойство модели, не связанное напрямую с её общими способностями.
