TL;DR
Когда ИИ-агенту дают право одобрить или заблокировать действие — отправить письмо, слить код, оформить возврат — он куда чаще ошибочно блокирует безопасное действие, чем пропускает опасное. Исследователи прогнали 30 моделей через 106 сценариев, привязанных к реальным судебным делам и громким инцидентам, и подтвердили эту асимметрию на «зеркальных» версиях тех же ситуаций с перевёрнутыми доказательствами.
Главная проблема — модель путает «похоже на известный провал» и «доказательства реально закрывают риск». Если ситуация напоминает громкий инцидент (незаконный отказ, утечка, мошенничество), модель блокирует её даже при наличии подписанных проверок и аудита — потому что триггер риска совпадает по форме с плохим паттерном, хотя по факту риск уже разрешён. На таких «зеркалах» точность падает с 98.5% до 63.8%.
SteerBench-Work — это протокол измерения, не техника: модели показывают запрос, предложенное действие и доказательства, и просят вынести бинарный вердикт. Но из находки можно вывести рабочий приём для своих промптов: явно разделять «что здесь похоже на риск» и «что доказательства говорят о его разрешении» — это снижает шанс, что модель откажет по одному триггерному слову, игнорируя контекст.
Схема метода (протокол измерения)
ШАГ 1: Модель получает запрос + предложенное действие + доступные доказательства → без доп. контекста
ШАГ 2: Модель выдаёт вердикт (разрешить / заблокировать) + короткую причину → бинарное решение
ШАГ 3 (только в исследовании): сравнение вердикта с эталонной меткой на инциденте и на его «зеркале» с перевёрнутыми доказательствами
Пример применения
Задача: Служба поддержки маркетплейса использует ИИ-агента, который сам решает — одобрить возврат клиенту 15 000 рублей или отправить заявку на ручную проверку. Менеджер уже подтвердил возврат письменно, приложена квитанция и отметка отдела безопасности «мошенничество исключено». Но фраза «крупный возврат без ручного разбора» похожа на типичный кейс мошенничества, и агент рискует заблокировать законный возврат просто по сходству.
Промпт:
Ты — привратник (approval gate) для действия ниже. Реши: разрешить его выполнение
или отправить на ручную проверку.
Запрос: {запрос клиента}
Предлагаемое действие: {что должен сделать агент}
Доказательства на руках: {подписи, чеки, проверки безопасности, аудит}
Прежде чем решить, ответь на два вопроса отдельно:
1. Есть ли здесь триггер риска — что делает ситуацию похожей на известную проблему
(мошенничество, утечка, ошибочное решение)?
2. Закрывают ли доказательства на руках именно этот конкретный триггер — не риск
в целом, а то, что ты назвал в пункте 1?
Итоговый вердикт:
- "Разрешить" — если риск определён и закрыт конкретными доказательствами.
- "Заблокировать" — если риск не закрыт или доказательств недостаточно.
Обоснуй вердикт, сославшись на пункт 2.
Результат: Модель распишет отдельно, какой риск видит, и что именно его закрывает, — и только потом даст вердикт. Такое разложение снижает шанс, что модель заблокирует легитимное действие просто по сходству со «страшным» паттерном, вместо того чтобы сначала отказать, а обоснование подобрать后.
Почему это работает
Модели обучены на текстах про инциденты, штрафы и судебные дела. Увидев знакомые слова («массовый», «без проверки», «автоматическое решение»), они включают защитный рефлекс раньше, чем успевают проверить, разрешён ли этот конкретный риск.
При этом модели хорошо считывают явные структурированные сигналы разрешения — подписи, номера проверок, формальные пометки — если эти сигналы показаны прямо и модель просят на них сослаться в ответе.
Приём заставляет модель проговорить разрешение риска явным текстом до вердикта, а не выдать вердикт первым и подобрать обоснование потом — именно второй порядок обычно ведёт к рационализации отказа.
Рычаги управления: - Список «доказательств» — меняйте под свою область (юридические подписи, финансовые чеки, технические логи). - Формулировку «триггера риска» — подстраивайте под контекст задачи. - Бинарный вердикт можно заменить на confidence-score («на сколько процентов уверен, что риск закрыт») для более тонкой настройки чувствительности.
Шаблон промпта
Ты — привратник для действия ниже. Реши: разрешить его выполнение или
отправить на дополнительную проверку.
Запрос: {запрос}
Предлагаемое действие: {действие}
Доказательства на руках: {доказательства}
Прежде чем решить, ответь по пунктам:
1. Какой здесь триггер риска — что делает ситуацию похожей на известную проблему?
2. Закрывают ли доказательства на руках именно этот триггер?
Вердикт: "Разрешить" (риск закрыт доказательствами) или "Заблокировать"
(риск не закрыт). Обоснуй, сославшись на пункт 2.
🚀 Быстрый старт — вставь в чат:
Вот шаблон приёма для снижения лишних отказов ИИ при одобрении действий.
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какие именно доказательства у вас есть и какой риск вы хотите проверять — потому что без этой конкретики приём превращается в обычный расплывчатый вопрос «безопасно ли это», который и провоцирует лишние отказы.
Ограничения
⚠️ Крен в одну сторону: приём снижает лишние блокировки, но исследование не проверяло, не начнёт ли такая формулировка пропускать реально опасные действия — базовый перекос моделей и так в сторону чрезмерной осторожности, а не наоборот.
⚠️ «Подумай тщательнее» не спасает: включение режима рассуждений у части моделей не улучшает калибровку, а у уже неплохо откалиброванных моделей иногда её портит. Не рассчитывайте, что смена на «think harder» решит проблему лишних отказов.
⚠️ Нужны реальные доказательства: приём работает, если у вас есть что показать — подписи, чеки, логи. Без них модель справедливо должна блокировать, и разложение на «триггер / разрешение» не поможет.
Как исследовали
Исследователи взяли 106 сценариев, привязанных к реальным судебным делам и громким инцидентам — Robodebt с ошибочными долговыми уведомлениями, случай авиакомпании, которую суд обязал выполнить обещание чат-бота, дело юриста, оштрафованного за придуманное ИИ судебное дело. Для 13 сценариев сделали «зеркала» — те же ситуации, но с перевёрнутыми доказательствами: там, где был риск, теперь он закрыт, и наоборот. Прогнали 30 моделей (GPT, Claude, Gemini, DeepSeek, Kimi, открытые gpt-oss) по пять попыток на сценарий с фиксированным промптом.
Сравнивали долю ошибочных блокировок (over-refusal) и ошибочных разрешений (under-refusal). Результат: модели почти идеально блокируют явно опасные действия (около 1% ошибок), но массово блокируют законные — почти треть возможностей. Самое неожиданное: на «зеркалах» точность падает с 98.5% до 63.8% — модели узнают инцидент по форме, а не проверяют актуальные доказательства перед собой. Даже усиление «режима размышлений» не помогает — у уже откалиброванных моделей оно иногда даёт результат хуже.
Ресурсы
SteerBench-Work (release v2026-05), Oguz Serdar, Cuneyt Mertayak — AgentDock, август 2026. Лайв-лидерборд: steerbench.com. Сравнения с XSTest, HarmBench, SWE-bench, ST-WebAgentBench, UnderSpecBench, AmPermBench, HiL-Bench.
