TL;DR
Если дать агенту пошаговый план в инструкции, хороший план заметно помогает, а плохой, но правдоподобный, ломает результат. Модель не умеет надёжно отличить одно от другого. План, который стал неверным на середине, тоже опасен: после нескольких удачных шагов модель продолжает ему доверять и идёт дальше по инерции.
Это две разные способности: «извлекать пользу из подсказки» и «отвергать вредную подсказку». Сильная модель в решении задач не обязательно умеет второе. В экспериментах плохой план ухудшал результат у всех протестированных пар «модель — задача». Хороший план помогал не везде. Падения доходили до десятков процентных пунктов.
Авторы предлагают тренировку, которая учит модель выборочно доверять плану. Читателю она недоступна: нужны дообучение и GPU. Применимо другое: сами находки о том, как ведут себя модели с пошаговыми инструкциями. Они подсказывают, как писать воркфлоу-инструкции агентам и как их проверять.
Схема эксперимента (как устроен Box²-Bench)
Задача и модель фиксированы. Меняется только план (воркфлоу) в промпте.
5 условий:
Без плана → самостоятельное решение (база)
Хороший → все шаги полезные
Плохой → все шаги правдоподобные, но уводящие в сторону
Частичный → первые k шагов хорошие, дальше плана нет
Смешанный → первые k шагов хорошие, дальше плохие
Сравнения:
Хороший − Без плана = польза от хорошего плана
Плохой − Без плана = вред от плохого плана
Смешанный − Частичный = вред от «продолжения по инерции»
Пример применения
Задача: Вы запускаете агента (Claude Code или кастомного GPT), который каждую неделю делает разбор продаж магазина на Ozon и Wildberries. Старую инструкцию писал бывший аналитик, и в ней жёсткий порядок: «1. Выгрузи отчёт. 2. Посчитай средний чек по всем SKU. 3. Отсортируй по выручке. 4. Выведи топ-10». Сейчас магазин вырос, и половина выручки приходится на три товара. Средний чек «по всем SKU» маскирует картину. Агент послушно выполняет все шаги и выдаёт красивый, но бесполезный отчёт.
Промпт (переписанная инструкция по принципу «цели + право отклониться»):
Ты аналитик продаж магазина на Ozon и WB. Каждую неделю готовишь разбор.
Ориентировочный план (цели, а не жёсткие шаги):
1. Получить свежую выгрузку и проверить, что она полная.
2. Понять, откуда пришла выручка и где она просела.
3. Выделить 3 главных вывода для владельца.
4. Предложить 2-3 действия на следующую неделю.
Как пользоваться планом:
- План — подсказка, а не приказ. Если на любом шаге видишь, что он
не подходит к текущим данным, скажи об этом одной строкой
(«Шаг 2: отклоняюсь, потому что ...») и сделай лучше.
- После каждого шага коротко проверь: «этот шаг приближает меня
к цели разбора или я просто следую пункту?»
- Если первые шаги прошли хорошо, это не повод слепо доверять
следующим. Проверяй каждый шаг заново.
Данные: {выгрузка}
Результат: Агент выдаст разбор по целям. Если шаг не подходит к данным (например, «средний чек по всем SKU»), он пометит отклонение и объяснит причину. Видно, где он следовал плану, а где ушёл от него. Это не проверенный авторами приём, а проверка вашей гипотезы на своих данных.
Почему это работает (и что именно подтверждено)
Слабость моделей. Пошаговый план в промпте для модели сильный сигнал. Она склонна ему следовать, даже когда он расходится с её собственной стратегией. Плохой план выглядит правдоподобно, и отличить его от хорошего без проверки трудно. Хороший старт усиливает доверие: после нескольких полезных шагов модель переносит это доверие на следующие, даже когда план стал вредным. Авторы называют это инерцией доверия.
Что модель умеет. Когда план хороший, она его использует: результат заметно растёт. Значит, правильная настройка не «убрать план», а сделать план отменяемым. Авторы подтвердили это обучением: их тренированные модели сохраняли пользу от хороших планов и меньше страдали от плохих. Промптом это не проверялось.
Как это применить текстом (моя интерпретация, не проверено авторами). Рычаги, которые вытекают из находок:
- Цели вместо жёстких шагов. В самой статье план как раз внешний ряд целей, а внутреннюю траекторию ведёт модель. Чем жёстче шаги, тем сильнее давит ошибка в них.
- Явное право отклониться. Разрешение «если шаг не подходит, скажи и сделай иначе» работает как предохранитель. Проверять это нужно на своих задачах.
- Проверка на каждом шаге. Из-за инерции доверия одной проверки в начале недостаточно.
- Ревью плана человеком. Плохой план опаснее его отсутствия, поэтому устаревшие инструкции стоит пересматривать.
Шаблон промпта
В статье готовых промптов нет: там обучение и бенчмарк. Ниже шаблон, который повторяет структуру их эксперимента (внешний план из целей, внутренний ход за моделью). Это моя сборка, не проверенная авторами.
Ты {роль}. Задача: {задача}.
Ориентировочный план (цели, не жёсткие шаги):
1. {цель_1}
2. {цель_2}
3. {цель_3}
Правила работы с планом:
- План — подсказка, не приказ.
- Перед каждым шагом проверь: «подходит ли этот шаг к текущим данным
и к конечной цели {конечная_цель}?»
- Если шаг не подходит — напиши «Отклоняюсь от шага N, потому что ...»
и выполни лучший вариант.
- Хорошие результаты прошлых шагов не гарантируют, что следующий шаг тоже
правильный. Проверяй каждый.
Данные: {данные}
Подставьте роль агента, задачу, 3-5 целей плана и конечный результат, по которому проверяете отклонения.
🚀 Быстрый старт — вставь в чат:
Вот шаблон инструкции с планом, который агент может отклонять.
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какая у тебя конечная цель, какие шаги в твоём текущем плане и где он уже подводил. Это нужно, чтобы сформулировать цели вместо жёстких шагов и понять, где нужны проверки.
Ограничения
⚠️ Готового промптового решения нет: авторы решали проблему обучением (дообучение на плохих планах и обучение с подкреплением). Для читателя это недоступно. Приёмы из секции выше — моя интерпретация находок, не проверенная в статье.
⚠️ Плохие планы искусственные: их создавала другая модель по заданию «сделай правдоподобно, но вводяще в заблуждение». Реальные ошибки в инструкциях бывают тоньше или грубее.
⚠️ Задачи с проверяемым ответом: математика, код, поиск, веб-магазин. Для творческих и субъективных задач выводы не проверялись.
⚠️ Обучение почти ломает пользу от планов: тренированная на плохих планах модель стала сопротивляться вообще любым планам, и польза от хороших упала. Выборочное доверие получилось только после второго этапа обучения.
⚠️ Малые выборки в части экспериментов: например, 30 задач AIME в мультиагентной проверке. Выводы там предварительные, и авторы пишут, что прирост неравномерный.
Как исследовали
Идея простая: зафиксировать модель и задачу, менять только план в промпте. Планы делала отдельная модель, а независимый проверяющий отсеивал неправильные, нерелевантные и «протекающие» ответом. Три современные модели (Gemini Flash, DeepSeek V4 Flash, GLM 5.2) прогнали на четырёх типах задач: математика, программирование, поиск, работа с инструментами.
Результат: хороший план помог в восьми из двенадцати пар «модель — задача». Плохой план ухудшил результат во всех двенадцати, на величину от 2,3 до 43,3 пункта. Смешанный план проигрывал частичному в десяти из двенадцати пар. Сравнение тут чистое: обе версии начинаются одинаково, но у одной после перехода шагов нет, а у другой они вредные. То есть дело не в отсутствии подсказки, а именно в продолжении слепого доверия.
Дальше авторы дообучили маленькие открытые модели (Qwen3-4B и Qwen3.5-9B) только на плохих планах. Вред от плохого плана на AIME упал с 20 до 6,7 пункта, на WebShop с 9,8 до 0,6. Но пользу от хороших планов модель потеряла. Обучение с подкреплением вернуло её: прирост от хорошего плана стал +6,7 вместо −3,3. Тренированные модели перенесли это поведение на подсказки других агентов и на повреждённую память: чаще проверяли записи, а не верили им.
Практический инсайт: способность «пользоваться подсказкой» и способность «ей не подчиняться» нужно проверять отдельно. Отличный результат без плана ничего не говорит о том, как агент поведёт себя с плохой инструкцией.
Адаптации и экстраполяции
🔧 Техника: добавить контрольные точки → бороться с инерцией доверия
Если агент выполняет длинный план, вставьте проверки не только в начале, но и после каждых 2-3 шагов:
После шага 3 остановись и ответь: «Результаты шагов 1-3 соответствуют цели?
Какой из следующих шагов теперь вызывает сомнение?»
Это моя гипотеза на основе находки об инерции. Проверьте на своих данных.
🔧 Техника: аудит инструкции → поиск «плохих шагов»
Перед запуском агента попросите другую модель или новый чат найти в инструкции шаги, которые могут навредить:
Вот инструкция агенту: {инструкция}. Задача: {задача}.
Найди шаги, которые выглядят разумно, но могут увести от цели на текущих
данных. Для каждого — когда он вреден и как переформулировать.
Это копирует подход статьи наоборот. Там модель делала правдоподобные, но вредные шаги, а здесь мы просим найти такие шаги в своей инструкции.
Ресурсы
- Статья: «Thinking Outside the Box: Can Language Models Rely on External Guidance Selectively?» (Box²-Bench).
- Авторы: Minghan Wang, Boyuan Wang, Jinhang Zuo, Yuxin Tao, Fang Kong. Southern University of Science and Technology, City University of Hong Kong.
- Бенчмарки в экспериментах: OpenR1-Math, DeepSWE, BrowseComp, AutomationBench, AIME 2026, WebShop, LongMemEval-V2-Small, Economy of Minds.
