3,583 papers
arXiv:2609.39578 76 30 сент. 2026 г. FREE

Box²-Bench: модели слепо идут за чужим планом, даже когда он ведёт не туда

КЛЮЧЕВАЯ СУТЬ
Если дать агенту пошаговый план в инструкции, хороший план заметно помогает, а плохой, но правдоподобный, ломает результат. Модель не умеет надёжно отличить одно от другого. План, который стал неверным на середине, тоже опасен: после нескольких удачных шагов модель продолжает ему доверять и идёт дальше по инерции.
Адаптировать под запрос
⚡

TL;DR

Если дать агенту пошаговый план в инструкции, хороший план заметно помогает, а плохой, но правдоподобный, ломает результат. Модель не умеет надёжно отличить одно от другого. План, который стал неверным на середине, тоже опасен: после нескольких удачных шагов модель продолжает ему доверять и идёт дальше по инерции.

Это две разные способности: «извлекать пользу из подсказки» и «отвергать вредную подсказку». Сильная модель в решении задач не обязательно умеет второе. В экспериментах плохой план ухудшал результат у всех протестированных пар «модель — задача». Хороший план помогал не везде. Падения доходили до десятков процентных пунктов.

Авторы предлагают тренировку, которая учит модель выборочно доверять плану. Читателю она недоступна: нужны дообучение и GPU. Применимо другое: сами находки о том, как ведут себя модели с пошаговыми инструкциями. Они подсказывают, как писать воркфлоу-инструкции агентам и как их проверять.

🔍

Схема эксперимента (как устроен Box²-Bench)

Задача и модель фиксированы. Меняется только план (воркфлоу) в промпте.

5 условий:
  Без плана   → самостоятельное решение (база)
  Хороший     → все шаги полезные
  Плохой      → все шаги правдоподобные, но уводящие в сторону
  Частичный   → первые k шагов хорошие, дальше плана нет
  Смешанный   → первые k шагов хорошие, дальше плохие

Сравнения:
  Хороший − Без плана      = польза от хорошего плана
  Плохой − Без плана       = вред от плохого плана
  Смешанный − Частичный    = вред от «продолжения по инерции»
🚀

Пример применения

Задача: Вы запускаете агента (Claude Code или кастомного GPT), который каждую неделю делает разбор продаж магазина на Ozon и Wildberries. Старую инструкцию писал бывший аналитик, и в ней жёсткий порядок: «1. Выгрузи отчёт. 2. Посчитай средний чек по всем SKU. 3. Отсортируй по выручке. 4. Выведи топ-10». Сейчас магазин вырос, и половина выручки приходится на три товара. Средний чек «по всем SKU» маскирует картину. Агент послушно выполняет все шаги и выдаёт красивый, но бесполезный отчёт.

Промпт (переписанная инструкция по принципу «цели + право отклониться»):

Ты аналитик продаж магазина на Ozon и WB. Каждую неделю готовишь разбор.

Ориентировочный план (цели, а не жёсткие шаги):
1. Получить свежую выгрузку и проверить, что она полная.
2. Понять, откуда пришла выручка и где она просела.
3. Выделить 3 главных вывода для владельца.
4. Предложить 2-3 действия на следующую неделю.

Как пользоваться планом:
- План — подсказка, а не приказ. Если на любом шаге видишь, что он 
  не подходит к текущим данным, скажи об этом одной строкой 
  («Шаг 2: отклоняюсь, потому что ...») и сделай лучше.
- После каждого шага коротко проверь: «этот шаг приближает меня 
  к цели разбора или я просто следую пункту?»
- Если первые шаги прошли хорошо, это не повод слепо доверять 
  следующим. Проверяй каждый шаг заново.

Данные: {выгрузка}

Результат: Агент выдаст разбор по целям. Если шаг не подходит к данным (например, «средний чек по всем SKU»), он пометит отклонение и объяснит причину. Видно, где он следовал плану, а где ушёл от него. Это не проверенный авторами приём, а проверка вашей гипотезы на своих данных.

🧠

Почему это работает (и что именно подтверждено)

Слабость моделей. Пошаговый план в промпте для модели сильный сигнал. Она склонна ему следовать, даже когда он расходится с её собственной стратегией. Плохой план выглядит правдоподобно, и отличить его от хорошего без проверки трудно. Хороший старт усиливает доверие: после нескольких полезных шагов модель переносит это доверие на следующие, даже когда план стал вредным. Авторы называют это инерцией доверия.

Что модель умеет. Когда план хороший, она его использует: результат заметно растёт. Значит, правильная настройка не «убрать план», а сделать план отменяемым. Авторы подтвердили это обучением: их тренированные модели сохраняли пользу от хороших планов и меньше страдали от плохих. Промптом это не проверялось.

Как это применить текстом (моя интерпретация, не проверено авторами). Рычаги, которые вытекают из находок:

  • Цели вместо жёстких шагов. В самой статье план как раз внешний ряд целей, а внутреннюю траекторию ведёт модель. Чем жёстче шаги, тем сильнее давит ошибка в них.
  • Явное право отклониться. Разрешение «если шаг не подходит, скажи и сделай иначе» работает как предохранитель. Проверять это нужно на своих задачах.
  • Проверка на каждом шаге. Из-за инерции доверия одной проверки в начале недостаточно.
  • Ревью плана человеком. Плохой план опаснее его отсутствия, поэтому устаревшие инструкции стоит пересматривать.
📋

Шаблон промпта

В статье готовых промптов нет: там обучение и бенчмарк. Ниже шаблон, который повторяет структуру их эксперимента (внешний план из целей, внутренний ход за моделью). Это моя сборка, не проверенная авторами.

Ты {роль}. Задача: {задача}.

Ориентировочный план (цели, не жёсткие шаги):
1. {цель_1}
2. {цель_2}
3. {цель_3}

Правила работы с планом:
- План — подсказка, не приказ.
- Перед каждым шагом проверь: «подходит ли этот шаг к текущим данным 
  и к конечной цели {конечная_цель}?»
- Если шаг не подходит — напиши «Отклоняюсь от шага N, потому что ...» 
  и выполни лучший вариант.
- Хорошие результаты прошлых шагов не гарантируют, что следующий шаг тоже 
  правильный. Проверяй каждый.

Данные: {данные}

Подставьте роль агента, задачу, 3-5 целей плана и конечный результат, по которому проверяете отклонения.

🚀 Быстрый старт — вставь в чат:

Вот шаблон инструкции с планом, который агент может отклонять. 
Адаптируй под мою задачу: {твоя задача}. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какая у тебя конечная цель, какие шаги в твоём текущем плане и где он уже подводил. Это нужно, чтобы сформулировать цели вместо жёстких шагов и понять, где нужны проверки.

⚠️

Ограничения

⚠️ Готового промптового решения нет: авторы решали проблему обучением (дообучение на плохих планах и обучение с подкреплением). Для читателя это недоступно. Приёмы из секции выше — моя интерпретация находок, не проверенная в статье.

⚠️ Плохие планы искусственные: их создавала другая модель по заданию «сделай правдоподобно, но вводяще в заблуждение». Реальные ошибки в инструкциях бывают тоньше или грубее.

⚠️ Задачи с проверяемым ответом: математика, код, поиск, веб-магазин. Для творческих и субъективных задач выводы не проверялись.

⚠️ Обучение почти ломает пользу от планов: тренированная на плохих планах модель стала сопротивляться вообще любым планам, и польза от хороших упала. Выборочное доверие получилось только после второго этапа обучения.

⚠️ Малые выборки в части экспериментов: например, 30 задач AIME в мультиагентной проверке. Выводы там предварительные, и авторы пишут, что прирост неравномерный.

🔍

Как исследовали

Идея простая: зафиксировать модель и задачу, менять только план в промпте. Планы делала отдельная модель, а независимый проверяющий отсеивал неправильные, нерелевантные и «протекающие» ответом. Три современные модели (Gemini Flash, DeepSeek V4 Flash, GLM 5.2) прогнали на четырёх типах задач: математика, программирование, поиск, работа с инструментами.

Результат: хороший план помог в восьми из двенадцати пар «модель — задача». Плохой план ухудшил результат во всех двенадцати, на величину от 2,3 до 43,3 пункта. Смешанный план проигрывал частичному в десяти из двенадцати пар. Сравнение тут чистое: обе версии начинаются одинаково, но у одной после перехода шагов нет, а у другой они вредные. То есть дело не в отсутствии подсказки, а именно в продолжении слепого доверия.

Дальше авторы дообучили маленькие открытые модели (Qwen3-4B и Qwen3.5-9B) только на плохих планах. Вред от плохого плана на AIME упал с 20 до 6,7 пункта, на WebShop с 9,8 до 0,6. Но пользу от хороших планов модель потеряла. Обучение с подкреплением вернуло её: прирост от хорошего плана стал +6,7 вместо −3,3. Тренированные модели перенесли это поведение на подсказки других агентов и на повреждённую память: чаще проверяли записи, а не верили им.

Практический инсайт: способность «пользоваться подсказкой» и способность «ей не подчиняться» нужно проверять отдельно. Отличный результат без плана ничего не говорит о том, как агент поведёт себя с плохой инструкцией.

💡

Адаптации и экстраполяции

🔧 Техника: добавить контрольные точки → бороться с инерцией доверия

Если агент выполняет длинный план, вставьте проверки не только в начале, но и после каждых 2-3 шагов:

После шага 3 остановись и ответь: «Результаты шагов 1-3 соответствуют цели?
Какой из следующих шагов теперь вызывает сомнение?» 

Это моя гипотеза на основе находки об инерции. Проверьте на своих данных.

🔧 Техника: аудит инструкции → поиск «плохих шагов»

Перед запуском агента попросите другую модель или новый чат найти в инструкции шаги, которые могут навредить:

Вот инструкция агенту: {инструкция}. Задача: {задача}.
Найди шаги, которые выглядят разумно, но могут увести от цели на текущих 
данных. Для каждого — когда он вреден и как переформулировать.

Это копирует подход статьи наоборот. Там модель делала правдоподобные, но вредные шаги, а здесь мы просим найти такие шаги в своей инструкции.

🔗

Ресурсы

  • Статья: «Thinking Outside the Box: Can Language Models Rely on External Guidance Selectively?» (Box²-Bench).
  • Авторы: Minghan Wang, Boyuan Wang, Jinhang Zuo, Yuxin Tao, Fang Kong. Southern University of Science and Technology, City University of Hong Kong.
  • Бенчмарки в экспериментах: OpenR1-Math, DeepSWE, BrowseComp, AutomationBench, AIME 2026, WebShop, LongMemEval-V2-Small, Economy of Minds.

Проблемы LLM

ПроблемаСутьКак обойти
Модель слепо идёт за плохим пошаговым планомТы даёшь в инструкции жёсткий список шагов. Один шаг неверный, но выглядит разумно. Модель его выполняет. Результат хуже, чем без плана вообще. Так бывает с устаревшими инструкциями, чужими шаблонами, планами от другой модели. Модель не отличает вредный шаг от полезного. План для неё сильный сигнал, сильнее собственной стратегииПиши план как цели, а не как жёсткие шаги. Добавь явное право отклониться: «если шаг не подходит к данным, скажи об этом и сделай лучше». Устаревшие инструкции пересматривай. Плохой план опаснее, чем никакого. Это вывод из находок, сами авторы промптом его не проверяли
После удачных шагов модель верит плану дальше, даже когда он ошибсяПервые шаги плана были хорошими и дали результат. Потом план стал вредным. Модель не замечает перелома. Она переносит доверие на следующие шаги и идёт по инерции. Одна проверка в начале не спасаетТребуй короткую проверку после каждого шага: «приближает ли этот шаг к цели или я просто следую пункту?». Добавь фразу: «успех прошлых шагов не гарантирует, что следующий верный». Приём не проверен авторами, это гипотеза

Методы

МетодСуть
План из целей с правом отклониться — защита от плохих шаговВместо жёстких шагов дай ориентировочные цели. Добавь три правила. 1) «План — подсказка, не приказ». 2) «Перед шагом проверь: подходит ли он к текущим данным и конечной цели?». 3) «Если не подходит, напиши Отклоняюсь от шага N, потому что ... и сделай лучше». Почему работает: жёсткий шаг модель воспринимает как приказ. Цель оставляет ей выбор способа. Явное разрешение снижает давление плана. Строка об отклонении делает расхождения видимыми, и ты видишь, где план устарел. Когда применять: повторяющиеся задачи агента, старые или чужие инструкции, данные меняются. Когда не нужно: шаги строго обязательны (юридические, регламентные). Тут отклонение вредно. Ограничение: авторы проверяли это только обучением модели, не промптом. Проверь на своих данных

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с