TL;DR
Когда AI-агент работает над сложной задачей много часов подряд, он застревает в одной узкой колее действий — вместо того, чтобы менять стратегию, он по кругу подкручивает один и тот же приём. Метод — это промпт-блок на ~1000 токенов, который явно запрещает петлевые действия, прописывает проверенные практики заранее и заставляет модель каждые 30-60 минут останавливаться и спрашивать себя, не застряла ли она.
Главная находка: исследователи сравнили, как люди и два AI-агента (Codex и MLEvolve) решают одни и те же задачи на Kaggle. Люди чередуют работу с данными, проверку, смену модели, ансамблирование — и возвращаются к идеям, которые отложили раньше. Агенты вместо этого зацикливаются: один агент бесконечно перевешивает готовый ансамбль моделей, второй — бесконечно мутирует одну и ту же модель (меняет эпохи, слои, зерна случайности). Ни тот, ни другой почти никогда не меняют направление и почти никогда не возвращаются к брошенным подходам — это как человек, который зациклился на одной правке текста, вместо того чтобы переписать абзац целиком.
Промпт с явными запретами на повторяющиеся действия и периодическими напоминаниями частично выводит агента из петли и поднимает результат почти во всех проверенных задачах. Но работает он избирательно: запреты модель выполняет с перехлёстом (совсем перестаёт делать даже уместные вещи), а советы не помогают, если агент уже и так делает это на человеческом уровне.
Схема метода
ШАГ 1: Anti-loop constraints — запрет зацикленных действий
(одна валидация без вариаций, мелкие правки одного и того же места,
переписывание всего кода до появления рабочей версии)
→ список явных запретов в промпте
ШАГ 2: Human-prior practices — предписать проверенные приёмы с самого начала
(кросс-валидация, ансамбль моделей, сохранение промежуточных предсказаний)
→ чек-лист действий "делай с первой версии"
ШАГ 3: Periodic self-check — каждые 30-60 минут (или условных "шагов" в диалоге)
агент сверяет, не застрял ли он в одном виде работы
→ повторный вопрос-триггер, вставляемый заново в промпт
ШАГ 4: Task-specific priors — адаптация правил под тип задачи
(другие приёмы для картинок, другие для табличных данных)
→ контекстная настройка списка из шага 2
Все четыре шага живут в одном промпте, который повторно вставляется в диалог с агентом на протяжении всей работы — это не одноразовая инструкция, а инструкция с "перезапуском".
Пример применения
Задача: Вы просите ChatGPT (в режиме агента / Code Interpreter) несколько часов подряд анализировать таблицу с продажами интернет-магазина и искать закономерности, чтобы предложить, как поднять выручку.
Промпт:
Ты работаешь над задачей: найди факторы, влияющие на выручку интернет-магазина,
и предложи 3 конкретные гипотезы для теста. У тебя есть доступ к таблице продаж.
Работай по правилам:
ЗАПРЕЩЕНО:
- Больше 2 раз подряд перепроверять одну и ту же гипотезу другими цифрами
- Менять только формулировки выводов без новых данных
- Переписывать весь анализ с нуля, если базовая версия уже работает
ДЕЛАЙ С НАЧАЛА:
- Проверяй каждую гипотезу на двух разных срезах данных (например, по месяцам и по категориям)
- Держи в голове список гипотез, которые отклонил — не удаляй их
- Раз в 3-4 действия сравнивай новые находки со старыми выводами
КАЖДЫЕ 5 ШАГОВ ОСТАНАВЛИВАЙСЯ И СПРАШИВАЙ СЕБЯ:
- Я продолжаю копать в одном направлении, или пробую разное?
- Есть отклонённая гипотеза, к которой стоит вернуться с новыми данными?
Начинай анализ.
Результат: Модель будет периодически (раз в несколько ответов) делать паузу и явно проверять себя по вопросам из блока "остановись и спроси", вслух перечисляя, какие направления она уже пробовала и какие отложила. Ответы станут разнообразнее по типу анализа (не только "давай ещё раз посчитаем среднее"), а старые отклонённые идеи будут периодически всплывать заново с новыми аргументами.
Почему это работает
Модель, работающая долго над одной задачей, не помнит, что она уже отбросила — у неё нет внутреннего чувства "я это уже пробовал и не сработало, пойду в другую сторону". Она просто продолжает подкручивать последнее, что видела перед собой, потому что это самый простой следующий шаг.
Зато модель отлично следует явно названным правилам, если их сформулировать конкретно и напомнить о них снова через некоторое время. Абстрактное "будь разнообразнее" не работает — а конкретный список "не делай так, делай вот так, спроси себя об этом" работает.
Метод использует эту сильную сторону: вместо того, чтобы надеяться, что модель сама сообразит менять стратегию, ей называют конкретные петли по имени и вставляют напоминание с чётким интервалом — это работает как будильник, который прерывает автопилот.
Рычаги управления: - Список запретов — сузь или расширь под свою задачу. Слишком жёсткий запрет может привести к перехлёсту: модель совсем перестанет делать даже уместные вещи. - Частота напоминаний — для короткой сессии (10-15 сообщений) можно вставлять напоминание каждые 3-4 ответа, для длинной — реже. - Список "делай сразу" — если модель и так справляется хорошо в этой части, лишние инструкции не дадут эффекта, только займут место.
Ограничения
⚠️ Перехлёст от запретов: если что-то полностью запретить, модель может перестать делать это даже там, где это уместно. Исследование показало: агент, которому запретили "простую" проверку без кросс-валидации, перестал использовать её вообще — хотя иногда она была лучшим выбором.
⚠️ Нулевой эффект для того, что модель уже умеет: если модель уже действует на нужном уровне в какой-то части задачи, добавление инструкции про это ничего не меняет — инструкция помогает только там, где есть реальный разрыв.
⚠️ Не решает фундаментальную разницу в стиле работы: промпт сдвигает только то поведение, которое можно свести к явному правилу. Общий "профиль" работы модели (какие типы действий она предпочитает) остаётся прежним — это подсказка, а не пересборка модели.
Как исследовали
Команда собрала 4465 траекторий людей с Kaggle (134 соревнования) — по сути, историю каждой правки кода с оценкой и временной меткой — и сопоставила с 207 траекториями двух AI-агентов (Codex и MLEvolve) на 7 тех же соревнованиях. Каждую правку кода размечали: что поменяли, зачем, насколько сильно и как это повлияло на результат.
Разница оказалась не в мелочах: люди чередуют виды работы и регулярно возвращаются к отложенным идеям (у топовых участников — 78% таких возвратов заканчиваются лучше, чем было). Агенты почти никогда не возвращались — Codex сделал это один раз за все прогоны, MLEvolve — ни разу.
Затем протестировали планирующий промпт на 7 соревнованиях с 12-часовым лимитом, сравнив четыре варианта: обычная задача, задача с промптом, задача с одноразовой вставкой без повторов и задача с повторами без содержания. Результат неожиданный: без содержания повторение ничего не давало — улучшение приносило именно что написано в промпте, а не то, что его напоминают снова и снова. Это и есть главный практический вывод: содержание правил важнее частоты напоминаний.
Ресурсы
TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development Jiarui Yan, Weiwei Sun, Sijie Li, Wenhan Li, Yiming Yang — Carnegie Mellon University Датасет: huggingface.co/datasets/jerryyan/TraceML
