3,583 papers
arXiv:2609.30199 80 24 сент. 2026 г. FREE

ExplorationBench: агент осваивает незнакомые правила только через живую обратную связь, а не через «подумай ещё»

КЛЮЧЕВАЯ СУТЬ
Модель, которая «думала дольше», осталась на уровне 0,5–11%. Модель с доступом к среде дошла до 87,6%. Метод позволяет заставить агента вскрывать реальные правила незнакомой системы: API, где документация врёт, или формата, который ведёт себя не по привычке. Агент сам придумывает пробы, запускает их и читает точный ответ. Потом он сдаёт экзамен без инструментов на задачах, которых раньше не видел.
Адаптировать под запрос
⚡

TL;DR

Когда агенту надо разобраться в незнакомой системе (расхождение документации и реальности, нестандартное API, внутренние правила компании), выигрывает цикл «сам придумал проверку → запустил → прочитал результат → поправил гипотезу». ExplorationBench — стенд из двух выдуманных миров с правилами, противоречащими привычным знаниям. В одном из миров числа молча меняются при выводе, а счёт позиций идёт с единицы вместо нуля. Модели получают кривую инструкцию, четыре раунда на эксперименты и итоговый экзамен без инструментов.

Главная находка: дополнительные «размышления» без обратной связи не заменяют эксперименты. В мире с программами модель, которая просто «думала дольше», осталась почти на нуле. Модель с доступом к среде выросла до 87%. Важно и кто выбирает проверки. Если дать модели готовые удачные эксперименты, но не дать их придумывать, результат падает почти у всех. Случайные проверки почти бесполезны. Ещё две ловушки: модель может правильно назвать правило и всё равно ошибиться при его применении, а лишние раунды исследования иногда ухудшают уже достигнутое. Разброс между запусками одной и той же модели огромный: от почти нуля до почти максимума.

Практический вывод для настройки агента: даём ему инструмент, который возвращает точный результат (запуск кода, тестовый запрос, проверку). В инструкции требуем самому планировать проверки, фиксировать найденные правила и сверять их с контрольными задачами без подсказок. Запускаем несколько попыток и выбираем лучшую.

📌

Схема протокола из исследования

ШАГ 0: Модель получает неточную инструкцию + несколько решённых примеров (без вызова инструментов)
        → замер M0 (что знает «из головы»)
ШАГ 1–4: Раунд исследования — модель сама придумывает пробы
        (программа / доказательство), запускает их в среде,
        читает точный результат, дописывает в историю
        → после каждого раунда замер M1…M4
ЗАМЕР (в отдельной копии диалога, без инструментов):
        а) перечислить правила, которые модель считает верными
        б) решить 70 контрольных задач, которых она не видела
        → копия удаляется, чтобы тест не давал новых данных
ИТОГ: из трёх независимых запусков берётся лучший

Все шаги идут в одном диалоге, без памяти между запусками и без обновления весов.

🚀

Пример применения

Метод сильнее всего там, где можно быстро и точно проверить результат: код, API, формулы, воспроизводимые инструкции. Он слабее для субъективных задач вроде «оценить креатив». Поэтому берём интеграцию, где документация расходится с реальностью.

Задача: Вы подключаете магазин к API маркетплейса (Wildberries, Ozon). В документации написано одно, а на деле поля приходят в другом формате, даты в другой таймзоне, пагинация считается с единицы. Вы в Claude Code или Cursor с доступом к тестовому кабинету. Гадать по документации бессмысленно.

Промпт:

Ты исследуешь API маркетплейса, документация которого может быть неточной.
Не доверяй документации и своим привычным представлениям об API.


Документация лежит в файле docs/api.md. Считай её гипотезой, не фактом.



Проведи 4 раунда исследования. В каждом раунде:
1. Сам придумай 3–5 коротких проб — запросов, которые проверят самые
   сомнительные места: пагинацию, формат дат, обработку пустых полей,
   лимиты, коды ошибок.
2. Выполни пробы через тестовый кабинет и прочитай ответы дословно.
3. Запиши в файл findings.md: что ожидал → что получил → вывод-правило.
4. Не повторяй пробу, которая уже дала ответ. Следующую выбирай так,
   чтобы она отличала твои гипотезы друг от друга.



После каждого раунда, не вызывая инструменты:
- выпиши список правил, в которых уверен, и список тех, что не проверены;
- реши 5 контрольных мини-задач (например, «что вернёт запрос
  страницы 2 с лимитом 50?») только по findings.md;
- пометь любое правило, которое противоречит предыдущему раунду.
Если контрольные задачи показали ошибки — вернись к пробам, не расширяй
findings.md догадками.


В конце выдай итоговый список правил с подтверждающей пробой
для каждого.

Результат: Агент проведёт несколько раундов: сначала запросы и сверка с документацией, потом уточняющие пробы на спорных местах. На каждом раунде появится список правил в findings.md со ссылками на пробы. После раундов будут видны контрольные ответы по записям. Если какое-то правило вызовет противоречие, агент пометит его и вернётся к пробам. В финале вы получите проверенный список реальных правил API, а не пересказ документации.

🧠

Почему это работает

Слабость. У модели есть сильные привычки, например «страницы считаются с нуля» или «число выводится как есть». Если реальность их нарушает, дополнительные рассуждения не помогают. Модель продолжает думать теми же привычками, а новых данных у неё нет. Поэтому «дольше думающая» модель в программном мире осталась на нуле.

Сильная сторона. Модель хорошо замечает расхождение между ожиданием и результатом и умеет строить гипотезы по примерам. Когда она видит точный ответ среды, она быстро находит, какое правило сломано.

Как протокол это использует. Обратная связь даёт данные, которых нет в голове. Самостоятельный выбор проб направляет эксперименты на неопределённые места: если подставить чужие или случайные пробы, польза резко падает. Отдельный экзамен без инструментов проверяет, что модель поняла, а не просто нагенерировала записей.

Рычаги управления: - Число раундов — уменьшай для простых систем. Статья показывает, что продолжение иногда ухудшает результат, так что бесконечные раунды опасны. - Контрольные задачи — чем точнее и разнообразнее, тем лучше видно, применяет ли агент правило или только его проговаривает. - Запрет повторять пробы — экономит бюджет и толкает к новым гипотезам. - Несколько независимых запусков — разброс между попытками одной модели огромный. Запускай 2–3 попытки с нуля и выбирай лучшую по контрольным задачам. - Явный список правил — убери его, если не нужен отчёт. Но тогда ты не отличишь «не нашёл правило» от «нашёл, но не применил».

🔍

Что показали эксперименты

  • Без обратной связи (дополнительные ходы без доступа к среде) программный мир остался на уровне 0,5–11%. С исследованием лучшая траектория дошла до 87,6%.
  • Кто выбирает пробы. Модель сама проектирует пробы — медиана 66%. Те же самые лучшие пробы, но выбранные заранее и повторённые — 40,7%. Случайные пробы по шаблону — 5,7%. В логическом мире разницы между своими и повторёнными пробами почти нет: там важнее, какие доказательства пробуют.
  • Знать ≠ применять. Даже когда нужные правила были названы верно, задачи решались лишь в 71% случаев.
  • Подсказка с полным списком правил в логическом мире (93–97%) оказалась лучше собственных исследований у всех моделей.
  • Нестабильность. Траектории одной модели расходились до 72,8 пункта. В 6 из 30 программных запусков итог оказался хуже одного из прежних промежуточных замеров.
  • Ранги моделей не переносятся. Лидер в одном мире необязательно лидирует в другом (корреляция рангов 0,35).
📋

Шаблон промпта

Это адаптация протокола бенчмарка под рабочую задачу (структуру раундов и отдельной проверки без инструментов сохранили).

Ты исследуешь систему {система}, в описании которой могут быть ошибки.
Не доверяй описанию и привычным представлениям о таких системах.


{где_лежит_описание_или_инструкция}
Считай его гипотезой, не фактом.



{2–3 примера: входные данные и точный результат, который выдала система}



Проведи {число_раундов} раундов. В каждом раунде:
1. Сам придумай {число_проб} проб — {что_можно_запускать},
   которые проверят самые сомнительные места.
2. Выполни их через {инструмент} и прочитай результат дословно.
3. Запиши в {файл_заметок}: ожидал → получил → правило.
4. Не повторяй пробы с уже известным ответом. Выбирай следующую так,
   чтобы разделить конкурирующие гипотезы.



После каждого раунда, не вызывая инструменты:
- перечисли правила, в которых уверен, и непроверенные;
- реши {число} контрольных задач только по {файл_заметок};
- отметь противоречия с прошлыми раундами.
Если ответы на контрольные расходятся с ожиданием — вернись к пробам,
не достраивай правила догадками.



Итоговый список правил с подтверждающей пробой для каждого.

Что подставлять: {система} — объект исследования (API, формат файла, внутренний регламент). {инструмент} — то, что вернёт точный результат (запуск скрипта, тестовый запрос). {число_раундов} — для начала 3–4. Контрольные задачи придумай заранее, чтобы ответ можно было проверить.

🚀 Быстрый старт — вставь в чат или в агента:

Вот шаблон исследовательского цикла. Адаптируй под мою задачу: [твоя задача].
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, что именно исследуем, какой инструмент вернёт точный результат и какие контрольные задачи можно проверить без подсказок. Эти три вещи и есть суть метода: без проверяемой обратной связи цикл превращается в рассуждения «в голове».

⚠️

Ограничения

⚠️ Нужна точная обратная связь: Метод работает, когда среда возвращает однозначный результат (вывод программы, проверка доказательства, ответ API). Для субъективных задач (текст, дизайн, стратегия) выводы статьи напрямую не переносятся.

⚠️ Нет готового промпта: Авторы измеряют поведение моделей и не проверяют промпты, которые улучшают исследование. Шаблон выше адаптирует протокол бенчмарка. Он основан на выводах статьи, но сама статья его не тестировала.

⚠️ Нестабильность: Результаты одной модели в разных запусках расходятся сильнее, чем между разными моделями. Один прогон ничего не доказывает. Больше раундов не значит лучше: в части запусков итог оказался хуже промежуточного.

⚠️ Миры синтетические: Правила выдуманные и жёстко формальные. В логическом мире самостоятельный выбор проб ничего не добавил, а полный список правил от человека обошёл любое самообучение модели. Если правила известны, лучше дать их сразу.

⚠️ Нет универсального лидера: Рейтинг моделей между двумя мирами почти не совпадает. Выбирай модель по своей задаче, а не по общему рейтингу.

🔗

Ресурсы

  • ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds — www.explorationbench.com
  • Авторы: команда из Fudan University, Hunyuan Team (Tencent) и Tsinghua University (контакты: mingzhang23@m.fudan.edu.cn, tgui@fudan.edu.cn, qz@fudan.edu.cn, congzheng@tencent.com, maxmpan@tencent.com)
  • Связанные работы, упомянутые в статье: SWE-bench, τ-bench, MARS, DiscoveryWorld, NewtonBench, CL-bench, ReAct

📋 Дайджест исследования

Ключевая суть

Модель, которая «думала дольше», осталась на уровне 0,5–11%. Модель с доступом к среде дошла до 87,6%. Метод позволяет заставить агента вскрывать реальные правила незнакомой системы: API, где документация врёт, или формата, который ведёт себя не по привычке. Агент сам придумывает пробы, запускает их и читает точный ответ. Потом он сдаёт экзамен без инструментов на задачах, которых раньше не видел.

Принцип работы

Цикл из четырёх шагов, повторяется несколько раундов. 1. Проба: агент сам придумывает 3–5 коротких запросов на самые сомнительные места. 2. Чтение: он запускает их и читает ответ дословно. 3. Запись: в файл идёт тройка «ожидал, получил, правило». 4. Экзамен: агент решает контрольные задачи только по записям, без инструментов. Правило считается найденным, когда по нему решена задача, которую агент не видел. Просто красиво сформулировать мало. Это как следователь и кабинетный теоретик. Следователь идёт на место и щупает улики. Теоретик строит версии из головы. Контрольные задачи — это допрос следователя: а по твоей версии что будет вот здесь?

Почему работает

У модели крепкие привычки: страницы считаются с нуля, число выводится как есть. Реальность их ломает, а новых данных в голове нет. Дополнительные размышления крутят те же привычки по кругу. Эксперимент приносит данные, которых в голове нет, а точный ответ среды сразу показывает, какая привычка сломана. Важно и то, кто выбирает пробы. Свои пробы модели: медиана 66%. Те же лучшие пробы, но выбранные заранее и повторённые: 40,7%. Случайные пробы по шаблону: 5,7%. Жесть — случайные эксперименты почти равны отсутствию экспериментов. Есть две ловушки. Правило названо верно, а задачи решены лишь в 71% случаев. Знать и применять — разные вещи. Кроме того, в 6 из 30 запусков лишние раунды ухудшили уже достигнутый итог. Разброс между запусками одной модели доходил до 72,8 пункта. Один прогон ничего не доказывает.

Когда применять

Агенты (Claude Code, Cursor) → отладка интеграций, где документация расходится с реальностью, особенно когда есть тестовый стенд с точным ответом: запуск кода, тестовый запрос, проверка формата. Подходит и для изучения внутренних правил, если результат можно проверить однозначно. НЕ подходит для субъективных задач: креатив, дизайн, стратегия. Там нет точного отклика, и выводы статьи не переносятся. Если правила уже известны, не гоняй агента по кругу — дай их сразу. В логическом мире полный список правил (93–97%) обошёл любое самообучение модели.

Мини-рецепт

1. Найди источник правды: инструмент, который возвращает точный результат. Это запуск скрипта, тестовый кабинет или проверка формата. Нет такого — метод не заработает.
2. Назови документацию гипотезой: в промпте напиши «не доверяй описанию и привычкам». Иначе модель просто перескажет мануал.
3. Заставь планировать самому: «придумай 3–5 проб на самые сомнительные места». Готовые чужие пробы дают 40,7% вместо 66%.
4. Веди файл заметок: ожидал, получил, правило. Без записи не отличить «не нашёл» от «забыл».
5. Запрети повторы: известный ответ не проверяем заново. Следующую пробу выбирай так, чтобы она разводила конкурирующие гипотезы.
6. Устрой экзамен: после каждого раунда 5 контрольных задач только по заметкам. Ответы придумай и проверь заранее.
7. Не тяни раунды: для начала 3–4. Лишние иногда портят результат.
8. Запусти 2–3 раза с нуля: выбери лучший прогон по контрольным задачам. Разброс огромный, одна попытка ничего не значит.

Честная оговорка: авторы сами не проверяли такие промпты. Цикл собран из выводов их контрольных условий.

Примеры

[ПЛОХО]: `Прочитай docs/api.md и напиши интеграцию с API маркетплейса` [ХОРОШО]: `Документация docs/api.md может врать, считай её гипотезой. Проведи 4 раунда. В каждом сам придумай 3–5 проб на самые сомнительные места: пагинация, формат дат, пустые поля, коды ошибок. Выполни их через тестовый кабинет, прочитай ответы дословно. Запиши в findings.md: ожидал, получил, правило. Не повторяй пробу с известным ответом. После каждого раунда, не вызывая инструменты, реши 5 контрольных задач только по findings.md. Например: что вернёт страница 2 с лимитом 50? Если ответы разошлись с ожиданием, вернись к пробам и не достраивай правила догадками. В конце выдай список правил с подтверждающей пробой для каждого.` В первом случае агент пересказывает документацию и ломается на проде. Во втором получаешь список реальных правил, каждое привязано к пробе. [ПЛОХО]: `Подумай хорошенько и найди, как этот формат на самом деле считает позиции` [ХОРОШО]: `Придумай 3 пробы, которые отличат счёт с нуля от счёта с единицы. Запусти их, запиши результат в notes.md. Затем решай контрольные задачи только по notes.md.`
Источник: ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds
ArXiv ID: 2609.30199 | Сгенерировано: 2026-10-09 11:10

Проблемы LLM

ПроблемаСутьКак обойти
Модель держится за привычные правила, даже когда система работает иначе. Думать дольше не помогаетАгент работает с незнакомой системой: нестандартным API, неточной документацией, внутренними правилами. У модели есть сильные привычки. Например: «страницы считаются с нуля», «число выводится как есть». Если реальность их нарушает, просьба «подумай ещё» ничего не даёт. Новых данных нет. Модель продолжает рассуждать теми же привычками. Результат может остаться почти на нулеДай агенту инструмент, который возвращает точный результат: запуск кода, тестовый запрос, проверку. Пусть сам придумывает короткие пробы и читает ответы дословно. В промпте напиши: «Не доверяй описанию и привычным представлениям. Считай документацию гипотезой»
Модель правильно называет правило, но неверно его применяетАгент выписал верное правило. Ты решаешь, что он понял. Потом даёшь задачу на это правило. Он ошибается. Список правил в отчёте создаёт ложную уверенность. Ты не отличаешь «не нашёл правило» от «нашёл, но не умеет применить»Проверяй не список правил, а решение новых задач. Заранее подготовь контрольные задачи с известными ответами. Агент решает их только по своим записям, без доступа к среде. Расхождение значит, что правило записано неверно или неполно

Методы

МетодСуть
Цикл «проба → результат → правило» с самостоятельным выбором пробДай агенту несколько раундов. В каждом он сам придумывает 3–5 коротких проб, запускает их и читает результат дословно. Потом записывает в файл: ожидал → получил → правило. Добавь два запрета: «Не повторяй пробу с известным ответом». «Выбирай следующую так, чтобы разделить конкурирующие гипотезы». Почему работает: Среда даёт данные, которых нет в голове модели. Своя проба бьёт в самые неопределённые места. Чужие или случайные пробы часто почти бесполезны. Когда да: результат можно быстро и точно проверить. Это код, API, формулы, воспроизводимые инструкции. Когда нет: субъективные задачи вроде текста, дизайна, стратегии. Там нет однозначного ответа среды
Контрольная проверка после каждого раунда, без инструментовПосле раунда агент не вызывает инструменты. Он выписывает правила: уверен и не проверено. Потом решает 5–10 контрольных задач только по файлу заметок. Отмечает правила, которые противоречат прошлым раундам. Если ответы неверны, он возвращается к пробам и не достраивает правила догадками. Для чистоты запускай проверку в отдельной копии диалога и потом удаляй её. Почему работает: Запрет инструментов проверяет понимание, а не умение накопить записей. Копия диалога не даёт модели новых данных во время проверки. Замер после каждого раунда показывает момент, когда результат начал падать. Можно остановиться и взять лучшую точку. Когда нет: не можешь заранее подготовить задачи с проверяемым ответом
Несколько независимых запусков, выбор лучшего по контрольным задачамЗапусти 2–3 попытки с нуля, без общей памяти. Сравни их на одних и тех же контрольных задачах. Возьми лучшую. Почему работает: Одна и та же модель в разных запусках даёт результат от почти нуля до почти максимума. Разброс между запусками часто больше, чем между моделями. Один запуск ничего не доказывает. Лишние раунды иногда ухудшают уже достигнутое, поэтому ещё и фиксируй лучшую промежуточную точку. Когда да: важна надёжность итога, а запуск дешёвый. Когда нет: задача необратима или каждый запуск дорог

Тезисы

ТезисКомментарий
Кто выбирает проверки, важно не меньше, чем сами проверкиЕсли дать агенту заранее подготовленные удачные пробы, результат часто заметно хуже, чем когда он придумывает их сам. Случайные пробы по шаблону почти бесполезны. Почему: Своя проба строится из текущих сомнений агента. Она попадает туда, где он не уверен. Чужая проба отвечает на чужой вопрос. Применяй: не подсовывай готовый набор тестов вместо исследования. Скажи: «Придумай пробы, которые отличают твои гипотезы друг от друга». Исключение: если важные доказательства заранее известны, выбор проб почти ничего не добавляет

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с