3,583 papers
arXiv:2608.00685 78 1 авг. 2026 г. FREE

Оркестрация LLM: почему хороший детальный промпт часто бьёт многошаговые техники

КЛЮЧЕВАЯ СУТЬ
Один детально расписанный промпт поднял точность модели на задаче по коду с 20% до 82% — это больше, чем дала любая многошаговая схема с несколькими запросами. Метод позволяет получить максимум точности за один запрос, без циклов критики-переделки (Self-Refine), спора агентов (Debate) или генерации нескольких вариантов на выбор (Best-of-N). Фишка в том, что модель не угадывает задачу — промпт явно расписывает план, формат и ограничения, и модель просто следует структуре как чек-листу. +62 процентных пункта точности одной инструкцией — против 2-5 пунктов от всей многошаговой оркестрации вместе взятой.
Адаптировать под запрос

TL;DR

Исследователи сравнили пять способов получить ответ от LLM — простой запрос, запрос с инструкцией «думай по шагам» (CoT), Self-Refine (сгенерировать → раскритиковать → переделать), Best-of-N (сгенерировать 3 варианта → выбрать лучший) и Debate (два агента спорят, судья выбирает финал) — на задачах по программированию, шахматным этюдам и математике. Причём каждую технику одинаково тщательно оптимизировали заранее, чтобы сравнение было честным.

Оказалось, что многошаговые техники (Self-Refine, BoN, Debate) дают прирост точности всего 2–5 процентных пунктов, но тратят в 2–4 раза больше токенов — то есть в разы дороже и медленнее. И что важнее: какая техника выиграет — зависит не от сложности задачи (как многие интуитивно думают), а от того, какая именно модель стоит за ней. Метод, который отлично работает на одной модели, может провалиться на другой — предсказать это заранее почти невозможно.

Но самая практичная находка — в другом месте. Один детально расписанный промпт с явными инструкциями (что делать сначала, что потом, в каком формате выдать ответ) поднял точность модели на задаче по программированию с 20% до 82% — это сильнее, чем любая многошаговая оркестрация. Иначе говоря: прежде чем городить сложную схему из нескольких запросов, попробуйте один раз нормально прописать промпт.


🔬

Схема сравнения (не метод, а тест пяти подходов)

БАЗОВЫЙ ВАРИАНТ 1: Просто задача → ответ
БАЗОВЫЙ ВАРИАНТ 2: Задача + "думай по шагам" (CoT) → ответ

ОРКЕСТРАЦИЯ 1 (Self-Refine): 
  Генерация ответа → Критика ответа → Переделка (до 2 раундов) → финальный ответ

ОРКЕСТРАЦИЯ 2 (Best-of-N):
  3 независимые попытки → выбор лучшей по критерию → финальный ответ

ОРКЕСТРАЦИЯ 3 (Debate):
  2 "агента" отвечают отдельно → видят ответы друг друга → каждый пересматривает →
  судья изучает обе версии → финальный ответ

Все варианты тестировали на одних и тех же задачах, с одинаковыми моделями, при равном бюджете на "докручивание" промпта — чтобы разница была в самой схеме, а не в том, что один промпт вылизали лучше другого.


🚀

Пример применения

Задача: Вы просите Claude/ChatGPT написать код для парсинга Excel-файла с расходами компании и вывода отчёта.

Плохой (дорогой) подход — сразу лезть в многошаговую схему:

Шаг 1: Напиши код для парсинга файла
Шаг 2: Раскритикуй свой код
Шаг 3: Перепиши с учётом критики

Это работает, но требует 3+ отдельных обменов и не гарантирует ощутимого прироста качества.

Хороший подход — один детальный промпт:

Напиши Python-код, который парсит Excel-файл с расходами и строит отчёт по категориям.

Сначала опиши план: какие библиотеки используешь, как обрабатываешь пустые ячейки и 
несовпадение форматов дат.

Затем напиши сам код.

Требования к выводу:
- Код в одном блоке, без пояснений внутри
- Обработка ошибок для случаев, когда файл повреждён
- В конце — краткий список того, что код НЕ умеет (ограничения)

Результат: модель сначала явно проговорит план (разделение "что делать" от "как делать" — как в примере из исследования), потом выдаст код с чёткой структурой. Это даст более надёжный результат за один запрос, чем цикл "сгенерируй-раскритикуй-переделай".

Если всё же нужна многошаговая проверка (например, для сложной задачи, где важна перепроверка) — берите Best-of-N, а не «дебаты»: попросите модель сгенерировать 3 разных решения и затем сама выбрать лучшее по чётким критериям. Это стабильно работало лучше «дебатов между агентами» во всех проверенных доменах.


🧠

Почему это работает

Модели плохо угадывают, что именно от них хотят, если инструкция общая («думай по шагам»). Слабость не в рассуждениях самих по себе, а в неопределённости задачи — модель не знает, на что обращать внимание.

Сильная сторона LLM — она отлично выполняет явно прописанную процедуру. Когда промпт разделяет этапы («сначала план, потом код»), задаёт жёсткие рамки вывода и указывает на конкретные ограничения задачи — модель следует этой структуре почти как чек-листу. Это и объясняет скачок с 20% до 82% точности в исследовании: не «больше вызовов», а более точная инструкция.

Многошаговые техники (Self-Refine, Debate) пытаются добавить качество через повторные проходы — но каждый проход тоже подчиняется тому же слабому промпту, если сам промпт не улучшен. Отсюда и разброс: без хорошей базовой инструкции лишние шаги просто умножают токены, а не качество.

Рычаги, которые можно крутить самому: - Число кандидатов в Best-of-N — 3 в исследовании, можно сделать 2 для экономии или 5 для более сложных задач - Критерий выбора лучшего варианта — замените на свой (например, "выбери вариант с наименьшим количеством строк кода") - Число раундов в Self-Refine — 2 в исследовании; для простых задач достаточно 1 - Явный "выходной контракт" — формат вывода, ограничения, что не должно быть в ответе — этот рычаг дал больше эффекта, чем любая многошаговая схема


📋

Шаблон промпта (детальная инструкция вместо оркестрации)

Задача: {описание задачи}

Прежде чем решать, распиши план:
- Какой подход используешь
- Как обработаешь {специфичные для задачи сложности — например, крайние случаи, ограничения}

Затем реализуй план.

Формат ответа:
- {требование к структуре, например: только код без комментариев / только текст без списков}
- {явное ограничение: длина, стиль, что нельзя включать}

В конце добавь короткий список: что решение не учитывает или где могут быть слабые места.

🚀 Быстрый старт — вставь в чат:

Вот шаблон детального промпта. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про специфику вашей задачи (какие крайние случаи важны, какой формат вывода нужен) — потому что именно эта конкретика даёт основной прирост качества, а не количество шагов в диалоге.

Шаблон для Best-of-N (если нужна доп. надёжность):

{задача}

Сгенерируй 3 независимых варианта решения.
Затем сам оцени все три по критерию: {критерий, например "точность расчётов и читаемость кода"}.
Выбери лучший вариант и объясни почему.
Выведи только финальный выбранный вариант.

⚠️

Ограничения

⚠️ Эффект зависит от модели: то, что дало прирост на одной модели, может не сработать на другой — универсального правила "эта техника всегда лучше" нет. Нужно проверять на своей связке модель+задача.

⚠️ Сложность задачи не предсказывает выгоду от оркестрации: интуиция "чем сложнее задача, тем больше пользы от многошаговых техник" не подтвердилась. Не стоит автоматически включать Self-Refine или Debate только потому, что задача кажется трудной.

⚠️ Debate почти никогда не оправдывает себя: во всех трёх доменах "дебаты" между агентами не показали значимого превосходства над простым CoT-промптом, при этом расходуя больше всего токенов.

⚠️ Прирост скромный в абсолютных числах: лучшие результаты — это 2–5 процентных пунктов точности. Если для вашей задачи такая точность некритична, оркестрация того не стоит.


🔗

Ресурсы

Leins, Pelleriti, Gonnermann-Müller, Pokutta — "When Does LLM Orchestration Pay Off?", Zuse Institute Berlin & TU Berlin. Методология оптимизации промптов — GEPA (Agrawal et al., 2026). Бенчмарки: Codeforces, Lichess, AMC из набора Easy2Hard-Bench (Ding et al., 2024).


📋 Дайджест исследования

Ключевая суть

Один детально расписанный промпт поднял точность модели на задаче по коду с 20% до 82% — это больше, чем дала любая многошаговая схема с несколькими запросами. Метод позволяет получить максимум точности за один запрос, без циклов критики-переделки (Self-Refine), спора агентов (Debate) или генерации нескольких вариантов на выбор (Best-of-N). Фишка в том, что модель не угадывает задачу — промпт явно расписывает план, формат и ограничения, и модель просто следует структуре как чек-листу. +62 процентных пункта точности одной инструкцией — против 2-5 пунктов от всей многошаговой оркестрации вместе взятой.

Принцип работы

Правило простое: конкретика бьёт количество шагов. Не «думай по шагам» в общем виде — а «сначала план, потом код, вот формат вывода, вот что нельзя включать». Модель работает как студент с чек-листом, а не как студент с абстрактным советом «подумай хорошенько» — дай ей чек-лист, и она его выполнит. Если всё же нужна доп. проверка — берите Best-of-N (3 варианта + модель сама выбирает лучший), а не Debate (спор двух агентов) — Debate почти нигде не окупает свою стоимость в токенах.

Почему работает

Слабость модели не в рассуждениях, а в неопределённости — она не знает, на что обращать внимание, если инструкция общая. Многошаговые техники (Self-Refine, Debate) пытаются добить качество через повторные проходы, но каждый проход крутится вокруг того же слабого промпта — отсюда и разброс результатов от модели к модели. Жесть в том, что сложность задачи вообще не предсказывает выгоду от оркестрации — интуиция «сложная задача = нужна многошаговая схема» не подтвердилась экспериментально ни на коде, ни на шахматах, ни на математике.

Когда применять

Промпт-инжиниринг → для любой задачи где важна точность с первого запроса (код, расчёты, структурированный текст), особенно когда бюджет на токены ограничен или задача требует быстрого ответа. Best-of-N подойдёт, если нужна доп. надёжность и есть чёткий критерий выбора лучшего варианта. НЕ подходит слепое применение Debate — во всех проверенных доменах он не оправдал свою стоимость в токенах.

Мини-рецепт

1. Опиши задачу: конкретно, без общих формулировок вроде «сделай хорошо»
2. Попроси план перед решением: «сначала распиши подход, какие крайние случаи учтёшь»
3. Задай жёсткий формат вывода: что должно быть в ответе, а что — нет (например, «код без комментариев внутри»)
4. Добавь пункт про ограничения: попроси модель честно перечислить что решение не учитывает
5. Если нужна доп. проверка: замени многошаговую схему на Best-of-N — 3 варианта + чёткий критерий выбора, а не спор агентов

Примеры

[ПЛОХО] : Напиши код для парсинга Excel-файла с расходами
[ХОРОШО] : Напиши Python-код для парсинга Excel-файла с расходами. Сначала опиши план: какие библиотеки используешь, как обрабатываешь пустые ячейки и несовпадение форматов дат. Затем напиши код. Формат: код в одном блоке без пояснений внутри, обработка ошибок для повреждённых файлов. В конце — список того, что код не умеет.
Источник: When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty
ArXiv ID: 2608.00685 | Сгенерировано: 2026-08-04 04:25

Проблемы LLM

ПроблемаСутьКак обойти
Общая инструкция создаёт неопределённостьПросишь модель "думай по шагам" или просто даёшь задачу без деталей. Модель не знает, на что обращать внимание — какие крайние случаи важны, какой формат нужен. Результат случайный, точность низкая. Это универсальная проблема для любых задач с общими промптамиПропиши явный "контракт" на выход: сначала план (какой подход, как обрабатывать сложные случаи), потом реализация, потом жёсткий формат ответа и список ограничений. Такая структура убирает неопределённость почти как чек-лист

Методы

МетодСуть
Явный выходной контракт вместо многошаговой схемыРаздели промпт на три части: план реализация формат вывода с ограничениями. Задача план (подход + крайние случаи) решение жёсткий формат список слабых мест. Работает потому что модель хорошо выполняет чётко прописанную процедуру, но плохо угадывает намерение из общей формулировки. Один такой промпт может поднять точность сильнее, чем цикл "критика-переделка" или "спор агентов". Когда применять: любая задача, где важен конкретный формат или есть скрытые крайние случаи. Когда не работает: задачи без чётких критериев правильности, где сама структура ответа не определена

Тезисы

ТезисКомментарий
Многошаговая оркестрация наследует слабость исходного промптаЕсли базовый запрос расплывчатый, повторные проходы (критика-переделка, спор агентов) работают по тому же слабому запросу. Каждый шаг не добавляет ясности — он просто повторяет ту же неопределённость. Отсюда рост токенов (в 2–4 раза) почти без роста точности (2–5 процентных пунктов). Применяй: сначала вложись в детальный промпт с явным форматом и ограничениями, только потом думай про добавление шагов
📖 Простыми словами

When DoesLLMOrchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty

arXiv: 2608.00685

Суть в том, что все эти навороченные цепочки рассуждений и споры агентов — не волшебная таблетка, а инструмент с очень капризным КПД. Исследователи взяли пять популярных методов «дрессировки» нейронок — от простого CoT (цепочка мыслей) до сложных Debate (когда два бота спорят) — и выяснили, что на простых задачах вся эта суета только жрет деньги. Модель либо знает ответ сразу, либо никакие дебаты ей не помогут, если задача элементарная. Весь профит от сложных схем оркестрации проявляется только в «зоне златовласки»: когда задача достаточно сложная, чтобы запутаться, но не настолько хардкорная, чтобы модель окончательно поплыла.

Это как нанимать консилиум профессоров, чтобы решить, какого цвета купить обои в прихожую. Формально они проведут глубокий анализ, но результат будет тем же, что и при твоем единоличном решении, только в сто раз дороже и дольше. Сложные методы вроде Self-Refine (когда модель сама себя критикует) работают только тогда, когда у ИИ есть четкий критерий успеха. Если задача размыта, модель просто перекладывает мусор из одной кучи в другую, делая вид, что работает над качеством.

Что реально показало зубы в тестах: методы Best-of-N и Debate выигрывают за счет банального перебора вариантов и фильтрации бреда. Если заставить модель выдать три разных решения и выбрать лучшее, шанс на успех растет, но только в программировании или математике, где ответ можно проверить. В шахматах же, где цена ошибки — один неверный ход, даже самый дорогой Debate часто пасует. Оказалось, что оптимизация промпта для одного запроса часто дает больше профита, чем нагромождение из десяти агентов, которые просто множат галлюцинации друг друга.

Исследование гоняли на коде и математике, но принцип универсален для любой автоматизации на базе LLM. Если ты строишь систему для поддержки клиентов или генерации контента, не спеши городить огород из агентов. В 80% случаев хорошо прописанная инструкция и один прогон работают не хуже, чем сложная схема, которая стоит как крыло самолета. Оркестрация — это не способ сделать модель умнее, это способ выжать максимум из того, что она уже знает, когда цена ошибки действительно высока.

Короче: хватит верить в магию «агентных систем» как в панацею от тупости моделей. Сложность должна быть оправдана сложностью задачи, иначе ты просто сливаешь токены в трубу. Если базовая модель лажает на простых вещах, никакие «советы старейшин» из пяти GPT-4 её не спасут. Сначала вылизывай базовый промпт, и только если уперся в потолок на действительно тяжелых задачах — подключай тяжелую артиллерию вроде Self-Refine или Debate.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с