3,583 papers
arXiv:2608.01347 80 2 авг. 2026 г. FREE

"Сравни несколько подходов": фраза, которая заставляет ИИ-агентов кодинга тратить в 2-7 раз больше токенов впустую

КЛЮЧЕВАЯ СУТЬ
Просишь модель "разработать несколько подходов и сравнить перед выбором" — и она честно раздувает токены размышления в 2,4–7,4 раза. Итоговый код при этом не меняется ни на строчку. Метод bounded efficiency позволяет резать эти скрытые расходы без потери качества — просто убрав триггерные фразы и добавив чёткие границы задачи. Шаблон "объём работы + критерий готовности + стоп-условие" не увеличивает токены ни на одной из шести протестированных моделей, а на GLM-5.2 сокращает расход вдвое при том же результате.
Адаптировать под запрос

TL;DR

Исследователи протестировали, как конкретные формулировки в промпте влияют на скрытые "токены размышления" (то, что модели типа Claude, DeepSeek, Kimi тратят на внутреннее обдумывание перед ответом) у ИИ-агентов, которые пишут код. Оказалось, что некоторые привычные фразы раздувают эти расходы в разы, не улучшая при этом качество решения ни на йоту.

Главная находка: фраза "разработай несколько подходов и сравни перед тем как выбрать" — самая дорогая из всех протестированных. Она увеличивает расход токенов на размышление в 2,4–7,4 раза на всех шести проверенных моделях, и это подтвердилось даже на скрытых, ранее не виданных задачах. Модель послушно начинает "перебирать варианты в голове", хотя итоговое решение получается ровно таким же, как если бы её попросили сделать одно решение сразу. Похожий эффект дают фразы вроде "думай глубоко" и "думай тщательно" — модель честно тратит больше времени на раздумья, но результат не меняется.

Решение простое и бесплатное: шаблон с явными границами задачи — что именно менять, какой критерий готовности, когда остановиться. Такой промпт не увеличивает расход токенов ни на одной модели, а на одной из них (GLM-5.2) сократил его вдвое при том же качестве результата.


📌

Схема находок (что вредно, что безопасно, что помогает)

ВРЕДНО: "разработай несколько подходов и сравни" → ×2.4–7.4 токенов размышления, качество не меняется
ВРЕДНО: "думай глубоко / тщательно" → ×1.6–2.2 токенов, качество не меняется
РИСКОВАННО: "наведи порядок вокруг", "действуй автономно" → модель лезет в файлы вне задачи
ДОРОГО: неверные технические подсказки в промпте → ×2.6 токенов (модель гонится за ложным следом)
БЕЗОПАСНО: многословность, лишний контекст, повторы → почти бесплатно (×1.03), можно не экономить на объяснениях
ПОЛЕЗНО: шаблон "объём работы + критерий готовности + условие стоп" → бесплатно, иногда экономит до 2× токенов

🚀

Пример применения

Задача: Вы просите Claude Code (или ChatGPT/Claude в режиме расширенного мышления) исправить баг в функции расчёта скидки на интернет-магазине — она уходит в минус, если купон больше суммы заказа.

Плохой промпт (по интуиции — "чем подробнее, тем лучше"):

Изучи несколько разных подходов к исправлению этой проблемы, сравни их плюсы 
и минусы, выбери оптимальный. Думай шаг за шагом, тщательно всё проверь. 
Если увидишь что-то ещё, что можно улучшить рядом — поправь и это.

Промпт по методу "bounded efficiency":

Задача: функция calculate_discount() возвращает отрицательную скидку, 
если купон больше суммы заказа.

Объём работы: изменить только файл discount.py. Остальной код не трогать.

Критерий готовности: тест test_discount_negative проходит, 
остальные тесты не ломаются.

Условие остановки: как только тесты проходят — останавливайся. 
Не ищи дополнительных улучшений и не предлагай альтернативные решения.

Результат: Первый промпт заставит модель "перебирать варианты в голове" — вы увидите более долгое ожидание ответа и больше потраченных токенов на размышление, а итоговое исправление будет тем же самым. Второй промпт даст такой же (или лучший) результат быстрее и дешевле — модель не будет тратить ресурсы на воображаемое сравнение и не станет менять код за пределами указанного файла.


🧠

Почему это работает

Модели с "рассуждением" (reasoning models) буквально следуют инструкциям — если вы просите сравнить несколько подходов, модель честно начинает генерировать это сравнение внутри себя, даже когда финальный ответ от этого не меняется. Это не хитрость и не смысловая глубина — это лишний текст, который вы просите произвести, и он оплачивается как обычные токены.

Сильная сторона таких моделей — они хорошо соблюдают явные границы и условия остановки. Если сказать точно, что нужно сделать и когда закончить, модель не станет "доразмышливать" сверх необходимого.

Метод использует это: убирая триггеры лишнего размышления ("сравни", "думай глубоко") и добавляя чёткий стоп-сигнал, вы даёте модели повод закончить раньше — без потери качества.

Рычаги управления: - Убрать фразы "сравни несколько вариантов", "рассмотри разные подходы" → экономия токенов, если сравнение вам не нужно как результат - Добавить "критерий готовности" и "условие остановки" → модель не переделывает то, что уже работает - Убрать "наведи порядок", "действуй автономно" → модель не трогает код за пределами задачи (это единственная категория фраз, которая расширяет объём изменений) - Не бояться длинных, подробных промптов → лишний текст почти не увеличивает стоимость, экономить на объяснениях контекста не нужно - Проверять технические подсказки перед тем, как включать их в промпт → неверная догадка об архитектуре стоит дороже всего — модель добросовестно идёт по ложному следу


📋

Шаблон промпта

Задача: {краткое описание проблемы}

Объём работы: изменить только {конкретные файлы/функции}. 
Остальной код не трогать.

Критерий готовности: {что должно работать / какие тесты должны проходить}

Условие остановки: как только критерий выполнен — останавливайся. 
Не ищи дополнительных улучшений и не предлагай альтернативные решения.

Подставьте в {краткое описание проблемы} конкретную суть бага или задачи, в {конкретные файлы/функции} — точные границы, куда модели разрешено лезть, в {критерий готовности} — понятный признак, что задача решена (тест проходит, функция возвращает нужное значение и т.п.).

🚀 Быстрый старт — вставь в чат:

Вот шаблон промпта для экономного и точного запроса к ИИ-агенту кодинга. 
Адаптируй под мою задачу: {твоя задача}. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про конкретные файлы, критерий готовности и границы задачи — потому что именно эти три вещи убирают лишнее "размышление" модели без потери качества.


⚠️

Ограничения

⚠️ Масштаб задачи: эффект измерен на небольших задачах (до 4 файлов). На больших проектах результат может быть другим — исследователи это прямо признают.

⚠️ Модель имеет значение: на новых "экономных" моделях (например, Kimi K3) относительный эффект сильнее (фраза про "думай глубоко" раздувает расход в ~15 раз), хотя абсолютный расход токенов всё равно остаётся низким — не пугайтесь процентов, смотрите на реальные цифры.

⚠️ Инструмент важнее промпта: один и тот же промпт может стоить в 5–30 раз дороже в зависимости от того, через какой интерфейс вы работаете (например, Claude Code против других агентских оболочек) — это не всегда в руках пользователя, но важно знать, если выбираете инструмент.

⚠️ Кэш-скидки — не эффективность: если провайдер показывает, что счёт снизился благодаря кэшированию, это не значит, что модель стала работать эффективнее — она делает ту же работу, просто вам выставляют меньший счёт за повторяющиеся части промпта.


🔍

Как исследовали

Команда взяла шесть крупных "думающих" моделей (DeepSeek, Kimi, Nemotron, GLM и другие) и прогнала их через два разных агентских интерфейса на 24 детерминированных задачах по написанию кода — с скрытыми тестами, которые агент не видит во время работы. Всего собрали больше 4600 валидных запусков на сумму около $166 реальных расходов.

Ключевая деталь дизайна: все гипотезы и пороги "что считается вредным" были зафиксированы до того, как исследователи посмотрели на результаты — это защищает от подгонки выводов под данные. Часть находок дополнительно проверили на 8 задачах, которые вообще не участвовали в подборе "вредных" фраз — и большинство эффектов подтвердилось.

Самое неожиданное: когда через несколько дней вышла новая модель Kimi K3, команда по тому же протоколу проверила её "с колёс" — и хотя относительный эффект от вредных фраз оказался ещё сильнее (модель "экономная" по умолчанию, поэтому любая лишняя инструкция сильнее видна на её фоне), абсолютный расход токенов остался на уровне или ниже, чем у предыдущих моделей. Это важный урок: относительный процент роста может пугать, но смотреть нужно на абсолютные цифры.

Также проверили эффект на закрытой модели Claude Sonnet 5 через официальный API — и большинство находок повторились, хотя выявилась интересная деталь: фраза про "думай глубоко" почти не вредит именно этой модели (она сама решает, сколько думать), а вот фраза про "максимальную уверенность в решении" оказалась там самой дорогой.


🔗

Ресурсы

Sarel Weinberger, Amir Hozez (PointFive). "Prompt-Induced Waste in Large Reasoning Models: A Preregistered Two-Harness Benchmark of Coding Agents", July 2026. Код, задачи, промпт-варианты и журналы использования опубликованы: github.com/sarelWeinberger/prompt_efficiency


📋 Дайджест исследования

Ключевая суть

Просишь модель "разработать несколько подходов и сравнить перед выбором" — и она честно раздувает токены размышления в 2,4–7,4 раза. Итоговый код при этом не меняется ни на строчку. Метод bounded efficiency позволяет резать эти скрытые расходы без потери качества — просто убрав триггерные фразы и добавив чёткие границы задачи. Шаблон "объём работы + критерий готовности + стоп-условие" не увеличивает токены ни на одной из шести протестированных моделей, а на GLM-5.2 сокращает расход вдвое при том же результате.

Принцип работы

Модель с рассуждениями — буквалист, а не мыслитель. Скажи "сравни варианты" — она честно начинает генерировать сравнение внутри себя, даже если финальный ответ от этого не меняется. Токены размышления оплачиваются как обычный текст — это не "глубина мысли", а лишние буквы, которые вы сами заказали. Зато та же буквальность работает в плюс: дай чёткое условие остановки — модель прекращает думать сразу после выполнения критерия, а не "доразмышливает" из вежливости.

Почему работает

Reasoning-модель не отличает сравнение для галочки от сравнения, которое реально нужно — она просто выполняет инструкцию буквально и подробно. Хуже всего с неверными техническими подсказками в промпте: модель добросовестно идёт по ложному следу и тратит в 2,6 раза больше токенов, пытаясь подстроить решение под ошибочный контекст. Ключевой инсайт — модель не умеет усомниться в постановке задачи, она просто выполняет её максимально подробно. А вот многословность и лишний контекст почти ничего не стоят — рост всего ×1,03, объяснять задачу подробно можно не боясь.

Когда применять

ИИ-агенты кодинга (Claude Code и похожие инструменты) → для задач исправления багов, мелкого рефакторинга и точечных правок, особенно когда важны скорость ответа и счёт за токены. Не подходит как единственный вывод для больших проектов (свыше 4 файлов) — там эффект пока не проверялся исследователями.

Мини-рецепт

1. Убери триггеры: вычеркни из промпта фразы "сравни несколько подходов", "думай глубоко/тщательно" — они не влияют на результат, только на счёт.
2. Задай границы: напиши прямо — <объём работы>изменить только файл discount.py, остальное не трогать.
3. Дай критерий готовности: конкретный тест или условие, например "функция возвращает 0 при купоне больше суммы заказа".
4. Поставь стоп-условие: "как только критерий выполнен — останавливайся, не ищи дополнительных улучшений".
5. Проверь технические подсказки перед вставкой в промпт: ошибочная догадка об архитектуре стоит дороже всего — до ×2,6 токенов впустую на погоню за ложным следом.

Примеры

[ПЛОХО] : Изучи несколько подходов к исправлению бага, сравни плюсы и минусы, думай тщательно, выбери оптимальный вариант.
[ХОРОШО] : Задача: функция calculate_discount() возвращает отрицательную скидку, если купон больше суммы заказа. Объём работы: изменить только файл discount.py, остальной код не трогать. Критерий готовности: тест test_discount_negative проходит, остальные тесты не ломаются. Условие остановки: как только тесты проходят — останавливайся, не ищи альтернативных решений.
Источник: Prompt-Induced Waste in Large Reasoning Models: A Preregistered Two-Harness Benchmark of Coding Agents
ArXiv ID: 2608.01347 | Сгенерировано: 2026-08-04 06:37

Проблемы LLM

ПроблемаСутьКак обойти
Просьба "сравнить варианты" раздувает внутренние размышления без пользыПросишь модель "разработать несколько подходов и сравнить" или "подумать глубже". Модель честно генерирует это сравнение внутри себя. Расход токенов на размышление растёт в разы. Итоговый ответ при этом получается точно таким же, как при простой постановке задачиНе проси сравнивать варианты, если тебе не нужен сам процесс сравнения как результат. Формулируй задачу прямо: "сделай X", без "рассмотри альтернативы"
Фразы про автономность заставляют модель выходить за границы задачиПросишь "навести порядок вокруг" или "действовать автономно". Модель начинает менять файлы и код, которые её не просили трогать. Это увеличивает не только токены, но и риск поломать рабочий кодЯвно ограничь зону работы: "изменить только файл X, остальное не трогать". Это единственный тип фраз, который расширяет объём правок, а не только токены
Неверная техническая подсказка в запросе стоит очень дорогоЕсли в промпте есть ошибочное предположение об архитектуре или причине бага, модель добросовестно идёт по этому ложному следу. Тратит на это в разы больше токенов, чем на решение без подсказкиПроверяй свои технические догадки перед тем как вставлять их в промпт. Если не уверен в причине — не предполагай её, дай модели самой разобраться

Методы

МетодСуть
Шаблон с границами задачи — бесплатная экономия токеновДобавь в промпт три поля: "объём работы" (что именно менять, что не трогать), "критерий готовности" (что должно заработать), "условие остановки" (когда именно закончить и не искать доп.улучшений). Задача: ... Объём работы: изменить только X. Критерий готовности: тест Y проходит. Условие остановки: как только тест проходит — остановись. Почему работает: модель хорошо соблюдает явные стоп-сигналы и границы, ей не нужно "доразмышливать" сверх заданного. Работает для агентов кодинга и любых задач с reasoning-моделями. Не увеличивает токены нигде, иногда сокращает вдвое

Тезисы

ТезисКомментарий
Reasoning-модель буквально выполняет инструкцию на размышление, даже если это не влияет на ответЕсли в запросе есть слова "сравни", "рассмотри альтернативы", "думай тщательно" — модель генерирует этот текст размышления внутри себя как отдельный шаг. Это не смысловая глубина, а обычный текст, который оплачивается токенами. Финальный результат от этого не меняется. Применяй: убирай из промпта любые слова, требующие процесса размышления, если тебе нужен только конечный результат, а не сам процесс сравнения
Явные границы и стоп-условия сильнее общих призывов "подумать больше"Модель с рассуждением хорошо соблюдает точные условия: что делать, где остановиться, какой критерий готовности. Такие ограничения снижают токены размышления без потери качества, потому что модель получает явный повод закончить раньше. Общие фразы типа "подумай тщательно" наоборот увеличивают размышление без выигрыша. Применяй: вместо "думай глубже" пиши "останавливайся, когда тест X проходит"
📖 Простыми словами

Prompt-Induced Waste inLargeReasoningModels: A Preregistered Two-Harness Benchmark of CodingAgents

arXiv: 2608.01347

Современные рассуждающие модели вроде DeepSeek или Claude работают не как калькуляторы, а как гиперответственные исполнители, которые буквально воспринимают каждое твоё слово. Когда ты просишь их «подумать получше» или «сравнить варианты», они не просто умнеют, они начинают генерировать тонны скрытых токенов размышления. Проблема в том, что эти модели часто попадают в ловушку: они тратят ресурсы на обсасывание очевидных вещей просто потому, что ты так сформулировал задачу. Это пустые расходы, которые раздувают контекст и твой счёт за API, но не добавляют ни капли качества итоговому коду.

Это похоже на ситуацию, когда ты нанимаешь дорогого юриста с почасовой оплатой и просишь его «тщательно проанализировать все риски» в договоре на покупку хлеба. Юрист честно просидит три часа, выпишет десять страниц текста и выставит счёт на тысячу долларов, хотя ответ был ясен через секунду. Ты сам заставил его имитировать бурную деятельность, и он это сделал — формально не подкопаешься, но по факту ты просто сжёг деньги на ветер.

Исследование выявило конкретных виновников этого облома: фразы вроде «рассмотри альтернативные подходы» или «проанализируй потенциальные ошибки» в простых задачах работают как триггеры для мусорных рассуждений. Модель начинает гонять воздух внутри своей «головы», генерируя в 2-3 раза больше скрытых токенов, чем нужно. При этом точность решения не растёт — если баг в коде очевиден, лишние раздумья его не исправят лучше, они просто сделают процесс дороже и медленнее.

Этот принцип универсален для любых Reasoning Models (o1, DeepSeek-R1 и прочих). Тестировали их на кодинге, но та же фигня происходит при написании текстов, анализе документов или планировании. Если задача линейная, любые призывы к «глубокому анализу» превращаются в налог на глупость. Ты платишь за то, что модель пересказывает сама себе условия задачи разными словами, пытаясь угодить твоему запросу на «сложность».

Короче: хватит пичкать промпты вежливым мусором и требованиями «подумать дважды» там, где всё и так понятно. Лишние инструкции — это лишние деньги, которые улетают в трубу без профита для дела. Пиши максимально сухо и по делу, иначе рискуешь получить золотой ответ на копеечный вопрос. Кто научится вовремя затыкать внутренний монолог нейронки, тот сэкономит бюджет и время, пока остальные оплачивают галлюцинации о собственной значимости.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с