TL;DR
Исследователи протестировали, как конкретные формулировки в промпте влияют на скрытые "токены размышления" (то, что модели типа Claude, DeepSeek, Kimi тратят на внутреннее обдумывание перед ответом) у ИИ-агентов, которые пишут код. Оказалось, что некоторые привычные фразы раздувают эти расходы в разы, не улучшая при этом качество решения ни на йоту.
Главная находка: фраза "разработай несколько подходов и сравни перед тем как выбрать" — самая дорогая из всех протестированных. Она увеличивает расход токенов на размышление в 2,4–7,4 раза на всех шести проверенных моделях, и это подтвердилось даже на скрытых, ранее не виданных задачах. Модель послушно начинает "перебирать варианты в голове", хотя итоговое решение получается ровно таким же, как если бы её попросили сделать одно решение сразу. Похожий эффект дают фразы вроде "думай глубоко" и "думай тщательно" — модель честно тратит больше времени на раздумья, но результат не меняется.
Решение простое и бесплатное: шаблон с явными границами задачи — что именно менять, какой критерий готовности, когда остановиться. Такой промпт не увеличивает расход токенов ни на одной модели, а на одной из них (GLM-5.2) сократил его вдвое при том же качестве результата.
Схема находок (что вредно, что безопасно, что помогает)
ВРЕДНО: "разработай несколько подходов и сравни" → ×2.4–7.4 токенов размышления, качество не меняется
ВРЕДНО: "думай глубоко / тщательно" → ×1.6–2.2 токенов, качество не меняется
РИСКОВАННО: "наведи порядок вокруг", "действуй автономно" → модель лезет в файлы вне задачи
ДОРОГО: неверные технические подсказки в промпте → ×2.6 токенов (модель гонится за ложным следом)
БЕЗОПАСНО: многословность, лишний контекст, повторы → почти бесплатно (×1.03), можно не экономить на объяснениях
ПОЛЕЗНО: шаблон "объём работы + критерий готовности + условие стоп" → бесплатно, иногда экономит до 2× токенов
Пример применения
Задача: Вы просите Claude Code (или ChatGPT/Claude в режиме расширенного мышления) исправить баг в функции расчёта скидки на интернет-магазине — она уходит в минус, если купон больше суммы заказа.
Плохой промпт (по интуиции — "чем подробнее, тем лучше"):
Изучи несколько разных подходов к исправлению этой проблемы, сравни их плюсы
и минусы, выбери оптимальный. Думай шаг за шагом, тщательно всё проверь.
Если увидишь что-то ещё, что можно улучшить рядом — поправь и это.
Промпт по методу "bounded efficiency":
Задача: функция calculate_discount() возвращает отрицательную скидку,
если купон больше суммы заказа.
Объём работы: изменить только файл discount.py. Остальной код не трогать.
Критерий готовности: тест test_discount_negative проходит,
остальные тесты не ломаются.
Условие остановки: как только тесты проходят — останавливайся.
Не ищи дополнительных улучшений и не предлагай альтернативные решения.
Результат: Первый промпт заставит модель "перебирать варианты в голове" — вы увидите более долгое ожидание ответа и больше потраченных токенов на размышление, а итоговое исправление будет тем же самым. Второй промпт даст такой же (или лучший) результат быстрее и дешевле — модель не будет тратить ресурсы на воображаемое сравнение и не станет менять код за пределами указанного файла.
Почему это работает
Модели с "рассуждением" (reasoning models) буквально следуют инструкциям — если вы просите сравнить несколько подходов, модель честно начинает генерировать это сравнение внутри себя, даже когда финальный ответ от этого не меняется. Это не хитрость и не смысловая глубина — это лишний текст, который вы просите произвести, и он оплачивается как обычные токены.
Сильная сторона таких моделей — они хорошо соблюдают явные границы и условия остановки. Если сказать точно, что нужно сделать и когда закончить, модель не станет "доразмышливать" сверх необходимого.
Метод использует это: убирая триггеры лишнего размышления ("сравни", "думай глубоко") и добавляя чёткий стоп-сигнал, вы даёте модели повод закончить раньше — без потери качества.
Рычаги управления: - Убрать фразы "сравни несколько вариантов", "рассмотри разные подходы" → экономия токенов, если сравнение вам не нужно как результат - Добавить "критерий готовности" и "условие остановки" → модель не переделывает то, что уже работает - Убрать "наведи порядок", "действуй автономно" → модель не трогает код за пределами задачи (это единственная категория фраз, которая расширяет объём изменений) - Не бояться длинных, подробных промптов → лишний текст почти не увеличивает стоимость, экономить на объяснениях контекста не нужно - Проверять технические подсказки перед тем, как включать их в промпт → неверная догадка об архитектуре стоит дороже всего — модель добросовестно идёт по ложному следу
Шаблон промпта
Задача: {краткое описание проблемы}
Объём работы: изменить только {конкретные файлы/функции}.
Остальной код не трогать.
Критерий готовности: {что должно работать / какие тесты должны проходить}
Условие остановки: как только критерий выполнен — останавливайся.
Не ищи дополнительных улучшений и не предлагай альтернативные решения.
Подставьте в {краткое описание проблемы} конкретную суть бага или задачи, в {конкретные файлы/функции} — точные границы, куда модели разрешено лезть, в {критерий готовности} — понятный признак, что задача решена (тест проходит, функция возвращает нужное значение и т.п.).
🚀 Быстрый старт — вставь в чат:
Вот шаблон промпта для экономного и точного запроса к ИИ-агенту кодинга.
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит про конкретные файлы, критерий готовности и границы задачи — потому что именно эти три вещи убирают лишнее "размышление" модели без потери качества.
Ограничения
⚠️ Масштаб задачи: эффект измерен на небольших задачах (до 4 файлов). На больших проектах результат может быть другим — исследователи это прямо признают.
⚠️ Модель имеет значение: на новых "экономных" моделях (например, Kimi K3) относительный эффект сильнее (фраза про "думай глубоко" раздувает расход в ~15 раз), хотя абсолютный расход токенов всё равно остаётся низким — не пугайтесь процентов, смотрите на реальные цифры.
⚠️ Инструмент важнее промпта: один и тот же промпт может стоить в 5–30 раз дороже в зависимости от того, через какой интерфейс вы работаете (например, Claude Code против других агентских оболочек) — это не всегда в руках пользователя, но важно знать, если выбираете инструмент.
⚠️ Кэш-скидки — не эффективность: если провайдер показывает, что счёт снизился благодаря кэшированию, это не значит, что модель стала работать эффективнее — она делает ту же работу, просто вам выставляют меньший счёт за повторяющиеся части промпта.
Как исследовали
Команда взяла шесть крупных "думающих" моделей (DeepSeek, Kimi, Nemotron, GLM и другие) и прогнала их через два разных агентских интерфейса на 24 детерминированных задачах по написанию кода — с скрытыми тестами, которые агент не видит во время работы. Всего собрали больше 4600 валидных запусков на сумму около $166 реальных расходов.
Ключевая деталь дизайна: все гипотезы и пороги "что считается вредным" были зафиксированы до того, как исследователи посмотрели на результаты — это защищает от подгонки выводов под данные. Часть находок дополнительно проверили на 8 задачах, которые вообще не участвовали в подборе "вредных" фраз — и большинство эффектов подтвердилось.
Самое неожиданное: когда через несколько дней вышла новая модель Kimi K3, команда по тому же протоколу проверила её "с колёс" — и хотя относительный эффект от вредных фраз оказался ещё сильнее (модель "экономная" по умолчанию, поэтому любая лишняя инструкция сильнее видна на её фоне), абсолютный расход токенов остался на уровне или ниже, чем у предыдущих моделей. Это важный урок: относительный процент роста может пугать, но смотреть нужно на абсолютные цифры.
Также проверили эффект на закрытой модели Claude Sonnet 5 через официальный API — и большинство находок повторились, хотя выявилась интересная деталь: фраза про "думай глубоко" почти не вредит именно этой модели (она сама решает, сколько думать), а вот фраза про "максимальную уверенность в решении" оказалась там самой дорогой.
Ресурсы
Sarel Weinberger, Amir Hozez (PointFive). "Prompt-Induced Waste in Large Reasoning Models: A Preregistered Two-Harness Benchmark of Coding Agents", July 2026. Код, задачи, промпт-варианты и журналы использования опубликованы: github.com/sarelWeinberger/prompt_efficiency
