Модели, которые «думают» перед ответом (расширенное размышление, thinking mode), не всегда дают выгоду. Иногда они тратят в 5-10 раз больше токенов, а точность растёт на десятые доли процента. А иногда — точность падает: модель начинает переосмысливать задачу, которую без раздумий решила бы правильно с первого раза.
Главная боль: непонятно, когда включать «думай дольше», а когда это пустая трата токенов и времени. Причина проста — reasoning-режим помогает не там, где задача сложная, а там, где задача многошаговая: когда шаг 2 зависит от результата шага 1. На задачах, где нужно просто вспомнить факт или выбрать из вариантов, дополнительное «размышление» бесполезно — сколько ни думай, если факта в памяти модели нет, он не появится.
Авторы вводят метрику TES (Token Economy Score) — прирост точности в процентных пунктах, делённый на то, во сколько раз выросло число токенов. Если TES выше 1 — думать выгодно. Если ниже 0 — думать вредно. На основе 151 теста они формулируют правило: включай «размышление» по структуре задачи, а не по её сложности.
Схема правила
ШАГ 1: Определи структуру задачи →
→ последовательная (каждый шаг зависит от предыдущего: код, доказательство, расчёт, много условий)
→ ИЛИ разовая (факт, классификация, короткий ответ)
ШАГ 2: Если последовательная → включи режим размышления (thinking / extended thinking)
ШАГ 3: Если разовая → выключи, используй быстрый режим — экономия токенов и времени
ШАГ 4: Если можно выбрать уровень «усилия» (эффорт: low/medium/high/max) →
→ начни со среднего, замерь результат
→ повышай только если видишь реальный прирост точности
→ не ставь максимум по умолчанию — часто он хуже среднего
Пример применения
Задача: Юрист составляет договор поставки с 15 взаимосвязанными пунктами (штрафы зависят от сроков, сроки — от условий оплаты, условия оплаты — от объёма) в Claude с включённым extended thinking. Параллельно коллега спрашивает у той же модели «какая ставка НДС для экспорта в ЕАЭС в 2025 году».
Промпт для юриста (задача с цепочкой шагов — включаем размышление):
[Extended thinking: ВКЛ]
Составь договор поставки с учётом следующих взаимосвязанных условий:
{условия оплаты, сроки, штрафы, объём поставки}
Проверь логическую согласованность всех пунктов между собой.
Промпт для коллеги (факт — выключаем размышление):
[Extended thinking: ВЫКЛ]
Какая ставка НДС для экспортных поставок в страны ЕАЭС в 2025 году?
Результат: В первом случае модель потратит больше токенов и времени на «внутреннее размышление», но реально проверит согласованность условий — это окупится. Во втором случае включение thinking mode не даст никакого выигрыша в точности, просто заставит модель дольше отвечать и потратить больше токенов на бесполезные размышления над тем, что либо знает, либо не знает.
Почему это работает
Модель не умеет сама решать, когда «подумать дольше» — реально помогает, а когда просто жжёт токены. Она одинаково генерирует длинные цепочки размышлений и на сложной многошаговой задаче, и на простом вопросе о факте.
Сильная сторона reasoning-режима — он реально помогает там, где можно проверить и исправить себя по ходу: в коде можно перепроверить логику, в математике — пересчитать шаг, в договоре — сверить пункты друг с другом. Там «думание» — это дополнительная проверка, а не пустой шум.
Правило из статьи использует это напрямую: сортируешь задачи не по сложности, а по структуре — есть ли в задаче цепочка шагов, где можно себя проверить, или это разовый вопрос без внутренней логики для проверки.
Рычаги управления: - Тип задачи (цепочка шагов / разовый вопрос) → определяет, включать reasoning вообще. - Уровень эффорта (если доступен выбор) → не ставь максимум по умолчанию, начни со среднего — часто максимум даёт меньше или даже хуже медиума.
Шаблон промпта
Явного «промпта-метода» здесь нет — это правило выбора режима. Но можно оформить как инструкцию самому себе или как system-промпт:
Прежде чем отвечать на {задача}, определи её структуру:
1. Требует ли задача цепочки шагов, где каждый следующий шаг зависит
от результата предыдущего (расчёты, код, доказательство,
взаимосвязанные условия)?
→ Если да: подумай подробно, проверь каждый шаг перед финальным ответом.
2. Или это разовый вопрос на факт, классификацию, извлечение информации?
→ Если да: отвечай прямо, без долгих размышлений —
дополнительное обдумывание здесь не даст новой информации.
🚀 Быстрый старт — вставь в чат:
Вот принцип выбора режима размышления для LLM. Адаптируй под мою задачу: {твоя задача}.
Скажи, нужно ли для неё включать расширенное размышление (thinking mode)
или это разовый вопрос без цепочки шагов.
[вставить шаблон выше]
LLM спросит про характер задачи — потому что от этого зависит, стоит ли тратить токены на размышление. Она сама определит, к какому типу отнести твою задачу, и подскажет режим.
Ограничения
⚠️ Нужен выбор режима: правило работает только там, где есть явный переключатель thinking mode (Claude extended thinking, ChatGPT Thinking/Instant, Gemini thinking budget). Без переключателя применить нечего.
⚠️ Максимальный эффорт может быть хуже среднего: это не только трата токенов — авторы нашли случаи, где модель на максимальном уровне размышления давала менее точный ответ, чем на среднем. Модель «переосмысливает» и портит верный ответ.
⚠️ Сложность ≠ структура: сложные с виду вопросы на знание (типа энциклопедических тестов) не выигрывают от reasoning, даже если выглядят «трудными». Не путай субъективную сложность с наличием цепочки шагов.
⚠️ Правило требует проверки на своей задаче: авторы сами советуют тестировать — сначала средний уровень, замерить прирост, и только потом увеличивать. Это не универсальный алгоритм на все случаи.
Как исследовали
Исследователи прогнали 151 комбинацию модель-бенчмарк на семи задачах: математика (AIME), код (LiveCodeBench), наука (GPQA Diamond), знание фактов (MMLU-Pro), следование инструкциям (IFBench), экспертные вопросы (HLE) и физика (CritPt). Для каждой пары «модель с размышлением / модель без него» посчитали TES — прирост точности, делённый на то, во сколько раз выросло число токенов.
Дополнительно посчитали, сколько от общей стоимости запроса уходит на «внутреннее размышление» — оказалось, в среднем 95% стоимости уходит именно на невидимые пользователю размышления, а не на финальный текст ответа. Также сравнили облачные API с собственным сервером — на своём железе те же вычисления обходятся в разы дешевле, что может изменить экономику даже «дорогих» reasoning-моделей.
Удивил результат: сложность задачи по академическим меркам (MMLU-Pro считается «сложным» бенчмарком) плохо предсказывает выгоду от reasoning. Структура задачи — есть ли в ней цепочка взаимозависимых шагов — предсказывает лучше. Это и есть главный практический вывод: не ориентируйся на «сложность», ориентируйся на «есть ли шаги, зависящие друг от друга».
