3,583 papers
arXiv:2608.26235 74 26 авг. 2026 г. FREE

The Reasoning Tax: когда «режим размышления» у LLM окупается, а когда — просто жжёт токены

КЛЮЧЕВАЯ СУТЬ
Модель тратит в 5-10 раз больше токенов на «размышление» — точность растёт на десятые доли процента. А иногда даже падает: модель переосмысливает задачу, которую с первого раза решила бы правильно. Метод с метрикой TES (Token Economy Score) позволяет понять заранее, когда включать thinking mode, а когда это пустая трата токенов и времени. Фишка: решение не в сложности задачи, а в её структуре — есть ли цепочка шагов, где шаг 2 зависит от шага 1.
Адаптировать под запрос

Модели, которые «думают» перед ответом (расширенное размышление, thinking mode), не всегда дают выгоду. Иногда они тратят в 5-10 раз больше токенов, а точность растёт на десятые доли процента. А иногда — точность падает: модель начинает переосмысливать задачу, которую без раздумий решила бы правильно с первого раза.

Главная боль: непонятно, когда включать «думай дольше», а когда это пустая трата токенов и времени. Причина проста — reasoning-режим помогает не там, где задача сложная, а там, где задача многошаговая: когда шаг 2 зависит от результата шага 1. На задачах, где нужно просто вспомнить факт или выбрать из вариантов, дополнительное «размышление» бесполезно — сколько ни думай, если факта в памяти модели нет, он не появится.

Авторы вводят метрику TES (Token Economy Score) — прирост точности в процентных пунктах, делённый на то, во сколько раз выросло число токенов. Если TES выше 1 — думать выгодно. Если ниже 0 — думать вредно. На основе 151 теста они формулируют правило: включай «размышление» по структуре задачи, а не по её сложности.

📌

Схема правила

ШАГ 1: Определи структуру задачи → 
   → последовательная (каждый шаг зависит от предыдущего: код, доказательство, расчёт, много условий)
   → ИЛИ разовая (факт, классификация, короткий ответ)

ШАГ 2: Если последовательная → включи режим размышления (thinking / extended thinking)
ШАГ 3: Если разовая → выключи, используй быстрый режим — экономия токенов и времени

ШАГ 4: Если можно выбрать уровень «усилия» (эффорт: low/medium/high/max) →
   → начни со среднего, замерь результат
   → повышай только если видишь реальный прирост точности
   → не ставь максимум по умолчанию — часто он хуже среднего

🚀

Пример применения

Задача: Юрист составляет договор поставки с 15 взаимосвязанными пунктами (штрафы зависят от сроков, сроки — от условий оплаты, условия оплаты — от объёма) в Claude с включённым extended thinking. Параллельно коллега спрашивает у той же модели «какая ставка НДС для экспорта в ЕАЭС в 2025 году».

Промпт для юриста (задача с цепочкой шагов — включаем размышление):

[Extended thinking: ВКЛ]
Составь договор поставки с учётом следующих взаимосвязанных условий:
{условия оплаты, сроки, штрафы, объём поставки}
Проверь логическую согласованность всех пунктов между собой.

Промпт для коллеги (факт — выключаем размышление):

[Extended thinking: ВЫКЛ]
Какая ставка НДС для экспортных поставок в страны ЕАЭС в 2025 году?

Результат: В первом случае модель потратит больше токенов и времени на «внутреннее размышление», но реально проверит согласованность условий — это окупится. Во втором случае включение thinking mode не даст никакого выигрыша в точности, просто заставит модель дольше отвечать и потратить больше токенов на бесполезные размышления над тем, что либо знает, либо не знает.


🧠

Почему это работает

Модель не умеет сама решать, когда «подумать дольше» — реально помогает, а когда просто жжёт токены. Она одинаково генерирует длинные цепочки размышлений и на сложной многошаговой задаче, и на простом вопросе о факте.

Сильная сторона reasoning-режима — он реально помогает там, где можно проверить и исправить себя по ходу: в коде можно перепроверить логику, в математике — пересчитать шаг, в договоре — сверить пункты друг с другом. Там «думание» — это дополнительная проверка, а не пустой шум.

Правило из статьи использует это напрямую: сортируешь задачи не по сложности, а по структуре — есть ли в задаче цепочка шагов, где можно себя проверить, или это разовый вопрос без внутренней логики для проверки.

Рычаги управления: - Тип задачи (цепочка шагов / разовый вопрос) → определяет, включать reasoning вообще. - Уровень эффорта (если доступен выбор) → не ставь максимум по умолчанию, начни со среднего — часто максимум даёт меньше или даже хуже медиума.


📋

Шаблон промпта

Явного «промпта-метода» здесь нет — это правило выбора режима. Но можно оформить как инструкцию самому себе или как system-промпт:

Прежде чем отвечать на {задача}, определи её структуру:

1. Требует ли задача цепочки шагов, где каждый следующий шаг зависит 
   от результата предыдущего (расчёты, код, доказательство, 
   взаимосвязанные условия)? 
   → Если да: подумай подробно, проверь каждый шаг перед финальным ответом.

2. Или это разовый вопрос на факт, классификацию, извлечение информации? 
   → Если да: отвечай прямо, без долгих размышлений — 
   дополнительное обдумывание здесь не даст новой информации.

🚀 Быстрый старт — вставь в чат:

Вот принцип выбора режима размышления для LLM. Адаптируй под мою задачу: {твоя задача}.
Скажи, нужно ли для неё включать расширенное размышление (thinking mode) 
или это разовый вопрос без цепочки шагов.

[вставить шаблон выше]

LLM спросит про характер задачи — потому что от этого зависит, стоит ли тратить токены на размышление. Она сама определит, к какому типу отнести твою задачу, и подскажет режим.


⚠️

Ограничения

⚠️ Нужен выбор режима: правило работает только там, где есть явный переключатель thinking mode (Claude extended thinking, ChatGPT Thinking/Instant, Gemini thinking budget). Без переключателя применить нечего.

⚠️ Максимальный эффорт может быть хуже среднего: это не только трата токенов — авторы нашли случаи, где модель на максимальном уровне размышления давала менее точный ответ, чем на среднем. Модель «переосмысливает» и портит верный ответ.

⚠️ Сложность ≠ структура: сложные с виду вопросы на знание (типа энциклопедических тестов) не выигрывают от reasoning, даже если выглядят «трудными». Не путай субъективную сложность с наличием цепочки шагов.

⚠️ Правило требует проверки на своей задаче: авторы сами советуют тестировать — сначала средний уровень, замерить прирост, и только потом увеличивать. Это не универсальный алгоритм на все случаи.


🔍

Как исследовали

Исследователи прогнали 151 комбинацию модель-бенчмарк на семи задачах: математика (AIME), код (LiveCodeBench), наука (GPQA Diamond), знание фактов (MMLU-Pro), следование инструкциям (IFBench), экспертные вопросы (HLE) и физика (CritPt). Для каждой пары «модель с размышлением / модель без него» посчитали TES — прирост точности, делённый на то, во сколько раз выросло число токенов.

Дополнительно посчитали, сколько от общей стоимости запроса уходит на «внутреннее размышление» — оказалось, в среднем 95% стоимости уходит именно на невидимые пользователю размышления, а не на финальный текст ответа. Также сравнили облачные API с собственным сервером — на своём железе те же вычисления обходятся в разы дешевле, что может изменить экономику даже «дорогих» reasoning-моделей.

Удивил результат: сложность задачи по академическим меркам (MMLU-Pro считается «сложным» бенчмарком) плохо предсказывает выгоду от reasoning. Структура задачи — есть ли в ней цепочка взаимозависимых шагов — предсказывает лучше. Это и есть главный практический вывод: не ориентируйся на «сложность», ориентируйся на «есть ли шаги, зависящие друг от друга».


📋 Дайджест исследования

Ключевая суть

Модель тратит в 5-10 раз больше токенов на «размышление» — точность растёт на десятые доли процента. А иногда даже падает: модель переосмысливает задачу, которую с первого раза решила бы правильно. Метод с метрикой TES (Token Economy Score) позволяет понять заранее, когда включать thinking mode, а когда это пустая трата токенов и времени. Фишка: решение не в сложности задачи, а в её структуре — есть ли цепочка шагов, где шаг 2 зависит от шага 1.

Принцип работы

Не спрашивай «сложная ли задача» — спрашивай «есть ли в ней цепочка шагов». Последовательная задача (код, доказательство, договор с взаимосвязанными пунктами) — каждый следующий шаг зависит от предыдущего, там можно себя проверить по ходу. Разовая задача (факт, классификация, короткий ответ) — никакой внутренней логики для проверки нет. Включай размышление по структуре, а не по сложности — вот и всё правило на 151 тест.

Почему работает

Модель не умеет сама решать, когда думать дольше реально помогает. Она одинаково генерирует длинные цепочки размышлений и на сложной многошаговой задаче, и на простом вопросе о факте. Размышление реально работает только там, где можно проверить и исправить себя по ходу — пересчитать шаг в математике, сверить пункты в договоре, перепроверить логику в коде. На вопросе «какая ставка НДС» проверять нечего — либо модель знает факт, либо нет, сколько ни думай.

Когда применять

Код, доказательства, юридические документы с взаимосвязанными условиями, многошаговые расчёты → включай extended thinking, особенно когда шаг 2 буквально зависит от результата шага 1. НЕ подходит для фактов, классификации, извлечения короткой информации — там дополнительное размышление не даст новых данных, только сожжёт токены.

Мини-рецепт

1. Определи структуру задачи: цепочка шагов (каждый зависит от предыдущего) или разовый вопрос без внутренней логики.
2. Цепочка есть — включай размышление: [Extended thinking: ВКЛ] и проси модель проверить согласованность шагов между собой.
3. Цепочки нет — выключай: [Extended thinking: ВЫКЛ], отвечай прямо, без раздумий.
4. Если есть выбор уровня усилия: начни со среднего, замерь прирост точности. Не ставь максимум по умолчанию — часто он хуже среднего, модель начинает переосмысливать верный ответ.

Примеры

[ПЛОХО] : [Extended thinking: ВКЛ] Какая ставка НДС для экспортных поставок в страны ЕАЭС в 2025 году? — модель дольше думает, тратит больше токенов, но точность не растёт: факт либо есть в памяти, либо нет.
[ХОРОШО] : [Extended thinking: ВКЛ] Составь договор поставки с учётом взаимосвязанных условий: {оплата, сроки, штрафы, объём}. Проверь логическую согласованность всех пунктов между собой. — здесь размышление реально работает: модель сверяет 15 связанных пунктов друг с другом, а не просто вспоминает факт.
Источник: The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts
ArXiv ID: 2608.26235 | Сгенерировано: 2026-08-28 04:32

Проблемы LLM

ПроблемаСутьКак обойти
Модель не различает, когда размышление нужно, а когда бесполезноВключаешь режим расширенного размышления. Модель одинаково долго «думает» и над сложной многошаговой задачей, и над простым вопросом на факт. Если факта в её памяти нет — сколько ни думай, он не появится. Токены и время тратятся впустуюВключай режим размышления только для задач с цепочкой шагов (код, расчёт, договор с взаимосвязанными пунктами). Для разовых вопросов на факт или классификацию — выключай, отвечай напрямую
Максимальный уровень размышления портит уже верный ответМодель на самом высоком уровне «усилия» начинает переосмысливать задачу. Первый инстинктивный ответ был правильным, но после долгих раздумий модель меняет его на худший. Это происходит именно на максимальной настройке, не на среднейНе ставь максимальный уровень эффорта по умолчанию. Начинай со среднего, замеряй результат. Повышай только если видишь реальный прирост точности

Методы

МетодСуть
Включение размышления по структуре задачи, не по сложностиПеред запросом определи: есть ли в задаче цепочка шагов, где шаг 2 зависит от результата шага 1 (расчёт, код, доказательство, взаимосвязанные условия)? Если да — включи режим размышления. Если это разовый вопрос без внутренней логики (факт, классификация, короткий ответ) — выключи. Почему работает: размышление реально помогает там, где можно проверить и исправить себя по ходу — пересчитать шаг, сверить пункты друг с другом. На разовом вопросе такой самопроверки не существует, поэтому доп. токены не дают ничего. Когда да: код, математика, договоры с взаимосвязанными условиями. Когда нет: энциклопедические вопросы, извлечение факта, простая классификация
Постепенный подбор уровня эффортаЕсли модель позволяет выбрать уровень усилия (low/medium/high/max) — начинай со среднего. Замерь точность и число потраченных токенов. Повышай уровень только если видишь заметный прирост качества. Почему работает: более высокий уровень эффорта не гарантирует более точный ответ, а иногда даёт худший результат из-за переосмысления. Максимум по умолчанию — не безопасный выбор, а риск потратить токены и получить ответ хуже

Тезисы

ТезисКомментарий
Размышление окупается только там, где можно проверить промежуточный шагЭто про механику: расширенное размышление работает как внутренняя самопроверка — модель может пересчитать, сверить, перепроверить логику. Если в задаче нет промежуточных шагов для проверки (просто факт или готовый ответ), «раздумья» не создают новой информации, они просто удлиняют текст. Применяй: перед включением reasoning-режима спрашивай себя — есть ли в задаче что проверить по ходу, или ответ выдаётся сразу целиком
📖 Простыми словами

The Reasoning Tax: Token Economics ofLLMReasoning Across Task Types and Deployment Contexts

arXiv: 2608.26235

Модели с функцией глубокого мышления вроде extended thinking тупо не понимают, когда надо реально напрячь мозги, а когда выдать ответ за секунду. В их архитектуре нет встроенных тормозов: включаешь умный режим — и нейронка запускает километровые цепочки рассуждений на абсолютно любой чих. В итоге ты платишь так называемый налог на рассуждения (Reasoning Tax) в виде сожжённых токенов даже там, где он нафиг не сдался.

Это как нанять топового профессора права с почасовой ставкой в 500 баксов и спросить у него «нужен ли паспорт при покупке симки». Вместо короткого «да» он выдаст получасовой экскурс в историю законодательства, пока счётчик тикает. Формально он проделал колоссальную работу, но по факту — просто слил твои деньги на элементарщине.

Разница видна на контрасте задач. Когда юрист сводит сложный договор на 15 взаимосвязанных пунктов — где штрафы зависят от сроков, а сроки от объёма — глубокий анализ реально спасает, и трата тысяч токенов на рассуждения окупается. Но когда коллега в том же чате спрашивает «ставку НДС для экспорта в 2025 году», модель уходит в точно такой же параноидальный оверсинкинг, сжигая бюджет на тривиальный поиск факта.

Проблема касается всех reasoning-сеток — от Claude с extended thinking до семейства OpenAI o1 и o3. Бездумно вешать один умный режим на весь рабочий пайплайн — верный способ разориться на API. Единственное лекарство здесь — динамическая маршрутизация запросов: простые факты отдавай дешёвым моделям, а тяжёлый reasoning включай строго под многоходовки.

Короче: хватит платить налог на глупость, слепо веря, что «чем дольше сетка думает, тем лучше». Разделяй фактологию и сложную логику ещё на входе в промпт. Кто научится грамотно дозировать мышление моделей, срежет косты на AI в разы, пока остальные будут офигевать от космических счетов за токены.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с