3,583 papers
arXiv:2608.07968 76 8 авг. 2026 г. FREE

Reasoning-модели решают задачи по порядку, а не по важности — даже если явно указана "цена" каждой

КЛЮЧЕВАЯ СУТЬ
Напишешь «этот пункт стоит 15 баллов, а этот — 1» — модель прочитает и всё равно решит по порядку, будто ты ничего не писал. Находка позволяет понять, как заставить reasoning-модель тратить больше «мыслей» на важные вопросы в списке из 10-20 задач. Модель не считает выгоду заранее — она просто идёт по тексту сверху вниз, пока не кончится запас. Единственный рычаг — физический порядок вопросов в запросе, а не слова «важно» или цифры-баллы.
Адаптировать под запрос

TL;DR

Когда вы даёте модели сразу несколько задач в одном запросе с ограничением на длину рассуждения (например, просите решить 10 вопросов или проверить 15 пунктов договора), модель решает их строго по порядку появления в тексте, а не по важности. Она не выбирает, с чего начать по выгоде — она просто идёт последовательно, как студент, решающий билеты по номерам.

Даже если вы прямо напишете "этот вопрос стоит 15 баллов, а этот — 1 балл", модель это проигнорирует. Она тратит больше всего "мыслей" на первые вопросы, а к последним либо не доходит совсем, либо уделяет им пару секунд. Чем больше вопросов в списке — тем хуже: при 20 вопросах модель может вообще не притронуться к половине из них. Причина простая: у модели нет внутреннего "счётчика выгоды" — она не прикидывает заранее, где отдача больше, она просто продолжает читать сверху вниз, пока не кончится запал.

Единственное, что немного помогает — попросить модель сначала распланировать, сколько сил потратить на каждый вопрос, прежде чем отвечать. Это делает распределение внимания равномернее (модель охватывает больше пунктов), но не заставляет её приоритизировать важное — она просто размазывает те же силы поровну, вместо того чтобы направить их куда нужно.


📌

Схема находки

БЕЗ подсказки: Вопрос 1 (много токенов) → Вопрос 2 (меньше) → ... → Вопрос N (0 токенов)
              Порядок решения = порядок появления в тексте
              Указанная "ценность" вопроса — роли не играет

С просьбой "распланируй бюджет": то же самое, но токены размазаны равномернее
              Приоритет по важности — всё равно НЕ появляется

🚀

Пример применения

Задача: Вы просите ChatGPT проверить договор на 15 пунктов. Три пункта критичны (штрафы, ответственность, расторжение), остальные — формальность (реквизиты, даты).

Промпт (плохой вариант — так делают почти все):

Проверь этот договор на риски. Особое внимание обрати на пункты 4, 9 и 13 — 
там штрафные санкции и условия расторжения. Вот все 15 пунктов: [текст]

Что произойдёт: модель подробно разберёт пункты 1-2-3, к пункту 4 (критичному) отнесётся уже бегло, а до 13-го может не дойти вообще — "особое внимание" в тексте не перевешивает эффект порядка.

Промпт (рабочий вариант):

У меня есть договор из 15 пунктов. Три из них критичны (штрафы, ответственность, 
расторжение), остальные — формальность.

Сначала перечисли, в каком порядке ты будешь их разбирать, начиная с самых 
рискованных, независимо от того, в каком порядке они идут в тексте ниже.
Потом разбирай именно в этом порядке.

Пункты договора: [текст, где критичные пункты ВРУЧНУЮ переставлены в начало]

Результат: модель распределит внимание равномернее по всем 15 пунктам (за счёт просьбы спланировать), а перестановка критичных пунктов в начало гарантирует, что именно на них уйдёт больше всего "мыслей" — потому что порядок в тексте остаётся единственным работающим рычагом.


🧠

Почему это работает

У модели нет внутреннего "калькулятора выгоды" — она не сравнивает вопросы между собой перед тем, как начать решать. Она реактивна: заходит в задачу и продолжает думать, пока не кончится "запас" на неё, а не проактивна — не решает заранее, что задача А важнее задачи Б.

При этом модель отлично умеет следовать структуре текста — это её сильная сторона. Порядок абзацев, порядок пунктов списка — то, что она честно уважает.

Метод (если это можно назвать методом) просто использует эту сильную сторону: раз модель слушается порядка текста, а не слов "важно" или "15 баллов" — переставляйте важное физически в начало запроса, а не помечайте словами.

Рычаги управления: - Порядок вопросов в тексте → самый сильный и единственный надёжный рычаг. Важное — первым. - Слова "важно", "приоритет", цифры-баллы → почти не работают, не тратьте на них силы. - Просьба "сначала распланируй, потом решай" → помогает модели дойти до большего числа пунктов (не бросить на середине), но не меняет приоритеты. - Количество вопросов в одном запросе → чем больше, тем хуже деградация. Если у вас список из 15+ пунктов — дробите на 2-3 отдельных запроса.


📋

Шаблон промпта

У меня есть {количество} задач/вопросов. Их важность неравна:
1. {задача_1} — важность: {высокая/средняя/низкая}
2. {задача_2} — важность: {высокая/средняя/низкая}
...

Прежде чем отвечать, сначала перечисли порядок, в котором ты будешь их разбирать — 
начни с самых важных, независимо от того, в каком порядке они перечислены выше.
Затем разбирай их именно в этом порядке, уделяя больше внимания важным задачам.

Вот сами задачи (расставлены по важности — сначала важные):
{задача с наивысшей важностью}
{задача со средней важностью}
{задача с низкой важностью}

🚀 Быстрый старт — вставь в чат:

Вот шаблон работы с несколькими задачами разной важности. Адаптируй под мою задачу: 
{твоя задача}. Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит какие у вас задачи и какая у них важность — потому что без ручной расстановки порядка модель всё равно решит их по порядку появления, а не по значимости.


⚠️

Ограничения

⚠️ Планирование не решает главную проблему: даже попросив модель распланировать бюджет заранее, она не начинает ориентироваться на важность — она просто равномернее раскидывает те же силы. Расставлять приоритеты руками всё равно придётся вам.

⚠️ Нет промпта-волшебной палочки: словесные пометки "важно", "критично", указание баллов — не работают. Единственный рычаг — физический порядок в тексте.

⚠️ Чем больше пунктов, тем хуже: при 20+ вопросах в одном запросе до половины из них модель может не коснуться вообще. Если список длинный — дробите его на несколько сообщений.


🔍

Как исследовали

Исследователи взяли задачи по математике (OmniMATH) и по коду (CRUXEval-O) и собрали из них "экзамены" — пачки по 5, 10 и 20 вопросов с указанными баллами и общим лимитом токенов на рассуждение. Модели (пять открытых — разные DeepSeek-R1-Distill и Qwen3, и две через API — DeepSeek-V4) должны были максимизировать суммарный балл, свободно решая, сколько токенов потратить на каждый вопрос.

Чтобы отследить, куда уходит "внимание", авторы размечали текст рассуждения по меткам Q1, Q2... и считали, сколько токенов ушло на каждый вопрос и в каком порядке модель их реально решала — не по тому, что она упомянула, а по тому, где она реально работала.

Дальше сравнили реальное распределение с "идеальным" — как если бы модель решала задачи как рюкзак-задачу (сначала самое выгодное по соотношению баллы/сложность). Оказалось, что совпадение с "выгодным" выбором не выше случайного, а совпадение с "порядком появления в тексте" — почти максимальное (0.75-0.8 из 1). Это и есть главный неожиданный вывод: модель ведёт себя не как расчётливый стратег, а как студент, который решает билеты по номерам, не глядя на баллы за них.


📋 Дайджест исследования

Ключевая суть

Напишешь «этот пункт стоит 15 баллов, а этот — 1» — модель прочитает и всё равно решит по порядку, будто ты ничего не писал. Находка позволяет понять, как заставить reasoning-модель тратить больше «мыслей» на важные вопросы в списке из 10-20 задач. Модель не считает выгоду заранее — она просто идёт по тексту сверху вниз, пока не кончится запас. Единственный рычаг — физический порядок вопросов в запросе, а не слова «важно» или цифры-баллы.

Принцип работы

Модель работает как студент, решающий билеты по номерам — не выбирает сначала выгодные, просто идёт подряд. Она реактивна, а не проактивна: заходит в вопрос и думает, пока не кончится лимит на него, вместо того чтобы сначала сравнить все вопросы между собой. Порядок в тексте — единственный рычаг, который модель честно уважает. Слова «приоритет» и баллы она читает, но никак не использует.

Почему работает

У модели нет внутреннего счётчика выгоды — она не прикидывает заранее, где отдача больше. При 20 вопросах в одном запросе до половины из них может остаться без единого токена размышлений. Причина простая: модель тратит бюджет линейно, по ходу чтения текста, а не по значимости задачи. Просьба сначала распланировать бюджет чуть помогает — модель охватывает больше пунктов, но всё равно размазывает силы поровну, а не туда, где нужно.

Когда применять

Многозадачные запросы → чек-листы, проверка договоров по пунктам, ревью кода, много вопросов в одном сообщении — особенно когда пунктов 10 и больше. Не подходит для 2-3 задач: там модель успевает разобрать всё, и разница в приоритете просто не видна.

Мини-рецепт

1. Переставь руками: важные пункты — в начало текста, а не в конец с пометкой «важно».
2. Попроси распланировать: «сначала перечисли порядок разбора, потом решай» — это увеличит охват пунктов.
3. Дроби длинные списки: если пунктов больше 15, разбей на 2-3 отдельных запроса.
4. Забудь про баллы: «критично», «15 баллов из 20» — не работает, значение имеет только физическая позиция в тексте.

Примеры

[ПЛОХО] : Проверь договор на риски, особое внимание пунктам 4, 9, 13 — там штрафы. Вот все 15 пунктов: [текст]
[ХОРОШО] : У меня 15 пунктов договора. Три критичны (штрафы, ответственность, расторжение) — я переставил их в начало. Сначала скажи порядок разбора, потом разбирай: [текст с переставленными пунктами]
Источник: Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions
ArXiv ID: 2608.07968 | Сгенерировано: 2026-08-11 05:49

Проблемы LLM

ПроблемаСутьКак обойти
Модель решает задачи по порядку текста, а не по важностиДаёшь список из нескольких вопросов или пунктов. Просишь обратить особое внимание на конкретные из них, даже указываешь баллы или слово "критично". Модель это игнорирует. Тратит много сил на первые пункты, а до важных в конце списка либо не доходит, либо уделяет секундыПереставь важные пункты физически в начало текста. Слова "важно" и цифры-баллы не работают — работает только порядковая позиция
Чем больше задач в одном запросе — тем хуже распределениеПри коротком списке модель ещё как-то справляется. При длинном (15-20+ пунктов) до половины из них может не коснуться вообще. Модель не тратит время на оценку всего списка перед началом — просто идёт и в какой-то момент "заканчивается запал"Дроби длинный список на 2-3 отдельных запроса. Не давай больше 5-7 задач за раз, если важен каждый пункт

Методы

МетодСуть
Физическая перестановка важного в начало текстаРучками переставь критичные пункты списка так, чтобы они шли первыми, независимо от исходного порядка. Не помечай важность словами — переставляй порядок. Работает потому что модель честно следует структуре текста (порядку абзацев, пунктов), но не сравнивает пункты по значимости перед началом работы. Когда да: любой список задач/пунктов/вопросов, где важность неравная. Когда нет: если сам порядок в тексте несёт смысл (например, хронология событий) — тогда переставлять нельзя
Просьба "сначала распланируй бюджет, потом решай"Перед тем как отвечать по списку, попроси модель сначала расписать, сколько сил она потратит на каждый пункт. Это делает распределение внимания равномернее — модель охватывает больше пунктов, а не бросает список на середине. Но это НЕ решает приоритизацию: силы размазываются поровну, а не туда где нужнее. Когда да: нужно чтобы модель дошла до конца длинного списка. Когда нет: если нужна именно приоритизация — тут метод не поможет, нужна перестановка порядка
📖 Простыми словами

Thinking Hard, Not Smart: ReasoningModelsFail to Ration Test-TimeComputeAcross Questions

arXiv: 2608.07968

Суть в том, что современные рассуждающие модели вроде o1 или DeepSeek-R1 — это не гениальные стратеги, а прилежные отличники с жестким тоннельным зрением. Когда ты закидываешь в них пачку задач одним махом, они не сканируют весь список, чтобы расставить приоритеты. У них напрочь отсутствует динамическое распределение ресурсов. Модель просто втыкается в первый попавшийся пункт и тратит на него все свои «мыслительные силы», даже если это полная ерунда, оставляя действительно важные куски на потом, когда «мозги» уже на исходе.

Это как если бы ты нанял топового юриста проверить контракт, а он два часа скрупулезно вычитывал опечатки в реквизитах сторон, пока у него не закончилось рабочее время. В итоге на пункт о том, что ты продаешь почку и квартиру, у него остается пять секунд, и он просто ставит галочку, не глядя. Модель не понимает ценности вопроса — она видит только очередность токенов в контекстном окне.

Исследователи доказали: модели лажают в приоритизации, потому что решают задачи строго по списку. Если ты просишь проверить 15 пунктов договора, где критические условия запрятаны в конце, нейронка сольет весь свой test-time compute (время на раздумья) на первые три формальных абзаца. В итоге на выходе ты получаешь детальный разбор того, правильно ли написан адрес офиса, и абсолютно бесполезный «ок» по пункту о гигантских штрафах. Модель не проактивна, она реактивна до мозга костей.

Этот принцип универсален для любой сложной работы с AI: от аудита кода до анализа маркетинговых стратегий. Тестировали на математике и логике, но облом ждет везде, где есть множественные подзадачи. Если ты сваливаешь всё в одну кучу, ты добровольно отдаешь качество ответов на волю случая. Порядок появления текста становится важнее, чем реальный вес задачи, и это критическая уязвимость текущих архитектур.

Короче: хватит надеяться, что нейронка сама поймет, что здесь главное. Если хочешь адекватный результат, дроби задачи на части или ставь самое важное в начало списка. Модель не умеет «думать с умом», она умеет только «думать долго» над тем, что подсунули первым. Либо ты сам управляешь её вниманием, либо получаешь блестящий разбор чепухи при полном игнорировании катастрофы в конце документа.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с