3,583 papers
arXiv:2607.26845 74 29 июля 2026 г. FREE

Reasoning-режим LLM: делает выбор увереннее, но не учит модель просить больше данных

КЛЮЧЕВАЯ СУТЬ
Парадокс: включаешь режим размышлений у модели — она увереннее следует за очевидным сигналом, но не становится ни на грамм любопытнее к тому, что скрыто. Десять открытых моделей прогнали через задачу с двумя игровыми автоматами — историю выигрышей одного из них модель видела в разы меньше, чем у другого. Шаблон промпта заставляет модель вслух сравнить объём данных по каждому варианту — без этого она молча игнорирует дисбаланс, даже когда цифры прямо перед глазами. Результат — модель сама поднимает вопрос нехватки данных, а не делает вид, что всё сбалансировано.
Адаптировать под запрос

TL;DR

Когда включаешь режим «размышления» у языковой модели (chain-of-thought, extended thinking, o1-стиль), она начинает точнее использовать уже видимую информацию — меньше случайных «качелей» в ответе, чётче следует за очевидным сигналом. Но это не делает модель более склонной активно искать новую информацию, даже если один из вариантов изучен намного слабее другого.

Люди в условиях неопределённости иногда специально выбирают малоизученный вариант — чтобы узнать про него больше. Исследователи проверили, ведут ли себя так же reasoning-модели. Ответ — нет: включив «размышление», модели просто увереннее шли за тем, что видели, полностью игнорируя тот факт, что один вариант был изучен в разы меньше другого. Изменилось другое: рассуждения становились длиннее, когда история данных была несимметричной, а заявленная уверенность честнее падала на сложных решениях.

Исследователи прогнали десять открытых моделей через задачу «два игровых автомата с разной историей выигрышей» — с включённым и выключенным «думанием». Замерили выбор, длину рассуждений и заявленную уверенность, разложили поведение на «тягу к неизвестному» и «разброс выбора от неопределённости». Reasoning усилил только последовательность выбора по видимому значению — обе «сигнатуры любопытства» не выросли.


📌

Схема исследования

ШАГ 1: Модели показывают историю выигрышей двух "автоматов" (сбалансированную или нет) 
        → просят выбрать автомат + оценить уверенность (1-4)
        → прогон в двух режимах: с "размышлением" и без
ШАГ 2: Замер логитов выбора, длины рассуждений, уверенности
        → разложение поведения на 4 компонента математической моделью
ШАГ 3: Сравнение thinking vs non-thinking по этим компонентам
ШАГ 4: Проверка альтернативы — меняли temperature/top-p/top-k при генерации 
        размышлений, смотрели воспроизводится ли та же картина

🚀

Пример применения

Задача: Маркетолог тестирует два рекламных креатива в Яндекс.Директе с ограниченным бюджетом. По креативу А — 20 показов и CTR 3%. По креативу Б — всего 2 показа, но CTR 4%. Просит ИИ в режиме рассуждений решить, куда лить оставшийся бюджет.

Промпт (обычный, без явной инструкции):

У меня два креатива для рекламной кампании:
Креатив А: 20 показов, CTR 3%
Креатив Б: 2 показа, CTR 4%
Куда лить оставшийся бюджет?

Результат: Модель в режиме размышлений уверенно выберет креатив Б, потому что у него CTR выше — и не предупредит, что 2 показа это статистически ничего не значащая выборка. Она посчитает то, что видит, а не то, чего не знает.

Чтобы получить нужное поведение — явную проверку баланса данных — нужно спросить об этом прямо (шаблон ниже).


🧠

Почему это работает

Reasoning-режим не содержит встроенного «любопытства». Модель не сравнивает объём наблюдений по вариантам, если её не попросить об этом явно — даже когда эта информация прямо у неё перед глазами.

Сильная сторона thinking-режима — точность использования того, что явно видно: цифры, факты, сравнения. Модель меньше «шумит» и чётче следует за очевидным сигналом.

Раз модель сама не поднимает вопрос нехватки данных, нужно явно инструктировать её сверять объём наблюдений по каждому варианту и отдельно указывать, где данных мало, прежде чем давать финальный совет.

Рычаг управления: добавь в промпт явный пункт «сравни количество данных/наблюдений по каждому варианту» — это заставляет модель написать про дисбаланс вслух, а не молча его проигнорировать.


📋

Шаблон промпта

Помоги принять решение между вариантами: {вариант_А} и {вариант_Б}.

Данные по {вариант_А}: {данные_и_объём_выборки_А}
Данные по {вариант_Б}: {данные_и_объём_выборки_Б}

Прежде чем дать финальный ответ:
1. Укажи, сколько наблюдений/данных есть по каждому варианту.
2. Явно скажи, есть ли дисбаланс в объёме информации между вариантами.
3. Если дисбаланс есть — предложи, что стоит проверить или протестировать 
   дополнительно, прежде чем принимать окончательное решение.
4. Дай финальную рекомендацию с уровнем уверенности (низкий/средний/высокий) 
   и объясни, от чего эта уверенность зависит.

Подставь свою пару вариантов и данные по каждому — суммы, метрики, количество попыток.

🚀 Быстрый старт — вставь в чат:

Вот шаблон для принятия решений при неполных данных. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про конкретные варианты и объём данных по каждому — потому что без этого не сможет заметить дисбаланс, который сама по себе не ищет.


⚠️

Ограничения

⚠️ Проверено только на первом решении: модель тестировали на одном выборе после фиксированной истории данных, не в серии решений с обучением по ходу. Неизвестно, изменится ли поведение в длинном диалоге с обратной связью.

⚠️ Только открытые модели: тестировали Gemma, GPT-OSS, Nemotron, Qwen. Топовые закрытые чат-модели (GPT, Claude) не проверяли напрямую — механика reasoning скорее всего похожая, но не подтверждено.

⚠️ Не про поиск информации в интернете: речь о встроенной тенденции модели предпочитать менее изученный вариант в самих рассуждениях, а не о том, будет ли модель гуглить или задавать вопросы пользователю.


🔍

Как исследовали

Исследователи взяли десять открытых LLM и прогнали каждую через 600 раундов классической психологической задачи — «два игровых автомата с фиксированной, но неизвестной наградой» (её обычно используют на людях для изучения баланса между «использовать известное» и «исследовать неизвестное»). Модели видели историю выигрышей по каждому автомату — иногда сбалансированную, иногда нет — и выбирали автомат плюс сообщали уверенность. Каждый прогон делали в двух режимах: с «размышлением» и без.

Поведение разложили математической моделью на четыре компонента: следование за видимым значением, тяга к неизвестному варианту, рост случайности выбора при общей неопределённости и фоновый шум. Чтобы исключить банальное объяснение «рассуждение просто делает текст длиннее и случайнее», отдельно прогнали эксперимент с разными настройками temperature/top-p/top-k — картина не повторилась, значит эффект не сводится к случайности сэмплинга.

Удивительный итог: thinking снизил шум и усилил следование за значением, но абсолютно не добавил «любопытства» — ни тяги к неизвестному варианту, ни роста разброса при неопределённости. Зато длина рассуждений росла именно на несимметричных историях, а уверенность стала честнее падать на сложных решениях.


📋 Дайджест исследования

Ключевая суть

Парадокс: включаешь режим размышлений у модели — она увереннее следует за очевидным сигналом, но не становится ни на грамм любопытнее к тому, что скрыто. Десять открытых моделей прогнали через задачу с двумя игровыми автоматами — историю выигрышей одного из них модель видела в разы меньше, чем у другого. Шаблон промпта заставляет модель вслух сравнить объём данных по каждому варианту — без этого она молча игнорирует дисбаланс, даже когда цифры прямо перед глазами. Результат — модель сама поднимает вопрос нехватки данных, а не делает вид, что всё сбалансировано.

Принцип работы

Reasoning-режим — это не любопытство, это точность. Модель без подсказки видит только то, что написано явно: цифры, сравнения, факты. Она не спрашивает себя «а что если я мало знаю про один из вариантов?» — просто идёт за тем сигналом, который ярче. Люди в такой ситуации иногда специально выбирают малоизученный вариант — чтобы узнать про него больше. Модель так не делает, пока не попросишь прямо.

Почему работает

Исследователи разложили поведение модели на четыре компонента через математическую модель. Reasoning усилил только один — точность следования видимому сигналу. Два других — «тяга к неизвестному» и «разброс выбора от неопределённости» — вообще не изменились. Модель не сравнивает объём наблюдений по вариантам, если её не попросить об этом прямо — даже когда цифры лежат перед ней. При этом рассуждения становились длиннее при несимметричной истории данных, а заявленная уверенность честнее падала на сложных решениях.

Когда применять

Принятие решений при неполных данных → A/B тесты в маркетинге с разным числом показов, медицинские и финансовые консультации, где один вариант изучен слабее другого. Особенно важно когда пользователь сам не заметит маленькую выборку и легко примет CTR по двум показам за истину. НЕ нужно для задач без реального дисбаланса данных — там это лишний шаг.

Мини-рецепт

1. Дай модели оба варианта с цифрами: сколько наблюдений или данных по каждому.
2. Спроси прямо: сравни объём данных, есть ли дисбаланс между вариантами.
3. Попроси план: если дисбаланс есть — что докрутить или протестировать перед решением.
4. Финал: уверенность (низкий/средний/высокий) плюс объяснение, от чего она зависит.

Примеры

[ПЛОХО] : У меня два креатива: А — 20 показов, CTR 3%. Б — 2 показа, CTR 4%. Куда лить бюджет?
[ХОРОШО] : Данные по А: 20 показов, CTR 3%. Данные по Б: 2 показа, CTR 4%. Прежде чем ответить: 1) сравни объём данных по каждому варианту, 2) укажи дисбаланс если он есть, 3) предложи что проверить дополнительно, 4) дай финальный совет с уровнем уверенности и объясни от чего она зависит.
Источник: Thinking Under Uncertainty: Evidence Use and Information-Seeking in Language Models
ArXiv ID: 2607.26845 | Сгенерировано: 2026-07-30 04:24

Проблемы LLM

ПроблемаСутьКак обойти
Модель не замечает разницу в объёме данных между вариантамиСравниваешь два варианта: у одного много истории/наблюдений, у другого — почти нет. Модель в режиме рассуждений выбирает по видимым цифрам (например, у кого выше процент успеха), но не проверяет сама, что один вариант изучен в разы хуже другого. Даже "думающая" модель молча игнорирует этот рискЯвно попроси модель указать объём данных по каждому варианту и сказать, есть ли дисбаланс. Без этой инструкции модель не поднимет вопрос сама

Методы

МетодСуть
Явное требование сравнить объём выборки — вскрывает скрытый рискДобавь в запрос пункт: "укажи, сколько наблюдений есть по каждому варианту, и есть ли дисбаланс между ними". Дальше попроси, если дисбаланс есть — предложить что проверить дополнительно перед решением. Работает потому что режим рассуждений сам не сверяет объём данных — это не встроенная привычка модели, а действие, которое нужно запросить напрямую. Работает: любое сравнение вариантов с разным количеством подтверждающих данных (метрики рекламы, отзывы, тесты A/B, медицинские случаи). Не работает: если у пользователя нет доступа к данным об объёме выборки — тогда просить нечего

Тезисы

ТезисКомментарий
Режим рассуждений делает модель увереннее в видимом, но не любопытнее к неизвестномуВключение "размышления" у модели улучшает работу с тем, что явно перед глазами: цифры, факты, сравнения — модель меньше "шумит" и точнее следует очевидному сигналу. Но это не добавляет модели стремления узнать больше о слабо изученном варианте — она не воспринимает нехватку данных как повод для осторожности или уточнения, если её не попросить об этом прямо. Применяй: не жди, что "умный" режим модели сам предупредит о неполноте данных — закладывай эту проверку в промпт как отдельный шаг
📖 Простыми словами

Thinking Under Uncertainty: EvidenceUseand Information-Seeking inLanguageModels

arXiv: 2607.26845

Когда ты включаешь у модели режим «размышлений» (тот самый o1-стиль или chain-of-thought), она не становится умнее в человеческом смысле — она просто начинает лучше концентрироваться на том, что уже видит. Это работает как внутренний фильтр шума: модель перестает метаться и четче цепляется за явные факты, которые лежат перед ней. Если в тексте написано «А больше Б», обычная нейронка может тупануть и выдать рандом, а «думающая» модель вцепится в этот факт мертвой хваткой. Но есть нюанс: она работает только с тем, что ей дали, и совершенно не понимает, чего ей не хватает для нормального вывода.

Это как если бы ты нанял супер-внимательного бухгалтера, который идеально считает цифры в отчете, но в упор не замечает, что половина страниц вырвана. Он выдаст тебе филигранный расчет на основе огрызков данных, но даже не почешется спросить: «Слышь, а где остальное?». Модель в режиме рассуждений — это отличный исполнитель, у которого напрочь отсутствует инстинкт исследователя. Она видит цифры и делает выводы, даже если эти цифры — полная статистическая лажа.

В маркетинге это проявляется максимально наглядно: если у одного креатива 20 показов и CTR 3%, а у другого всего 2 показа и CTR 4%, «умная» модель радостно приговорит бюджет в пользу второго. Она видит, что 4 больше 3, и этого ей достаточно для логической цепочки. Модель не понимает концепцию неопределенности и не осознает, что два показа — это вообще ни о чем. Она не скажет: «Давай покрутим еще второй вариант, чтобы собрать данные», она просто выберет победителя по тем крохам, что есть, потому что в ее коде нет функции «пойти и поискать еще».

Тестировали это на выборе стратегий, но принцип универсален: хоть в медицине, хоть в инвестициях, хоть в выборе пылесоса. Если ты дашь модели два варианта, один из которых описан подробно, а второй — парой слов, она не станет задавать уточняющие вопросы по второму. Она просто проанализирует то, что есть, и выдаст вердикт. GEO и поиск информации здесь не работают автоматически — модель не стремится заполнить пробелы в своих знаниях, если ее не ткнуть в это носом.

Короче, режим рассуждений — это не панацея от ошибок, а просто способ заставить ИИ лучше использовать видимый контекст. Главный облом в том, что модель остается «самоуверенным отличником»: она выдаст тебе логически выверенный, стройный и красивый ответ, который будет абсолютно неверным, потому что базируется на неполных данных. Если хочешь адекватного поиска информации, придется прописывать это в промпте руками — само по себе «мышление» нейронки любопытства не добавляет.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с