TL;DR
Когда включаешь режим «размышления» у языковой модели (chain-of-thought, extended thinking, o1-стиль), она начинает точнее использовать уже видимую информацию — меньше случайных «качелей» в ответе, чётче следует за очевидным сигналом. Но это не делает модель более склонной активно искать новую информацию, даже если один из вариантов изучен намного слабее другого.
Люди в условиях неопределённости иногда специально выбирают малоизученный вариант — чтобы узнать про него больше. Исследователи проверили, ведут ли себя так же reasoning-модели. Ответ — нет: включив «размышление», модели просто увереннее шли за тем, что видели, полностью игнорируя тот факт, что один вариант был изучен в разы меньше другого. Изменилось другое: рассуждения становились длиннее, когда история данных была несимметричной, а заявленная уверенность честнее падала на сложных решениях.
Исследователи прогнали десять открытых моделей через задачу «два игровых автомата с разной историей выигрышей» — с включённым и выключенным «думанием». Замерили выбор, длину рассуждений и заявленную уверенность, разложили поведение на «тягу к неизвестному» и «разброс выбора от неопределённости». Reasoning усилил только последовательность выбора по видимому значению — обе «сигнатуры любопытства» не выросли.
Схема исследования
ШАГ 1: Модели показывают историю выигрышей двух "автоматов" (сбалансированную или нет)
→ просят выбрать автомат + оценить уверенность (1-4)
→ прогон в двух режимах: с "размышлением" и без
ШАГ 2: Замер логитов выбора, длины рассуждений, уверенности
→ разложение поведения на 4 компонента математической моделью
ШАГ 3: Сравнение thinking vs non-thinking по этим компонентам
ШАГ 4: Проверка альтернативы — меняли temperature/top-p/top-k при генерации
размышлений, смотрели воспроизводится ли та же картина
Пример применения
Задача: Маркетолог тестирует два рекламных креатива в Яндекс.Директе с ограниченным бюджетом. По креативу А — 20 показов и CTR 3%. По креативу Б — всего 2 показа, но CTR 4%. Просит ИИ в режиме рассуждений решить, куда лить оставшийся бюджет.
Промпт (обычный, без явной инструкции):
У меня два креатива для рекламной кампании:
Креатив А: 20 показов, CTR 3%
Креатив Б: 2 показа, CTR 4%
Куда лить оставшийся бюджет?
Результат: Модель в режиме размышлений уверенно выберет креатив Б, потому что у него CTR выше — и не предупредит, что 2 показа это статистически ничего не значащая выборка. Она посчитает то, что видит, а не то, чего не знает.
Чтобы получить нужное поведение — явную проверку баланса данных — нужно спросить об этом прямо (шаблон ниже).
Почему это работает
Reasoning-режим не содержит встроенного «любопытства». Модель не сравнивает объём наблюдений по вариантам, если её не попросить об этом явно — даже когда эта информация прямо у неё перед глазами.
Сильная сторона thinking-режима — точность использования того, что явно видно: цифры, факты, сравнения. Модель меньше «шумит» и чётче следует за очевидным сигналом.
Раз модель сама не поднимает вопрос нехватки данных, нужно явно инструктировать её сверять объём наблюдений по каждому варианту и отдельно указывать, где данных мало, прежде чем давать финальный совет.
Рычаг управления: добавь в промпт явный пункт «сравни количество данных/наблюдений по каждому варианту» — это заставляет модель написать про дисбаланс вслух, а не молча его проигнорировать.
Шаблон промпта
Помоги принять решение между вариантами: {вариант_А} и {вариант_Б}.
Данные по {вариант_А}: {данные_и_объём_выборки_А}
Данные по {вариант_Б}: {данные_и_объём_выборки_Б}
Прежде чем дать финальный ответ:
1. Укажи, сколько наблюдений/данных есть по каждому варианту.
2. Явно скажи, есть ли дисбаланс в объёме информации между вариантами.
3. Если дисбаланс есть — предложи, что стоит проверить или протестировать
дополнительно, прежде чем принимать окончательное решение.
4. Дай финальную рекомендацию с уровнем уверенности (низкий/средний/высокий)
и объясни, от чего эта уверенность зависит.
Подставь свою пару вариантов и данные по каждому — суммы, метрики, количество попыток.
🚀 Быстрый старт — вставь в чат:
Вот шаблон для принятия решений при неполных данных. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит про конкретные варианты и объём данных по каждому — потому что без этого не сможет заметить дисбаланс, который сама по себе не ищет.
Ограничения
⚠️ Проверено только на первом решении: модель тестировали на одном выборе после фиксированной истории данных, не в серии решений с обучением по ходу. Неизвестно, изменится ли поведение в длинном диалоге с обратной связью.
⚠️ Только открытые модели: тестировали Gemma, GPT-OSS, Nemotron, Qwen. Топовые закрытые чат-модели (GPT, Claude) не проверяли напрямую — механика reasoning скорее всего похожая, но не подтверждено.
⚠️ Не про поиск информации в интернете: речь о встроенной тенденции модели предпочитать менее изученный вариант в самих рассуждениях, а не о том, будет ли модель гуглить или задавать вопросы пользователю.
Как исследовали
Исследователи взяли десять открытых LLM и прогнали каждую через 600 раундов классической психологической задачи — «два игровых автомата с фиксированной, но неизвестной наградой» (её обычно используют на людях для изучения баланса между «использовать известное» и «исследовать неизвестное»). Модели видели историю выигрышей по каждому автомату — иногда сбалансированную, иногда нет — и выбирали автомат плюс сообщали уверенность. Каждый прогон делали в двух режимах: с «размышлением» и без.
Поведение разложили математической моделью на четыре компонента: следование за видимым значением, тяга к неизвестному варианту, рост случайности выбора при общей неопределённости и фоновый шум. Чтобы исключить банальное объяснение «рассуждение просто делает текст длиннее и случайнее», отдельно прогнали эксперимент с разными настройками temperature/top-p/top-k — картина не повторилась, значит эффект не сводится к случайности сэмплинга.
Удивительный итог: thinking снизил шум и усилил следование за значением, но абсолютно не добавил «любопытства» — ни тяги к неизвестному варианту, ни роста разброса при неопределённости. Зато длина рассуждений росла именно на несимметричных историях, а уверенность стала честнее падать на сложных решениях.
