TL;DR
Длинное «мышление» reasoning-моделей не делает суждения рациональнее. Reasoning-модели (о-серия, Claude и Qwen с режимом thinking, DeepSeek-R1) не меньше подвержены когнитивным искажениям, чем обычные версии. Точечная оценка даже чуть хуже, хотя статистически различие не надёжно. Больше токенов на размышление смещение тоже не снижает. Там, где что-то менялось, ответ уходил дальше от человеческого паттерна, но не к нейтральному.
Модель по-прежнему зависит от нерелевантных деталей запроса. Вы просите оценить цену, а в контексте мелькает чужое число, например «знакомый сделал за 50 000 ₽». Ответ сдвигается к этому числу. Это якорение, единственное искажение, которое у моделей работает как у людей, причём во всех семи проверенных. Остальные пять искажений модели проявляют вразнобой, а часто наоборот. Причина в том, что длинная цепочка рассуждений не заставляет модель отделять существенное от случайного. Она просто генерирует больше текста вокруг того же ответа.
Дешёвый приём: одна строка в промпте. Если перед ответом потребовать пересказать каждое число из запроса, якорение снижалось на всех пяти проверенных заданиях. Дополнительное «мышление» такого не давало. Эффект небольшой и на границе значимости (p = .057 при пяти заданиях), но направление было одинаковым везде.
Схема метода
ШАГ 1: Вставь в запрос: «Перед ответом перечисли каждое число,
упомянутое в запросе» → список чисел
ШАГ 2: Модель даёт оценку → ответ после списка
(всё в одном промпте, один запрос)
Вывод для выбора модели: не покупайте «рациональность» режимом thinking. Проверяйте модель на нужное вам искажение отдельно.
Пример применения
Задача: Вы руководите студией и просите модель оценить рыночную цену разработки Telegram-бота для интернет-магазина. В письме клиента есть фраза: «Мой знакомый сделал нечто похожее за 50 000 ₽, но мы готовы обсуждать». Если пересылать письмо в модель целиком, это число станет якорем.
Промпт:
Ниже письмо клиента. Оцени справедливую рыночную стоимость
разработки Telegram-бота в России (в рублях, один диапазон).
Перед ответом перечисли каждое число, упомянутое в письме.
Письмо:
«Здравствуйте! Нужен Telegram-бот для магазина одежды: каталог,
корзина, оплата через ЮKassa, уведомления менеджеру. Мой знакомый
сделал нечто похожее за 50 000 ₽, но мы готовы обсуждать.
Хотим запуститься до 1 апреля. Каталог — около 300 позиций.»
В конце напиши: «Оценка: от … до … ₽».
Результат: Сначала модель выпишет все числа из письма: 50 000 ₽, 1 апреля, 300 позиций. Затем даст диапазон цены. Важно понимать ожидания: статья показывает небольшое снижение смещения к якорю, а не его исчезновение. Поэтому для денежных решений сравните ответ с оценкой по запросу без числа-якоря.
Почему это работает
Слабость. Reasoning-модель генерирует длинный текст перед ответом, но этот текст не обязан «проверять» нерелевантные детали. Исследователи ссылаются на смежные работы: цепочки рассуждений часто объясняют ответ, который определён подсказкой, о которой в тексте ни слова. Поэтому больше токенов не дают больше рациональности.
Сильная сторона. Модель хорошо следует прямым инструкциям по формату вывода. Если потребовать явно выписать числа, они окажутся в тексте ответа как отдельные объекты, а не как фон.
Как метод обходит слабость. Перечисление превращает якорь из скрытого фона в явный элемент. Что именно происходит дальше, авторы механически не проверяли. Это объяснение остаётся гипотезой, а проверено только то, что эффект есть.
Рычаги: - Что пересказывать. В статье: «каждое число». Для других искажений (рамки, обязательства) можно пересказывать условия или формулировки, но это не проверено. - Reasoning-режим. Не включайте его ради снижения смещений. Цена токенов выше, выгоды по этому критерию нет.
Шаблон промпта
{задача: что оценить или выбрать}
Перед ответом перечисли каждое число, упомянутое в запросе.
{контекст с числами}
Формат ответа: {формат}
Подставьте: {задача} (оценка цены, срока, бюджета), {контекст} (письмо, бриф, описание ситуации), {формат} (диапазон, вариант из списка, число).
Ограничения
⚠️ Эффект небольшой и на границе значимости: снижение якорения было на всех пяти заданиях, но по пяти заданиям статистика не дотягивает до порога (p = .057). Это направление, а не гарантия.
⚠️ Проверено только якорение: для рамки, потери, эскалации обязательств, доступности и подтверждающего смещения аналогичный приём не тестировали.
⚠️ «Обратное» смещение не значит «рационально»: у моделей фрейминг идёт против человеческого паттерна, но ответ всё равно зависит от нерелевантной детали, просто в другую сторону.
⚠️ Малый диапазон «размышлений»: у Claude реально использовалось до ~800 токенов, у GPT-5.1 около 120 при любом запрошенном лимите. DeepSeek-R1 и Qwen3 вообще игнорировали лимит. Результат не доказывает, что очень длинное мышление никогда не поможет.
⚠️ Другая постановка задач: это управленческие кейсы с выбором из нумерованных вариантов. Свободный текст и ваш контекст могут вести себя иначе.
Как исследовали
Идея была простой: если reasoning-модель «думает как человек, включивший медленное мышление», то чем дольше она думает, тем слабее должны быть искажения. Автор взял 30 управленческих кейсов из бенчмарка Malberg et al. по шести искажениям (по пять на каждое). Каждый кейс существовал в двух версиях: контрольной и с «отравленной» деталью. Прогнали семь моделей из четырёх семейств (Claude Haiku 4.5, GPT-5.1, DeepSeek, Qwen3), каждую обычную и thinking-версию, с лимитами размышления 0, 1024, 4096 и 8192 токенов. Каждый вариант запускали по десять раз, всего 12 350 вызовов. Любопытная деталь: лимит из запроса не равен реальному размышлению. Claude его соблюдал, GPT-5.1 давал почти одинаковые ~117 токенов на любом лимите, а DeepSeek и Qwen игнорировали его и «думали» от ~1000 токенов даже при нуле. Поэтому автор считал дозой реально израсходованные токены. Результат противоречил интуиции: никакой наклон «больше мышления, меньше смещения» не оказался значимо отрицательным. Дополнительный сюрприз: четыре из пяти остальных смещений у моделей идут против человеческого направления.
Адаптации и экстраполяции
🔧 Техника: аудит по парным промптам → видите уязвимость своей задачи
Метод статьи по сути такой: два одинаковых запроса, отличающихся только нерелевантной деталью (числом, рамкой). Прогоните оба по 5–10 раз и сравните средние ответы. Для вашей задачи: «оцени стоимость» с числом знакомого и без него.
Экстраполяция (моё предположение, в статье не проверялось). Правило в системный промпт аналитика:
Перед любой оценкой перечисли все числа, упомянутые в запросе.Проверьте на своих кейсах, прежде чем доверять.
Ресурсы
- The Long Road to the Same Answer: Cognitive Bias Under Escalating Reasoning Budgets in Large Language Models, Obada Kraishan, College of Media and Communication, Texas Tech University. Принята на IEEE CogMI 2026.
- Репозиторий: https://github.com/obadaKraishan/anchored-minds
- Бенчмарк-источник: Malberg et al. (30 искажений, 200 сценариев).
- Смежные работы: Turpin et al. и Chen et al. о неполной верности цепочек рассуждений, Knipper et al. об устойчивости R1 и QwQ к фрейминг-эффекту.
