3,583 papers
arXiv:2610.10049 82 7 окт. 2026 г. FREE

Restate-the-Anchor: пересказ чисел из запроса снижает якорение, а «подумай подольше» не снижает смещения

КЛЮЧЕВАЯ СУТЬ
Режим «думай подольше» не лечит когнитивные искажения. Модели с длинными рассуждениями ведутся на чужое число так же, как обычные. Метод Restate-the-Anchor позволяет получать оценки цены, сроков и бюджета, которые меньше зависят от случайного числа в запросе. Фишка: перед ответом заставь модель выписать каждое число из запроса. Число перестаёт быть фоном и становится отдельным объектом в тексте. Якорение снижалось на всех 5 проверенных заданиях. Лишние токены на размышление такого не давали. Но эффект скромный: p = .057, то есть на границе значимости.
Адаптировать под запрос
⚡

TL;DR

Длинное «мышление» reasoning-моделей не делает суждения рациональнее. Reasoning-модели (о-серия, Claude и Qwen с режимом thinking, DeepSeek-R1) не меньше подвержены когнитивным искажениям, чем обычные версии. Точечная оценка даже чуть хуже, хотя статистически различие не надёжно. Больше токенов на размышление смещение тоже не снижает. Там, где что-то менялось, ответ уходил дальше от человеческого паттерна, но не к нейтральному.

Модель по-прежнему зависит от нерелевантных деталей запроса. Вы просите оценить цену, а в контексте мелькает чужое число, например «знакомый сделал за 50 000 ₽». Ответ сдвигается к этому числу. Это якорение, единственное искажение, которое у моделей работает как у людей, причём во всех семи проверенных. Остальные пять искажений модели проявляют вразнобой, а часто наоборот. Причина в том, что длинная цепочка рассуждений не заставляет модель отделять существенное от случайного. Она просто генерирует больше текста вокруг того же ответа.

Дешёвый приём: одна строка в промпте. Если перед ответом потребовать пересказать каждое число из запроса, якорение снижалось на всех пяти проверенных заданиях. Дополнительное «мышление» такого не давало. Эффект небольшой и на границе значимости (p = .057 при пяти заданиях), но направление было одинаковым везде.

🔬

Схема метода

ШАГ 1: Вставь в запрос: «Перед ответом перечисли каждое число,
        упомянутое в запросе» → список чисел
ШАГ 2: Модель даёт оценку → ответ после списка
(всё в одном промпте, один запрос)

Вывод для выбора модели: не покупайте «рациональность» режимом thinking. Проверяйте модель на нужное вам искажение отдельно.

🚀

Пример применения

Задача: Вы руководите студией и просите модель оценить рыночную цену разработки Telegram-бота для интернет-магазина. В письме клиента есть фраза: «Мой знакомый сделал нечто похожее за 50 000 ₽, но мы готовы обсуждать». Если пересылать письмо в модель целиком, это число станет якорем.

Промпт:

Ниже письмо клиента. Оцени справедливую рыночную стоимость
разработки Telegram-бота в России (в рублях, один диапазон).

Перед ответом перечисли каждое число, упомянутое в письме.

Письмо:
«Здравствуйте! Нужен Telegram-бот для магазина одежды: каталог,
корзина, оплата через ЮKassa, уведомления менеджеру. Мой знакомый
сделал нечто похожее за 50 000 ₽, но мы готовы обсуждать.
Хотим запуститься до 1 апреля. Каталог — около 300 позиций.»

В конце напиши: «Оценка: от … до … ₽».

Результат: Сначала модель выпишет все числа из письма: 50 000 ₽, 1 апреля, 300 позиций. Затем даст диапазон цены. Важно понимать ожидания: статья показывает небольшое снижение смещения к якорю, а не его исчезновение. Поэтому для денежных решений сравните ответ с оценкой по запросу без числа-якоря.

🧠

Почему это работает

Слабость. Reasoning-модель генерирует длинный текст перед ответом, но этот текст не обязан «проверять» нерелевантные детали. Исследователи ссылаются на смежные работы: цепочки рассуждений часто объясняют ответ, который определён подсказкой, о которой в тексте ни слова. Поэтому больше токенов не дают больше рациональности.

Сильная сторона. Модель хорошо следует прямым инструкциям по формату вывода. Если потребовать явно выписать числа, они окажутся в тексте ответа как отдельные объекты, а не как фон.

Как метод обходит слабость. Перечисление превращает якорь из скрытого фона в явный элемент. Что именно происходит дальше, авторы механически не проверяли. Это объяснение остаётся гипотезой, а проверено только то, что эффект есть.

Рычаги: - Что пересказывать. В статье: «каждое число». Для других искажений (рамки, обязательства) можно пересказывать условия или формулировки, но это не проверено. - Reasoning-режим. Не включайте его ради снижения смещений. Цена токенов выше, выгоды по этому критерию нет.

📋

Шаблон промпта

{задача: что оценить или выбрать}

Перед ответом перечисли каждое число, упомянутое в запросе.

{контекст с числами}

Формат ответа: {формат}

Подставьте: {задача} (оценка цены, срока, бюджета), {контекст} (письмо, бриф, описание ситуации), {формат} (диапазон, вариант из списка, число).

⚠️

Ограничения

⚠️ Эффект небольшой и на границе значимости: снижение якорения было на всех пяти заданиях, но по пяти заданиям статистика не дотягивает до порога (p = .057). Это направление, а не гарантия.

⚠️ Проверено только якорение: для рамки, потери, эскалации обязательств, доступности и подтверждающего смещения аналогичный приём не тестировали.

⚠️ «Обратное» смещение не значит «рационально»: у моделей фрейминг идёт против человеческого паттерна, но ответ всё равно зависит от нерелевантной детали, просто в другую сторону.

⚠️ Малый диапазон «размышлений»: у Claude реально использовалось до ~800 токенов, у GPT-5.1 около 120 при любом запрошенном лимите. DeepSeek-R1 и Qwen3 вообще игнорировали лимит. Результат не доказывает, что очень длинное мышление никогда не поможет.

⚠️ Другая постановка задач: это управленческие кейсы с выбором из нумерованных вариантов. Свободный текст и ваш контекст могут вести себя иначе.

🔍

Как исследовали

Идея была простой: если reasoning-модель «думает как человек, включивший медленное мышление», то чем дольше она думает, тем слабее должны быть искажения. Автор взял 30 управленческих кейсов из бенчмарка Malberg et al. по шести искажениям (по пять на каждое). Каждый кейс существовал в двух версиях: контрольной и с «отравленной» деталью. Прогнали семь моделей из четырёх семейств (Claude Haiku 4.5, GPT-5.1, DeepSeek, Qwen3), каждую обычную и thinking-версию, с лимитами размышления 0, 1024, 4096 и 8192 токенов. Каждый вариант запускали по десять раз, всего 12 350 вызовов. Любопытная деталь: лимит из запроса не равен реальному размышлению. Claude его соблюдал, GPT-5.1 давал почти одинаковые ~117 токенов на любом лимите, а DeepSeek и Qwen игнорировали его и «думали» от ~1000 токенов даже при нуле. Поэтому автор считал дозой реально израсходованные токены. Результат противоречил интуиции: никакой наклон «больше мышления, меньше смещения» не оказался значимо отрицательным. Дополнительный сюрприз: четыре из пяти остальных смещений у моделей идут против человеческого направления.

💡

Адаптации и экстраполяции

🔧 Техника: аудит по парным промптам → видите уязвимость своей задачи

Метод статьи по сути такой: два одинаковых запроса, отличающихся только нерелевантной деталью (числом, рамкой). Прогоните оба по 5–10 раз и сравните средние ответы. Для вашей задачи: «оцени стоимость» с числом знакомого и без него.

Экстраполяция (моё предположение, в статье не проверялось). Правило в системный промпт аналитика:

Перед любой оценкой перечисли все числа, упомянутые в запросе.

Проверьте на своих кейсах, прежде чем доверять.

🔗

Ресурсы

  • The Long Road to the Same Answer: Cognitive Bias Under Escalating Reasoning Budgets in Large Language Models, Obada Kraishan, College of Media and Communication, Texas Tech University. Принята на IEEE CogMI 2026.
  • Репозиторий: https://github.com/obadaKraishan/anchored-minds
  • Бенчмарк-источник: Malberg et al. (30 искажений, 200 сценариев).
  • Смежные работы: Turpin et al. и Chen et al. о неполной верности цепочек рассуждений, Knipper et al. об устойчивости R1 и QwQ к фрейминг-эффекту.

📋 Дайджест исследования

Ключевая суть

Режим «думай подольше» не лечит когнитивные искажения. Модели с длинными рассуждениями ведутся на чужое число так же, как обычные. Метод Restate-the-Anchor позволяет получать оценки цены, сроков и бюджета, которые меньше зависят от случайного числа в запросе. Фишка: перед ответом заставь модель выписать каждое число из запроса. Число перестаёт быть фоном и становится отдельным объектом в тексте. Якорение снижалось на всех 5 проверенных заданиях. Лишние токены на размышление такого не давали. Но эффект скромный: p = .057, то есть на границе значимости.

Принцип работы

Больше токенов не значит больше проверки. Модель пишет длинный текст вокруг того же самого ответа. Это как адвокат, который сочиняет красивую речь под уже готовый приговор. Якорь (например, «знакомый сделал за 50 000 ₽») сидит в запросе как фон. Цепочка рассуждений его не трогает. Не проси думать дольше. Заставь вытащить число на свет. Когда число выписано отдельной строкой, оно перестаёт тихо тянуть ответ к себе. Про якорение в этом смысле известно одно: модели ведутся на него, как люди, причём все 7 проверенных.

Почему работает

Авторы ссылаются на смежные работы. Цепочки рассуждений часто объясняют ответ, который определён подсказкой, о которой в тексте ни слова. Поэтому режим thinking не делает суждения рациональнее. Точечная оценка у таких моделей даже чуть хуже, хотя различие статистически ненадёжно. Остальные пять искажений (рамки, потери, эскалация обязательств, доступность, подтверждение) у моделей идут вразнобой, часто наоборот. А якорение работает у всех семи. Лишние токены дают больше слов вокруг того же ответа, а не больше проверки. Диапазон «размышлений» в тесте был узкий. У Claude реально использовалось до ~800 токенов. У GPT-5.1 около 120 при любом лимите. DeepSeek-R1 и Qwen3 лимит просто игнорировали. Почему пересказ чисел помогает, авторы не проверяли. Это гипотеза. Проверено только то, что эффект есть.

Когда применять

Оценки цены, сроков и бюджета по письму клиента или брифу, где мелькает чужое число → особенно когда в тексте есть «а знакомый сделал за…» или «в прошлом году было…». НЕ подходит как защита от других искажений: рамки, потерь, эскалации обязательств, доступности и подтверждающего смещения. Для них приём не тестировали. Для денежных решений сравни ответ с оценкой по тому же запросу без числа-якоря.

Мини-рецепт

1. Найди якорь: есть ли в запросе чужая цена, срок или прошлый результат?
2. Добавь одну строку: Перед ответом перечисли каждое число, упомянутое в запросе.
3. Поставь строку до контекста: сначала задача, потом эта инструкция, потом письмо или бриф с числами.
4. Зафиксируй формат: например, В конце напиши: «Оценка: от … до … ₽». Один диапазон вместо рассуждений на три абзаца.
5. Не включай режим thinking ради этого: токенов уйдёт больше, а выгоды по смещению нет.
6. Сделай контрольный прогон: тот же запрос без числа-якоря. Если ответы сильно расходятся, якорь всё ещё тянет.
7. Не жди чуда: по статье это небольшое снижение смещения, а не его исчезновение.

Примеры

[ПЛОХО] : Оцени рыночную цену Telegram-бота для магазина. Подумай хорошенько и рассуждай пошагово. Письмо клиента: «Мой знакомый сделал нечто похожее за 50 000 ₽, но мы готовы обсуждать».
[ХОРОШО] : Оцени справедливую рыночную стоимость разработки Telegram-бота в России (в рублях, один диапазон). Перед ответом перечисли каждое число, упомянутое в письме. Письмо: «Нужен бот для магазина одежды: каталог, корзина, оплата через ЮKassa. Мой знакомый сделал нечто похожее за 50 000 ₽, но мы готовы обсуждать. Запуск до 1 апреля. Каталог около 300 позиций». В конце напиши: «Оценка: от … до … ₽». Сначала модель выпишет: 50 000 ₽, 1 апреля, 300 позиций. Потом даст диапазон. Якорь уже лежит на столе отдельной строкой, а не шепчет из фона.
Источник: The Long Road to the Same Answer: Cognitive Bias Under Escalating Reasoning Budgets in Large Language Models
ArXiv ID: 2610.10049 | Сгенерировано: 2026-10-08 06:00

Проблемы LLM

ПроблемаСутьКак обойти
Лишнее число в запросе сдвигает оценку моделиПросишь оценить цену, срок или бюджет. В тексте есть чужое число: «знакомый сделал за 50 000 ₽». Модель тянется к нему. Ты не просил его учитывать, а оно влияет. Это якорение. Из известных человеческих искажений у моделей оно проявляется самым стабильным образом. Остальные искажения идут вразнобой или в обратную сторону. Под угрозой любые задачи с оценкой числа по тексту: письма клиентов, брифы, переписки1) Убери из запроса числа, не нужные для оценки. Передавай только данные, от которых зависит ответ. 2) Для важных решений задай тот же вопрос дважды: с числом и без. Если ответы сильно разные, это якорь. 3) Слабая мера: добавь «Перед ответом перечисли каждое число из запроса». Снижение было небольшим и не доказано надёжно. Не заменяет пункты 1 и 2

Тезисы

ТезисКомментарий
Длинные рассуждения не делают модель рациональнееРежим «подумай подольше» и модели с рассуждениями не защищают от когнитивных искажений. Больше токенов на размышление смещение тоже не снижает. Почему так: длинный текст не заставляет модель отделять важное от случайного. Модель пишет больше слов вокруг того же ответа. Часто рассуждения лишь объясняют ответ, который уже задан скрытой подсказкой в запросе. Применяй: не включай режим рассуждений ради защиты от смещений. Он стоит дороже и не даёт выгоды по этому критерию. Нужна защита — меняй запрос, а не длину мышления. Оговорка: проверяли короткие рассуждения, до сотен токенов. Для очень длинных цепочек вывод не доказан
📖 Простыми словами

The Long Road to the Same Answer: Cognitive Bias Under Escalating Reasoning Budgets inLargeLanguageModels

arXiv: 2610.10049

Reasoning-модели вроде DeepSeek-R1 или OpenAI o-series не думают как мудрецы — они просто тратят драгоценные токены на самооправдание. Если скормить нейронке искажённый ввод, увеличенный reasoning budget вообще не включит критическое мышление. Модель моментально цепляется за первый попавшийся якорь, а потом генерирует простыню псевдологики, чтобы технично подогнать ответ под этот случайный бред. Больше размышлений не равно больше рациональности.

Это как упёртый знакомый, который уже решил спустить всю заначку на сомнительную крипту. Если попросить его «сесть и хорошо подумать», он не одумается, а лишь изобретёт ещё пять безумных причин для покупки. Длинная цепочка мыслей Chain-of-Thought здесь работает не как фильтр ошибок, а как нанятый адвокат. Задача такого адвоката — изо всех сил оправдать принятое на автомате глупое решение.

В исследовании прогнали свежие модели с режимом размышлений, включая Claude Thinking и Qwen. Результат отрезвляет: раздувание цепочки шагов не снижает когнитивные искажения. В тестах на эффект якоря продвинутые версии лажают точно так же, как обычные, а иногда даже хуже. Если клиент в письме брякнул: «мне пилили похожего бота за 50 000 ₽», модель неизбежно спляшет вокруг этой цифры, сколько бы минут она ни думала.

Тестировали классические психологические ловушки, но грабли бьют повсюду: от оценки смет до ревью кода и скоринга кандидатов. Любая лишняя деталь в промпте становится триггером, который смещает итоговую оценку в сторону мусора. Иллюзия глубокого анализа смертельно опасна: ответ выглядит невероятно солидно и аргументированно, хотя внутри зашит абсолютно иррациональный перекос.

Короче: хватит наивно верить, что продвинутые рассуждалки сами отделят зерна от плевел. Грязный контекст ломает даже топовую нейронку. Не скармливай модели чужие догадки, намёки и токсичные вводные в надежде на мифическую «объективность со стороны». Вычищай входящие данные до стерильности своими руками, иначе получишь дорогой самообман, завёрнутый в красивый вывод.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с