3,583 papers
arXiv:2610.07751 73 6 окт. 2026 г. FREE

Belief-State Prompting и шумные данные: как LLM-агенту рассуждать, когда инструмент ошибается

КЛЮЧЕВАЯ СУТЬ
Обнаружено: слабые модели в неверных ответах уверены даже сильнее, чем в верных. Они хватаются за первый ответ источника и через пару вопросов пишут «90%». Метод Belief-State Prompting (промпт с отслеживанием убеждений) позволяет агенту расследовать причину по ненадёжным данным и останавливаться, когда доказательств правда хватает. Фишка: порог «остановись при 90%» ничего не проверяет, слабая модель просто пишет 90%. Поэтому после каждого ответа модель переписывает таблицу убеждений по каждому варианту и коротко объясняет сдвиг. Если процент прыгнул с 33% до 90% после одного ответа, это видно сразу. Но заметный прирост получают в основном сильные модели.
Адаптировать под запрос
⚡

TL;DR

Исследование проверяет, как LLM-агент ведёт себя, когда единственный источник данных ненадёжен и иногда отвечает по-разному на один и тот же вопрос. Агент задаёт источнику вопросы по шагам, видит ответы и оценку согласованности (сколько раз из нескольких попыток источник повторил тот же ответ), а затем решает, когда остановиться. Лучше всего показал себя рецепт Belief-State Prompting (BP, «промпт с отслеживанием убеждений»). Модель после каждого шага держит в тексте, насколько она верит в каждый вариант ответа, и выдаёт финал только когда уверена.

Главная находка: слабые модели решают слишком рано и уверенно ошибаются. Они хватаются за первый же ответ, задают уточняющие вопросы «подтверди ещё раз» и быстро объявляют 90% уверенности, хотя доказательств почти не прибавилось. Их уверенность в ошибочных ответах оказалась даже выше, чем в верных. Уверенность подстраивается под порог из промпта («остановись при 90%»), а не под силу найденных свидетельств. У сильных моделей доказательства накапливаются постепенно, а вопросы разнообразнее. Человек в первом раунде почти всегда задаёт широкий описательный вопрос, дальше идёт точечными вопросами и подтверждает реже всех.

Метод BP — это один промпт: «веди таблицу убеждений по вариантам, обновляй после каждого ответа, финал выдавай только при достаточной уверенности». Он заметно помогает только сильным моделям. У слабых обычный ReAct (цикл «мысль → действие → наблюдение») часто не хуже. Подсказка с «оценкой согласованности» ускоряет работу на задачах восприятия, но на задачах знаний может навредить: источник бывает стабильно и уверенно неправ.

🔬

Схема метода

ЦИКЛ (в одном промпте, ходы чередуются с ответами источника):
ШАГ 1: Записать варианты ответа и стартовые убеждения (поровну) → таблица %
ШАГ 2: Задать источнику ОДИН самодостаточный вопрос → вопрос
ШАГ 3: Получить ответ + оценку согласованности → факты
ШАГ 4: Обновить убеждения по каждому варианту, кратко объяснить почему → новая таблица %
ШАГ 5: Уверенность ≥ порога? Да → финальный ответ. Нет → вернуться к шагу 2
🚀

Пример применения

Задача: Владелец сети кофеен в Казани видит, что в октябре выручка упала. Есть три гипотезы: (А) конкурент открылся рядом, (Б) подрос чек на сиропах и сезонных напитках и ушли постоянные клиенты, (В) сломалась программа лояльности в приложении. Агент в Claude Code или Cursor может запрашивать «ненадёжные» источники: отчёты из CRM, разные выгрузки, ответы сотрудников. Они противоречат друг другу.

Промпт:

Ты — аналитик. Нужно выбрать ОДНУ из трёх причин падения выручки сети кофеен «Зерно» в Казани в октябре:
А) рядом с точкой на Баумана открылся конкурент;
Б) постоянные клиенты ушли из-за роста цен на сезонные напитки;
В) сломалась программа лояльности в приложении.

Источники ненадёжны: выгрузки CRM бывают неполными, управляющие противоречат друг другу. Я буду присылать ответы по твоим вопросам.

Правила:
1. До первого вопроса запиши стартовые убеждения по вариантам (в сумме 100%).
2. Первый вопрос — широкий, описательный: «что изменилось в октябре по точкам?». Дальше — точечные вопросы, которые различают гипотезы. Не задавай вопрос «подтверди ещё раз» — вместо этого проверь ту же мысль с другой стороны.
3. После каждого ответа обнови убеждения по А/Б/В и в одной строке объясни, какое свидетельство сдвинуло их. Если два источника противоречат друг другу — скажи об этом прямо и не решай сразу.
4. Ответ давай, только когда одна гипотеза подтверждена как минимум двумя разными по типу источниками. Если нет — задай ещё вопрос.
5. Когда решишь, что хватает, напиши финальный ответ, итоговые убеждения и что бы тебя переубедило.

Результат: Модель сначала выдаст таблицу убеждений, потом задаст широкий вопрос про изменения за месяц. После каждого ответа она покажет обновлённые проценты и короткое обоснование сдвига. Если выгрузки противоречат друг другу, она это отметит и задаст разведочный вопрос с другой стороны. Финалом будет выбор причины с итоговыми убеждениями и условием, что могло бы изменить решение.

🧠

Почему это работает

Слабость LLM. Первое правдоподобное свидетельство сильно якорит модель. Дальше она ищет подтверждение и заранее называет уверенность «как просили». Если в промпте «останавливайся при 90%», слабая модель просто пишет 90%, а не оценивает силу доказательств. Если источник в целом согласован, но неправ, повторение вопроса даёт только ложную уверенность.

Сильная сторона. Модель хорошо ведёт структурированную запись: варианты, проценты, причина сдвига. Эта запись видна и самой модели, и вам. Сильные модели используют её, чтобы действительно накапливать доказательства: у них убеждения растут постепенно, а не прыжком после первого ответа.

Как метод обходит слабость. Таблица убеждений превращает «мне кажется, это А» в проверяемую запись. Вы видите, после какого вопроса модель решила и достаточно ли было причин. Если уверенность прыгнула с 33% до 90% после одного ответа, это сигнал.

Рычаги управления: - Порог уверенности. Не ставьте один и тот же фиксированный порог всем моделям: слабая под него просто подстроится. Лучше требовать два разных независимых источника. - Типы вопросов. Первый раунд — «опиши всё, что видишь», потом точечные вопросы, и мало подтверждающих. Подтверждение — это ловушка слабой модели. - Отдельная строка «что бы меня переубедило». Заставляет искать опровергающее, а не подтверждающее. - Источник уверен, но может быть неправ. Для знаниевых вопросов добавьте проверку из внешнего независимого места, а не только повтор того же источника.

📋

Шаблон промпта

Текст BP в статье вынесен в приложение и в оригинале не приведён. Ниже реконструкция по описанию: следить за убеждениями по вариантам и коммититься только при достаточной уверенности. Плюс правила про типы вопросов, которые авторы описывают как признаки сильных рассуждающих.

Ты решаешь задачу с ненадёжными источниками. Задача: {задача}.
Варианты ответа:
{варианты}

Источник: {источник}. Он может ошибаться и отвечать по-разному на один вопрос.
{сигнал_согласованности}

Работай по циклу:
1. Запиши убеждения по каждому варианту в процентах (сумма 100%).
2. Задай источнику ОДИН самодостаточный вопрос.
3. После моего ответа обнови убеждения и в 1–2 строках объясни, какое свидетельство их сдвинуло.
4. Если ответы противоречат друг другу — назови противоречие и проверь другим вопросом.
5. Финальный ответ давай только когда {условие_остановки}.

Правила вопросов:
- Первый вопрос — широкий, описательный.
- Дальше — точечные, которые различают варианты.
- Подтверждающие вопросы («а точно?») используй редко: сначала попробуй другой угол.

Формат каждого шага: [Убеждения: A=.., Б=.., В=..] → [Вопрос] → (после ответа) [Обновление и причина].

Что подставлять: {задача} — суть решения; {варианты} — 2–5 конкретных вариантов; {источник} — что отвечает (выгрузка, сотрудник, другая модель); {сигнал_согласованности} — если есть, как часто источник повторяет ответ; {условие_остановки} — например, «одна гипотеза подтверждена двумя разными по типу источниками».

🚀 Быстрый старт — вставь в чат:

Вот шаблон Belief-State Prompting. Адаптируй под мою задачу: [твоя задача].
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про варианты ответа, источники и условие остановки. Для метода нужны конкретные варианты, между которыми можно распределять убеждения, и понятный критерий «хватит». Остальное она возьмёт из паттерна шаблона.

⚠️

Ограничения

⚠️ Слабые модели: BP помогает в основном сильным моделям. У слабых он часто не лучше обычного ReAct: они пишут высокую уверенность по инструкции, а не по доказательствам. Сам по себе промпт «поведение слабой модели» не исправляет.

⚠️ Порог уверенности: фиксированный порог вроде «90%» провоцирует показную уверенность. Слабая модель называет ту цифру, которую вы просили, а ошибочные ответы получают даже более высокую уверенность, чем верные.

⚠️ Знаниевые задачи: сигнал «источник согласован» там иногда вредит. Источник может быть устойчиво и уверенно неправ, и тогда согласованность — ложное подтверждение.

⚠️ Дообучение не спасает: обучение модели на её же удачных траекториях не дало стабильного прироста и местами ухудшило результат. Это не путь для практика, зато подтверждает: навык не копируется по поверхностным образцам.

⚠️ Задачи и данные: эксперименты — на ответах о картинке через текст. Перенос на бизнес-расследования, поддержку или аналитику — ваша экстраполяция. Убеждения, которые модель пишет, — её самоотчёт, а не гарантированное внутреннее состояние. Текст статьи в части анализа типов вопросов у нас обрезан.

🔍

Как исследовали

Идея была простой: заменить зрение текстом и проверить, умеют ли LLM рассуждать, когда «глаза» врут. Текстовая модель не видит картинку. Она задаёт вопросы про неё VLM (модели, которая видит изображения), а та отвечает с шумом: ответ каждый раз немного другой. Вместе с ответом модель получает долю повторов — сигнал согласованности.

Исследователи взяли два небольших VLM как «шумные датчики» и пять наборов вопросов: восприятие, графики, знания. Оставили только вопросы, где датчик отвечает верно в одном–пяти случаях из 11. Дополнительно проверили, что человек, не видя картинки, всё-таки может решить задачу. Получилось 1000 задач.

Сравнили восемь LLM и три стратегии: ReAct, UoT (стратегия «выбирай вопросы, которые лучше всего снижают неопределённость») и BP. Люди решали на 70–90%, лучшие модели — на 40–60%. UoT оказалась слабее двух других.

Дальше посмотрели, почему так. Они воспроизвели сотни диалогов и попросили модель после каждого шага выдать вероятность по вариантам. У большой модели вероятность верного ответа росла постепенно (примерно до 0.44–0.57). У маленькой — едва (до ~0.32), но уверенность в финале была выше. Почти половина диалогов маленькой модели уже после первого шага превышала 0.7 уверенности, против 13% у большой. Ошибочные диалоги заканчивались быстрее, чем верные у сильной. Вывод: скорость слабой модели — не признак силы, а признак ранней привязки к первому ответу.

Аблация сигнала согласованности показала: настоящий сигнал помогает на восприятии и диаграммах, а на знаниевом наборе иногда мешает. Людям случайный сигнал вредил сильнее, чем моделям. Модели меньше полагаются на подсказку, чем люди.

💡

Адаптации и экстраполяции

🔧 Техника: заменить порог процентов на правило «два разных источника» → меньше показной уверенности

Вместо «Заканчивай, когда уверенность ≥90%» напишите: «Заканчивай, только когда выбранный вариант подтверждён минимум двумя источниками разного типа (например, выгрузка + сотрудник), и ни один найденный факт не противоречит ему без объяснения». Это переносит остановку с цифры, которую модель нарисует, на проверяемый критерий.

🔧 Техника: потребовать «после каждого ответа напиши, что бы опровергло текущий лидер» → меньше раннего якоря

Добавьте в шаг 3: «Назови один факт, который заставил бы тебя сменить лидирующий вариант, и следующим вопросом проверь именно его». Это идея-вывод из анализа: подтверждающие вопросы — признак слабого рассуждения, опровергающие — сильного. Сама формулировка здесь наша, проверять её надо на своей задаче.

Экстраполяция: проверка слухов и спорных данных в Perplexity или Claude с поиском

Утверждение: «{утверждение}». Источники в поиске противоречат друг другу.
Веди таблицу убеждений: «верно / неверно / неясно» в %.
После каждого найденного источника обнови таблицу и укажи тип источника
(первоисточник, СМИ, пересказ, соцсети). Один и тот же факт из нескольких пересказов считай ОДНИМ свидетельством.
Финал — только когда есть минимум два независимых первоисточника.

Это наша адаптация: идея про «согласованность ≠ правда» применена к дублирующимся источникам. В статье такого эксперимента нет.

🔗

Ресурсы

  • Название работы: How Well Do LLMs Reason with Noisy Evidence? An Active Visual Reasoning Benchmark (бенчмарк VISUALNOISEQA).
  • Авторы: Bach Nguyen, Zhaonan Li, Mau Son Nguyen, Sanika Chavan, Nilay Kumar, Hong Anh Nguyen, Khoa Vo, Ben Zhou — Arizona State University.
  • Код и данные обещаны к открытому релизу после публикации.
  • Упомянутые методы: ReAct (Yao et al., 2023), Uncertainty of Thoughts (Hu et al., 2024), «слепой» VQA (Li et al., 2025), self-consistency (Wang et al., 2023).

📋 Дайджест исследования

Ключевая суть

Обнаружено: слабые модели в неверных ответах уверены даже сильнее, чем в верных. Они хватаются за первый ответ источника и через пару вопросов пишут «90%». Метод Belief-State Prompting (промпт с отслеживанием убеждений) позволяет агенту расследовать причину по ненадёжным данным и останавливаться, когда доказательств правда хватает. Фишка: порог «остановись при 90%» ничего не проверяет, слабая модель просто пишет 90%. Поэтому после каждого ответа модель переписывает таблицу убеждений по каждому варианту и коротко объясняет сдвиг. Если процент прыгнул с 33% до 90% после одного ответа, это видно сразу. Но заметный прирост получают в основном сильные модели.

Принцип работы

Это цикл, и он идёт в одном промпте. 1. Модель записывает варианты и стартовые убеждения поровну. 2. Задаёт источнику ОДИН самодостаточный вопрос. 3. Получает ответ и обновляет проценты. В одной строке пишет, какое свидетельство их сдвинуло. 4. Если уверенности хватает, даёт финал. Если нет, возвращается к шагу 2. Модель не говорит «мне кажется, это А», она ведёт проверяемую запись. Это как бухгалтерская книга вместо устного «ну, вроде сходится». Любой сдвиг можно найти и спросить: «а почему здесь +40%?». Первый вопрос широкий: «что изменилось?». Дальше точечные, которые различают гипотезы. Вопросы «подтверди ещё раз» почти не нужны.

Почему работает

Первое правдоподобное свидетельство сильно якорит модель. Дальше она ищет подтверждение и называет уверенность «как просили». Повтор вопроса источнику тут не помогает. Источник может быть стабильно и уверенно неправ, и тогда повтор даёт только ложную уверенность. Запись с причиной каждого сдвига превращает уверенность из украшения в улику: прыжок без новых фактов сразу виден. Сильные модели используют запись по делу, у них убеждения растут постепенно. Слабые просто подгоняют цифры под порог. Поэтому у них BP часто не лучше обычного ReAct (цикл «мысль → действие → наблюдение»). Надёжный рычаг не порог в процентах. Лучше требовать два разных по типу независимых источника и строку «что бы меня переубедило». Она заставляет искать опровергающее. Подсказка «источник согласован» ускоряет задачи восприятия. На вопросах знаний она может навредить: согласованное враньё остаётся враньём.

Когда применять

Анализ причин и диагностика → выбор одной из 2-5 конкретных гипотез по противоречивым данным (выгрузки, ответы сотрудников, другая модель), особенно когда агент сам решает, о чём спрашивать и когда остановиться. НЕ подходит для задач без чётких вариантов ответа, потому что процентам не за что зацепиться. Со слабой моделью не надейтесь на чудо: таблица покажет её ошибку, но не исправит. Эксперименты в статье проводили на вопросах о картинке в текстовом виде. Перенос на бизнес-задачи пока ваша экстраполяция. Убеждения в таблице тоже самоотчёт модели, а не прямой взгляд внутрь неё.

Мини-рецепт

1. Назови варианты: 2-5 конкретных гипотез. Без них проценты не между чем делить.
2. Опиши источники: скажи прямо, что они ошибаются и противоречат друг другу.
3. Потребуй стартовую таблицу: убеждения поровну, сумма 100%, до первого вопроса.
4. Задай порядок вопросов: первый широкий, дальше точечные. «А точно?» только в крайнем случае.
5. Требуй причину сдвига: после каждого ответа одна строка, что именно подвинуло проценты.
6. Поставь условие остановки: не «90%», а «подтверждено двумя разными по типу источниками».
7. Добавь страховку: в финале модель пишет итоговые убеждения и что бы её переубедило.
8. Следи за таблицей: скачок с 33% до 90% после одного ответа значит, что модель торопится. Верни её к вопросам.

Примеры

[ПЛОХО] : Почему упала выручка в кофейнях в октябре? Скажи, когда будешь уверен на 90%.
[ХОРОШО] : Выбери ОДНУ причину падения выручки в октябре: А) рядом открылся конкурент; Б) постоянные клиенты ушли из-за цен на сезонные напитки; В) сломалась программа лояльности. Источники ненадёжны: выгрузки неполные, управляющие противоречат друг другу. Сначала запиши стартовые убеждения по А/Б/В (сумма 100%). Первый вопрос задай широкий: что изменилось по точкам? Дальше только точечные вопросы, которые различают гипотезы. После каждого ответа обнови проценты и в одной строке скажи, что их сдвинуло. Если источники противоречат друг другу, скажи об этом прямо и не решай сразу. Финал давай, только когда одна гипотеза подтверждена двумя разными по типу источниками. В конце напиши, что бы тебя переубедило.
Источник: How Well Do LLMs Reason with Noisy Evidence? An Active Visual Reasoning Benchmark
ArXiv ID: 2610.07751 | Сгенерировано: 2026-10-07 05:10

Проблемы LLM

ПроблемаСутьКак обойти
Модель называет уверенность, которую ты просил, а не ту, что естьПишешь в запросе "остановись, когда уверен на 90%". Слабая модель быстро пишет "90%". Доказательств при этом почти не прибавилось. Уверенность в неверных ответах бывает даже выше, чем в верных. Ты думаешь, что вывод проверен, а он нет. Касается любых задач с условием "ответь, когда уверен"Не задавай один числовой порог. Задай условие по сути: "ответ подтверждён двумя независимыми источниками разного типа". Смотри на скачки: уверенность выросла с 33% до 90% после одного ответа. Это сигнал, что модель не накапливала доказательства, а решила сразу
Повторная проверка у того же источника даёт ложную уверенностьМодель получила первый правдоподобный ответ и зацепилась за него. Дальше она просит источник "подтверди ещё раз". Источник повторяет то же самое. Уверенность растёт, знаний не прибавилось. Хуже всего, когда источник стабильно и уверенно неправ. Тогда согласованность ответов просто закрепляет ошибкуЗапрети вопросы вида "а точно?". Вместо них проси проверить ту же мысль с другой стороны. Например, другой источник, другой тип данных, другой вопрос. Для вопросов на знания добавь внешнюю независимую проверку, а не повтор того же источника

Методы

МетодСуть
Таблица убеждений — решение становится видимымПопроси модель вести запись по вариантам ответа. До первого вопроса: стартовые убеждения поровну, сумма 100%. После каждого ответа источника: новые проценты и одна строка "какое свидетельство сдвинуло". Формат: [Убеждения: А=.., Б=.., В=..] → [Вопрос] → [Обновление и причина]. Финал давай только при достаточной уверенности. Почему работает: фраза "мне кажется, это А" становится записью, которую можно проверить. Ты видишь, после какого вопроса и по какой причине модель решила. Сильные модели реально накапливают доказательства по этой записи. Когда да: нужно выбрать из 2–5 конкретных вариантов, есть критерий "хватит". Когда нет: слабая модель. Она заполнит таблицу "для вида". Записи — это самоотчёт модели, а не гарантия её внутреннего состояния
Сначала широкий вопрос, потом различающие — против раннего якоряПервый вопрос просит описать всё: "что изменилось по точкам за месяц?". Дальше — точечные вопросы, которые разделяют гипотезы: "если верна А, то должно быть X, а при Б — Y". Подтверждающие вопросы используй редко. Почему работает: широкий вопрос не даёт зацепиться за одну версию в самом начале. Различающий вопрос даёт больше информации, чем подтверждающий. Подтверждение — ловушка слабой модели. Когда да: диагностика, расследование причин, разбор инцидентов. Когда нет: вариант уже известен, нужна только проверка факта
Условие остановки по типам доказательств + "что бы меня переубедило"Вместо "остановись при 90%" пиши: "ответ давай, когда гипотезу подтвердили два источника разного типа". В конце проси: "напиши итоговые убеждения и что бы тебя переубедило". Почему работает: условие по сути нельзя выполнить, просто назвав число. Нужны реальные факты из разных мест. Строка "что переубедит" заставляет модель искать опровержение, а не подтверждение. Когда да: ненадёжные или противоречивые данные. Когда нет: источник один и другого нет. Тогда честнее попросить модель назвать это ограничением
📖 Простыми словами

How Well DoLLMsReason with Noisy Evidence? An Active Visual Reasoning Benchmark

arXiv: 2610.07751

Большинство AI-агентов моментально ломаются в реальном мире, потому что верят первому попавшемуся слуху. Когда источник данных путается в показаниях, у LLM срабатывает классический эффект якоря: модель слепо цепляется за начальную гипотезу и дальше лишь ищет ей подтверждения. Вместо честной аналитики она имитирует работу — если промпт требует остановиться при «уверенности в 90%», слабая модель просто нарисует эту цифру с потолка, чтобы поскорее отделаться.

Это как допрашивать нетрезвого свидетеля, который сам толком ничего не разглядел, но очень уверенно кивает головой. Ты переспрашиваешь его пять раз, он пять раз одинаково врёт, а неопытный следователь радостно закрывает дело: «раз показания сходятся, значит точно он». В исследовании эта ложная согласованность усыпляет бдительность агента, заставляя его принимать банальный системный шум за чистую правду.

Решает проблему метод Belief-State Prompting (BP), или промпт с отслеживанием убеждений. Вместо слепой погони за выводом агент после каждого вопроса письменно ведет баланс вероятностей по всем гипотезам одновременно. Модель явно фиксирует в тексте, насколько она сейчас верит в каждый вариант, сопоставляет силу улик и делает финальный выбор только тогда, когда математика сомнений реально сошлась, а не когда ей просто показалось.

Тестировали механику на визуальных тестах, но принцип абсолютно универсален. Возьми реальный бизнес: выручка сети кофеен внезапно рухнула, а кривая CRM, отчеты бариста и статистика приложения противоречат друг другу. Обычный агент схватится за первую ошибку в логах и сольет бюджет на ложную проблему, тогда как пошаговая калибровка убеждений позволяет отсеять откровенный мусор и докопаться до реальной причины сбоя.

Короче: никогда не надейся, что LLM сама адекватно оценит противоречивые факты из внешних баз или кривых API. Заставляй агента явно расписывать сомнения по каждому пункту перед принятием решения. Без жесткого контроля вероятностей ты построишь не автономного аналитика, а самоуверенного сказочника, который принесет фатально ошибочный вывод с гордой припиской «уверен на 99%».

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с