TL;DR
Исследование проверяет, как LLM-агент ведёт себя, когда единственный источник данных ненадёжен и иногда отвечает по-разному на один и тот же вопрос. Агент задаёт источнику вопросы по шагам, видит ответы и оценку согласованности (сколько раз из нескольких попыток источник повторил тот же ответ), а затем решает, когда остановиться. Лучше всего показал себя рецепт Belief-State Prompting (BP, «промпт с отслеживанием убеждений»). Модель после каждого шага держит в тексте, насколько она верит в каждый вариант ответа, и выдаёт финал только когда уверена.
Главная находка: слабые модели решают слишком рано и уверенно ошибаются. Они хватаются за первый же ответ, задают уточняющие вопросы «подтверди ещё раз» и быстро объявляют 90% уверенности, хотя доказательств почти не прибавилось. Их уверенность в ошибочных ответах оказалась даже выше, чем в верных. Уверенность подстраивается под порог из промпта («остановись при 90%»), а не под силу найденных свидетельств. У сильных моделей доказательства накапливаются постепенно, а вопросы разнообразнее. Человек в первом раунде почти всегда задаёт широкий описательный вопрос, дальше идёт точечными вопросами и подтверждает реже всех.
Метод BP — это один промпт: «веди таблицу убеждений по вариантам, обновляй после каждого ответа, финал выдавай только при достаточной уверенности». Он заметно помогает только сильным моделям. У слабых обычный ReAct (цикл «мысль → действие → наблюдение») часто не хуже. Подсказка с «оценкой согласованности» ускоряет работу на задачах восприятия, но на задачах знаний может навредить: источник бывает стабильно и уверенно неправ.
Схема метода
ЦИКЛ (в одном промпте, ходы чередуются с ответами источника):
ШАГ 1: Записать варианты ответа и стартовые убеждения (поровну) → таблица %
ШАГ 2: Задать источнику ОДИН самодостаточный вопрос → вопрос
ШАГ 3: Получить ответ + оценку согласованности → факты
ШАГ 4: Обновить убеждения по каждому варианту, кратко объяснить почему → новая таблица %
ШАГ 5: Уверенность ≥ порога? Да → финальный ответ. Нет → вернуться к шагу 2
Пример применения
Задача: Владелец сети кофеен в Казани видит, что в октябре выручка упала. Есть три гипотезы: (А) конкурент открылся рядом, (Б) подрос чек на сиропах и сезонных напитках и ушли постоянные клиенты, (В) сломалась программа лояльности в приложении. Агент в Claude Code или Cursor может запрашивать «ненадёжные» источники: отчёты из CRM, разные выгрузки, ответы сотрудников. Они противоречат друг другу.
Промпт:
Ты — аналитик. Нужно выбрать ОДНУ из трёх причин падения выручки сети кофеен «Зерно» в Казани в октябре:
А) рядом с точкой на Баумана открылся конкурент;
Б) постоянные клиенты ушли из-за роста цен на сезонные напитки;
В) сломалась программа лояльности в приложении.
Источники ненадёжны: выгрузки CRM бывают неполными, управляющие противоречат друг другу. Я буду присылать ответы по твоим вопросам.
Правила:
1. До первого вопроса запиши стартовые убеждения по вариантам (в сумме 100%).
2. Первый вопрос — широкий, описательный: «что изменилось в октябре по точкам?». Дальше — точечные вопросы, которые различают гипотезы. Не задавай вопрос «подтверди ещё раз» — вместо этого проверь ту же мысль с другой стороны.
3. После каждого ответа обнови убеждения по А/Б/В и в одной строке объясни, какое свидетельство сдвинуло их. Если два источника противоречат друг другу — скажи об этом прямо и не решай сразу.
4. Ответ давай, только когда одна гипотеза подтверждена как минимум двумя разными по типу источниками. Если нет — задай ещё вопрос.
5. Когда решишь, что хватает, напиши финальный ответ, итоговые убеждения и что бы тебя переубедило.
Результат: Модель сначала выдаст таблицу убеждений, потом задаст широкий вопрос про изменения за месяц. После каждого ответа она покажет обновлённые проценты и короткое обоснование сдвига. Если выгрузки противоречат друг другу, она это отметит и задаст разведочный вопрос с другой стороны. Финалом будет выбор причины с итоговыми убеждениями и условием, что могло бы изменить решение.
Почему это работает
Слабость LLM. Первое правдоподобное свидетельство сильно якорит модель. Дальше она ищет подтверждение и заранее называет уверенность «как просили». Если в промпте «останавливайся при 90%», слабая модель просто пишет 90%, а не оценивает силу доказательств. Если источник в целом согласован, но неправ, повторение вопроса даёт только ложную уверенность.
Сильная сторона. Модель хорошо ведёт структурированную запись: варианты, проценты, причина сдвига. Эта запись видна и самой модели, и вам. Сильные модели используют её, чтобы действительно накапливать доказательства: у них убеждения растут постепенно, а не прыжком после первого ответа.
Как метод обходит слабость. Таблица убеждений превращает «мне кажется, это А» в проверяемую запись. Вы видите, после какого вопроса модель решила и достаточно ли было причин. Если уверенность прыгнула с 33% до 90% после одного ответа, это сигнал.
Рычаги управления: - Порог уверенности. Не ставьте один и тот же фиксированный порог всем моделям: слабая под него просто подстроится. Лучше требовать два разных независимых источника. - Типы вопросов. Первый раунд — «опиши всё, что видишь», потом точечные вопросы, и мало подтверждающих. Подтверждение — это ловушка слабой модели. - Отдельная строка «что бы меня переубедило». Заставляет искать опровергающее, а не подтверждающее. - Источник уверен, но может быть неправ. Для знаниевых вопросов добавьте проверку из внешнего независимого места, а не только повтор того же источника.
Шаблон промпта
Текст BP в статье вынесен в приложение и в оригинале не приведён. Ниже реконструкция по описанию: следить за убеждениями по вариантам и коммититься только при достаточной уверенности. Плюс правила про типы вопросов, которые авторы описывают как признаки сильных рассуждающих.
Ты решаешь задачу с ненадёжными источниками. Задача: {задача}.
Варианты ответа:
{варианты}
Источник: {источник}. Он может ошибаться и отвечать по-разному на один вопрос.
{сигнал_согласованности}
Работай по циклу:
1. Запиши убеждения по каждому варианту в процентах (сумма 100%).
2. Задай источнику ОДИН самодостаточный вопрос.
3. После моего ответа обнови убеждения и в 1–2 строках объясни, какое свидетельство их сдвинуло.
4. Если ответы противоречат друг другу — назови противоречие и проверь другим вопросом.
5. Финальный ответ давай только когда {условие_остановки}.
Правила вопросов:
- Первый вопрос — широкий, описательный.
- Дальше — точечные, которые различают варианты.
- Подтверждающие вопросы («а точно?») используй редко: сначала попробуй другой угол.
Формат каждого шага: [Убеждения: A=.., Б=.., В=..] → [Вопрос] → (после ответа) [Обновление и причина].
Что подставлять: {задача} — суть решения; {варианты} — 2–5 конкретных вариантов; {источник} — что отвечает (выгрузка, сотрудник, другая модель); {сигнал_согласованности} — если есть, как часто источник повторяет ответ; {условие_остановки} — например, «одна гипотеза подтверждена двумя разными по типу источниками».
🚀 Быстрый старт — вставь в чат:
Вот шаблон Belief-State Prompting. Адаптируй под мою задачу: [твоя задача].
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит про варианты ответа, источники и условие остановки. Для метода нужны конкретные варианты, между которыми можно распределять убеждения, и понятный критерий «хватит». Остальное она возьмёт из паттерна шаблона.
Ограничения
⚠️ Слабые модели: BP помогает в основном сильным моделям. У слабых он часто не лучше обычного ReAct: они пишут высокую уверенность по инструкции, а не по доказательствам. Сам по себе промпт «поведение слабой модели» не исправляет.
⚠️ Порог уверенности: фиксированный порог вроде «90%» провоцирует показную уверенность. Слабая модель называет ту цифру, которую вы просили, а ошибочные ответы получают даже более высокую уверенность, чем верные.
⚠️ Знаниевые задачи: сигнал «источник согласован» там иногда вредит. Источник может быть устойчиво и уверенно неправ, и тогда согласованность — ложное подтверждение.
⚠️ Дообучение не спасает: обучение модели на её же удачных траекториях не дало стабильного прироста и местами ухудшило результат. Это не путь для практика, зато подтверждает: навык не копируется по поверхностным образцам.
⚠️ Задачи и данные: эксперименты — на ответах о картинке через текст. Перенос на бизнес-расследования, поддержку или аналитику — ваша экстраполяция. Убеждения, которые модель пишет, — её самоотчёт, а не гарантированное внутреннее состояние. Текст статьи в части анализа типов вопросов у нас обрезан.
Как исследовали
Идея была простой: заменить зрение текстом и проверить, умеют ли LLM рассуждать, когда «глаза» врут. Текстовая модель не видит картинку. Она задаёт вопросы про неё VLM (модели, которая видит изображения), а та отвечает с шумом: ответ каждый раз немного другой. Вместе с ответом модель получает долю повторов — сигнал согласованности.
Исследователи взяли два небольших VLM как «шумные датчики» и пять наборов вопросов: восприятие, графики, знания. Оставили только вопросы, где датчик отвечает верно в одном–пяти случаях из 11. Дополнительно проверили, что человек, не видя картинки, всё-таки может решить задачу. Получилось 1000 задач.
Сравнили восемь LLM и три стратегии: ReAct, UoT (стратегия «выбирай вопросы, которые лучше всего снижают неопределённость») и BP. Люди решали на 70–90%, лучшие модели — на 40–60%. UoT оказалась слабее двух других.
Дальше посмотрели, почему так. Они воспроизвели сотни диалогов и попросили модель после каждого шага выдать вероятность по вариантам. У большой модели вероятность верного ответа росла постепенно (примерно до 0.44–0.57). У маленькой — едва (до ~0.32), но уверенность в финале была выше. Почти половина диалогов маленькой модели уже после первого шага превышала 0.7 уверенности, против 13% у большой. Ошибочные диалоги заканчивались быстрее, чем верные у сильной. Вывод: скорость слабой модели — не признак силы, а признак ранней привязки к первому ответу.
Аблация сигнала согласованности показала: настоящий сигнал помогает на восприятии и диаграммах, а на знаниевом наборе иногда мешает. Людям случайный сигнал вредил сильнее, чем моделям. Модели меньше полагаются на подсказку, чем люди.
Адаптации и экстраполяции
🔧 Техника: заменить порог процентов на правило «два разных источника» → меньше показной уверенности
Вместо «Заканчивай, когда уверенность ≥90%» напишите: «Заканчивай, только когда выбранный вариант подтверждён минимум двумя источниками разного типа (например, выгрузка + сотрудник), и ни один найденный факт не противоречит ему без объяснения». Это переносит остановку с цифры, которую модель нарисует, на проверяемый критерий.
🔧 Техника: потребовать «после каждого ответа напиши, что бы опровергло текущий лидер» → меньше раннего якоря
Добавьте в шаг 3: «Назови один факт, который заставил бы тебя сменить лидирующий вариант, и следующим вопросом проверь именно его». Это идея-вывод из анализа: подтверждающие вопросы — признак слабого рассуждения, опровергающие — сильного. Сама формулировка здесь наша, проверять её надо на своей задаче.
Экстраполяция: проверка слухов и спорных данных в Perplexity или Claude с поиском
Утверждение: «{утверждение}». Источники в поиске противоречат друг другу.
Веди таблицу убеждений: «верно / неверно / неясно» в %.
После каждого найденного источника обнови таблицу и укажи тип источника
(первоисточник, СМИ, пересказ, соцсети). Один и тот же факт из нескольких пересказов считай ОДНИМ свидетельством.
Финал — только когда есть минимум два независимых первоисточника.
Это наша адаптация: идея про «согласованность ≠ правда» применена к дублирующимся источникам. В статье такого эксперимента нет.
Ресурсы
- Название работы: How Well Do LLMs Reason with Noisy Evidence? An Active Visual Reasoning Benchmark (бенчмарк VISUALNOISEQA).
- Авторы: Bach Nguyen, Zhaonan Li, Mau Son Nguyen, Sanika Chavan, Nilay Kumar, Hong Anh Nguyen, Khoa Vo, Ben Zhou — Arizona State University.
- Код и данные обещаны к открытому релизу после публикации.
- Упомянутые методы: ReAct (Yao et al., 2023), Uncertainty of Thoughts (Hu et al., 2024), «слепой» VQA (Li et al., 2025), self-consistency (Wang et al., 2023).
