3,583 papers
arXiv:2609.04539 78 3 сент. 2026 г. FREE

Calibrated Reflection: как заставить LLM честно оценивать свою уверенность на шкалах

КЛЮЧЕВАЯ СУТЬ
Парадокс: LLM говорит «уверен на 95%» одинаково часто — и когда права, и когда ошибается. Цифра уверенности почти не совпадает с реальной точностью. Метод Calibrated Reflection даёт честную оценку уверенности LLM на любой порядковой шкале — риск клиента, качество текста, рейтинг отзыва — вместо числа для галочки. Фишка: модель заставляют оценить вероятность каждого балла шкалы, а не только выбранного — тогда она невольно сравнивает варианты вместо того чтобы защищать первую мысль. Дальше — раунд самокритики и взвешивание по расстоянию между баллами: итоговая уверенность падает сама, если вероятности размазаны по всей шкале.
Адаптировать под запрос

Когда просишь LLM оценить что-то по шкале — риск клиента от 1 до 5, качество текста, тональность отзыва — модель почти всегда говорит "уверен на 90-95%", даже если ошибается. Это не потому что модель врёт, а потому что её просят сразу назвать финальный балл и оценить его же уверенность — она защищает своё первое решение вместо того, чтобы честно взвесить альтернативы.

Причина проста: когда модель видит только один вариант ответа, у неё нет с чем его сравнить. Она не думает "а насколько вероятны соседние баллы?" — она просто укрепляется в первой мысли. Из-за этого разброс уверенности почти не отражает реальную точность: модель одинаково "уверена" и когда права, и когда ошибается.

Calibrated Reflection решает это в три шага: заставляет модель оценить вероятность каждого возможного балла на шкале (не только выбранного), потом для каждого балла пройти цикл "оценка → самокритика → финальная оценка", а в конце — пересчитать итоговую уверенность с учётом того, что ошибка на соседнем балле не так страшна, как ошибка через всю шкалу.

🔬

Схема метода

ШАГ 1 (MCS — Maximum Confidence Selection): 
Для КАЖДОГО балла шкалы модель оценивает вероятность "это правильный балл" → таблица вероятностей по всем меткам

ШАГ 2 (Reflection, встроен в шаг 1 для каждого балла):
Первичная оценка → самокритика/рефлексия → финальная оценка → число вероятности

ШАГ 3 (Distance-aware calibration):
Выбирается балл с максимальной вероятностью → пересчитывается итоговая уверенность:
близкие баллы усиливают уверенность, далёкие — ослабляют (вес = 1/(1+расстояние))

Все три шага — в ОДНОМ промпте, один вызов модели.

🚀

Пример применения

Задача: Модератор Wildberries/Ozon использует ChatGPT для предварительной оценки отзывов покупателей по шкале "полезность отзыва" от 1 до 5 (1 — бесполезен/спам, 5 — максимально полезен для других покупателей). Нужно понимать, каким оценкам можно доверять автоматически, а какие передавать живому модератору.

Промпт:

Ты — эксперт по оценке качества отзывов покупателей.

Шкала полезности отзыва: 
1 — бесполезен (спам, без деталей, эмоции без фактов)
2 — слабо полезен (мало конкретики)
3 — средне полезен (есть детали, но однобоко)
4 — полезен (конкретные факты, плюсы и минусы)
5 — максимально полезен (детально, объективно, помогает решить купить или нет)

Вот отзыв:
«Кроссовки пришли быстро, размер в размер, но подошва после недели носки начала отклеиваться. За свою цену — так себе, для дома норм, для активного использования не советую.»

Для КАЖДОГО балла от 1 до 5 сделай:
1. Первичная оценка: почему этот балл может быть правильным? Короткое рассуждение.
2. Рефлексия: перепроверь себя — не переоцениваешь или недооцениваешь этот балл?
3. Финальная оценка после рефлексии.
4. Вероятность (0–1): насколько вероятно, что именно этот балл правильный.

Выведи таблицу: | Балл | Вероятность |

Затем:
5. Выбери балл с максимальной вероятностью — финальный ответ.
6. Посчитай калиброванную уверенность: для каждого балла i вычисли вес W(i) = 1 / (1 + |i - финальный_балл|), затем калиброванная уверенность = сумма(вероятность_i × W(i)) / сумма(вероятность_i).

Покажи финальный балл и калиброванную уверенность в процентах.

Результат: Модель выдаст таблицу из 5 строк — по строке на каждый балл шкалы, с коротким рассуждением до и после самокритики и вероятностью для каждого. Дальше — выбранный балл и итоговый процент уверенности, который учитывает, что вероятностная масса была сосредоточена на соседних баллах (4 и 5), а не размазана по всей шкале. Если вероятности "размазаны" от 1 до 5 — итоговая уверенность автоматически упадёт, сигнализируя "нужна проверка человеком".


🧠

Почему это работает

LLM плохо оценивает свою уверенность "в лоб" — она не сравнивает варианты, а просто защищает первую пришедшую в голову мысль. Отсюда типичная переоценка: "уверен на 95%", даже когда балл спорный.

Зато LLM хорошо умеет рассуждать структурированно, если её заставить пройти по пунктам явно. Когда модель вынуждена оценить каждый вариант шкалы отдельно — она невольно сравнивает их друг с другом, а не просто утверждает первую догадку.

Рефлексия (самокритика после первой оценки) добавляет второй проход — модель ищет контраргументы своему первому мнению, что снижает переуверенность. А финальный пересчёт с весами по расстоянию — это простой счётчик "средняя ошибка не должна пугать так же, как большая": если модель почти поровну колеблется между 4 и 5 — это нормально и не должно резко снижать доверие к ответу, а если колеблется между 1 и 5 — должно.

Рычаги управления: - Число меток шкалы → чем больше баллов (например 1-10), тем длиннее и дороже промпт — для длинных шкал урезай до ключевых точек шкалы. - Формулу веса 1/(1+расстояние) можно заменить на другую (например, квадрат расстояния), если хочешь сильнее штрафовать дальние ошибки. - Шаг рефлексии можно убрать для простых/неважных оценок — сэкономишь токены, но потеряешь часть точности калибровки.


📋

Шаблон промпта

Ты — эксперт по оценке {объект оценки}.

Шкала: {описание шкалы с расшифровкой каждого балла от {мин} до {макс}}

Материал для оценки:
{текст/контент}

Для КАЖДОГО балла шкалы сделай:
1. Первичная оценка: почему этот балл может быть правильным?
2. Рефлексия: перепроверь рассуждение — нет ли переоценки или недооценки?
3. Финальная оценка после рефлексии.
4. Вероятность (0–1) что этот балл правильный.

Выведи таблицу: | Балл | Вероятность |

Затем:
5. Выбери балл с максимальной вероятностью.
6. Посчитай калиброванную уверенность: для каждого балла i вычисли вес W(i) = 1 / (1 + |i - финальный_балл|), калиброванная уверенность = сумма(вероятность_i × W(i)) / сумма(вероятность_i).

Выведи финальный балл и калиброванную уверенность в процентах.

Подставь: {объект оценки} — что оцениваешь (резюме, отзыв, идея), {описание шкалы} — расшифровка каждого балла, {текст/контент} — сам материал.

🚀 Быстрый старт — вставь в чат:

Вот шаблон метода калиброванной оценки уверенности. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про шкалу оценки (сколько баллов, что означает каждый) и про сам материал для оценки — без этого не построить таблицу вероятностей и не посчитать веса.


⚠️

Ограничения

⚠️ Только для порядковых шкал: метод работает, если у баллов есть естественный порядок (1-5, "низкий-средний-высокий риск"). Для категорий без порядка (кот/собака/машина) весовая формула по расстоянию не имеет смысла.

⚠️ Дорого для длинных шкал: если шкала на 20-100 пунктов, придётся гонять модель по каждому баллу — промпт станет огромным и медленным. Метод удобен для шкал из 3-7 пунктов.

⚠️ Улучшает не ответ, а уверенность в ответе: метод не делает саму оценку точнее — он честнее показывает, насколько ей можно доверять. Если модель системно ошибается в самой логике оценки — калибровка это не исправит.


🔗

Ресурсы

A Calibrated Reflection Approach for Enhancing Confidence Estimation in LLMs — Umesh Bodhwani, Yuan Ling, Shujing Dong, Yarong Feng, Hongfei Li, Ayush Goyal (Amazon.com, Seattle). Датасеты: HelpSteer2, Llama T-REx, проприетарный conversational dataset. Модели: Claude-3-Haiku, Mistral-7B-instruct.


📋 Дайджест исследования

Ключевая суть

Парадокс: LLM говорит «уверен на 95%» одинаково часто — и когда права, и когда ошибается. Цифра уверенности почти не совпадает с реальной точностью. Метод Calibrated Reflection даёт честную оценку уверенности LLM на любой порядковой шкале — риск клиента, качество текста, рейтинг отзыва — вместо числа для галочки. Фишка: модель заставляют оценить вероятность каждого балла шкалы, а не только выбранного — тогда она невольно сравнивает варианты вместо того чтобы защищать первую мысль. Дальше — раунд самокритики и взвешивание по расстоянию между баллами: итоговая уверенность падает сама, если вероятности размазаны по всей шкале.

Принцип работы

Не спрашивай модель «на сколько ты уверена в своём ответе» — спроси «оцени вероятность каждого варианта». Модель ведёт себя как студент на экзамене, который защищает первый ответ, если его не заставить сравнить с другими билетами. Три шага в одном промпте: оценка всех баллов → самокритика по каждому → пересчёт уверенности с весом 1/(1+расстояние). Ошибка на соседнем балле не должна пугать так же, как ошибка через всю шкалу.

Почему работает

LLM оценивает уверенность «в лоб» — это защита первой мысли, а не сравнение альтернатив. Один вариант ответа = нечего сравнивать = ложные 90-95% почти всегда. Когда модель расписывает вероятность для каждого балла шкалы, она сама создаёт себе конкурентов для сравнения. Рефлексия добавляет второй проход — модель ищет контраргументы себе, и переуверенность спадает. Формула веса 1/(1+расстояние) работает как простой здравый смысл: колебание между соседними баллами (4 и 5) — это нормально, а разброс от 1 до 5 — сигнал «не доверяй, зови человека».

Когда применять

Оценка по шкале с явным порядком → риск клиента, качество отзыва, рейтинг диалога, приоритет тикета — особенно когда нужно понять, каким оценкам доверять автоматически, а какие отправлять живому проверяющему. Не подходит для категорий без порядка (кот/собака/машина) и для шкал с 20+ градациями — промпт станет неподъёмным по длине.

Мини-рецепт

1. Расшифруй шкалу: распиши что значит каждый балл — не «1-5», а «1 — спам без деталей, 5 — детально и объективно»
2. Прогони через все варианты: для каждого балла — рассуждение, потом самокритика, потом число вероятности
3. Собери таблицу: балл | вероятность — сразу видно, размазано или сосредоточено
4. Посчитай вес: W(i) = 1/(1+расстояние от финального балла) — рядом усиливает уверенность, далеко ослабляет
5. Поставь порог: если калиброванная уверенность ниже 70% — отправляй результат на проверку человеку

Примеры

[ПЛОХО] : Оцени отзыв по шкале полезности от 1 до 5 и укажи насколько ты уверен в процентах
[ХОРОШО] : Для каждого балла от 1 до 5 сделай: 1) почему этот балл может быть правильным, 2) рефлексия — не переоцениваю ли я, 3) финальная вероятность. Выведи таблицу, выбери максимум, посчитай калиброванную уверенность с весом 1/(1+расстояние от финального балла)
Источник: A Calibrated Reflection Approach for Enhancing Confidence Estimation in LLMs
ArXiv ID: 2609.04539 | Сгенерировано: 2026-09-07 04:36

Проблемы LLM

ПроблемаСутьКак обойти
Модель переоценивает уверенность, видя только один вариант ответаПросишь оценить балл по шкале и сразу уверенность в нём. Модель защищает свою первую догадку, а не сравнивает её с соседними вариантами. Итог — почти всегда "уверен на 90-95%", даже если оценка спорная. Проблема касается любой оценки по шкале: риск, качество, рейтинг, тональностьПопроси модель оценить вероятность КАЖДОГО варианта шкалы отдельно, а не только выбранного. Это заставляет её сравнивать варианты между собой, а не утверждать первую мысль

Методы

МетодСуть
Оценка всех вариантов шкалы + самокритика — честная уверенностьДля каждого балла шкалы модель проходит цикл: первичная оценка самокритика финальная оценка вероятность (0-1). Затем выбирается балл с максимальной вероятностью, а итоговая уверенность пересчитывается с учётом расстояния до остальных вероятных баллов: близкие варианты усиливают итоговую уверенность, далёкие — ослабляют (вес = 1/(1+расстояние)). Всё делается в одном промпте, один вызов модели. Почему работает: сравнение вариантов не даёт модели просто закрепить первую догадку; самокритика заставляет искать контраргументы своему первому мнению; взвешивание по расстоянию отражает, что колебание между соседними баллами не так критично, как между дальними. Когда да: оценка по порядковой шкале из 3-7 пунктов (риск, качество, рейтинг), где важно понимать надёжность ответа. Когда нет: категории без порядка (кот/собака/машина); очень длинные шкалы (20+ пунктов) — промпт становится слишком большим и дорогим

Тезисы

ТезисКомментарий
Сравнение альтернатив снижает переуверенность моделиКогда модель видит только один вариант ответа, у неё нет опоры для сомнения — она укрепляется в первой мысли и завышает уверенность. Когда её заставляют оценить вероятность каждого альтернативного варианта, она невольно сравнивает их между собой, и итоговая уверенность становится честнее. Применяй: в любой оценочной задаче проси модель оценить не только выбранный вариант, а все возможные — так виднее реальные колебания и слабые места ответа
📖 Простыми словами

A Calibrated Reflection Approach for Enhancing Confidence Estimation inLLMs

arXiv: 2609.04539

LLM патологически самоуверены: когда ты спрашиваешь у сетки «насколько ты уверена?», она почти всегда выдаёт 95–99% уверенности, даже если только что сморозила глупость. Фундаментальная проблема в том, что модель не взвешивает вероятности задним числом, а тупо защищает первую сгенерированную мысль. Чтобы вытащить из неё реальную оценку надёжности, нужен метод калиброванной рефлексии (Calibrated Reflection), который заставляет нейросеть критически перепроверять собственный ответ.

Это как наглый студент на экзамене: ляпнул наугад первое попавшееся слово и с пеной у рта доказывает, что он абсолютно прав. Если спросить его в лоб: «Точно уверен?», он только сильнее упрётся рогом. Но если заставить его разобрать альтернативные варианты и по пунктам найти слабые места в своём ответе, спесь мгновенно слетает, и оценка становится на удивление адекватной.

Вместо наивной веры первому ответу метод запускает контролируемый самоанализ: модель сначала выдаёт гипотезу, затем целенаправленно ищет контраргументы, сравнивает свой вариант с альтернативами и только после этого оценивает вероятность ошибки. Такой рефлексивный аудит на корню срезает слепую переоценку и даёт математически выверенный скор уверенности вместо взятых с потолка процентов.

Принцип универсален, но ярче всего раскрывается в рутине вроде модерации отзывов на Wildberries или Ozon. Нейросеть оценивает полезность текста от 1 до 5, а калибровка точно определяет развилку: если модель уверена на 100% по фактам, решение принимается на автомате; если полезность спорная — тикет молча улетает живому модератору. Это работает везде: от скоринга клиентских лидов до триажа тикетов техподдержки.

Главный вывод: никогда не верь LLM на слово, когда она заявляет, что «всё сделано идеально». Внедряй калиброванную рефлексию, чтобы отделять железные факты от опасных галлюцинаций. Либо ты заставляешь модель аргументированно сомневаться в себе, либо твои живые сотрудники будут разгребать последствия её ложной самоуверенности.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с