3,583 papers
arXiv:2607.20526 74 10 июля 2026 г. FREE

ConfidenceBench: почему уверенный ответ LLM не значит правильный ответ

КЛЮЧЕВАЯ СУТЬ
Парадокс: топовая модель угадывает правильно даже вопросы уровня «какого цвета был киоск на углу улицы в Мадриде» — но сама говорит «не уверена». А бюджетная mini-версия лажает в половине случаев — и клянётся, что права на 100%. Метод ConfidenceBench позволяет понять, каким ответам LLM можно доверять без перепроверки — модель просто указывает процент уверенности рядом с ответом. Фишка — не лезть во внутренности модели (это невозможно через API), а получить сигнал через обычный текстовый вывод: JSON с полями answer и probability. Топовые модели (Claude Opus, Gemini Pro) дают честную оценку — чем выше процент, тем чаще ответ верный, а бюджетные (мини, нано, flash-lite) почти всегда выдают либо 25% — чистое гадание, либо 100% — железно уверен, без промежуточных значений.
Адаптировать под запрос

TL;DR

Если попросить модель оценить свою уверенность в ответе (в процентах), окажется, что самая точная модель — не самая честная в этой оценке. Модели умеют давать правильные ответы, но плохо умеют говорить, когда они на самом деле не уверены.

Главная боль: слабые модели (дешёвые версии типа mini, nano, flash-lite) либо говорят "уверен на 100%", либо сразу сваливаются на "не знаю" (25%) — и почти никогда не дают промежуточную честную оценку. При этом на вопросах, где ответ реально невозможно узнать (например, "какого цвета был киоск на углу улицы в Мадриде в такой-то день"), топовые модели наоборот недооценивают свою уверенность — говорят "не знаю", хотя угадывают правильно намного чаще, чем случайность.

Исследователи просто просили модель вместе с ответом указать процент уверенности и сравнивали этот процент с реальной правильностью ответа через три независимых прогона. Оказалось, что дорогие/топовые модели (Claude Opus, Gemini Pro) дают "честную" градацию уверенности — чем выше процент, тем чаще ответ верный. А бюджетные версии этой градации почти не показывают: у них confidence практически не связан с тем, правы они или нет.


🔬

Схема метода

ШАГ 1: Задать вопрос модели с требованием ответить в строгом формате:
        {"answer": "A/B/C/D", "probability": число от 0 до 100}
        (один запрос, без дополнительных шагов)

ШАГ 2: Сравнить процент уверенности с фактической правильностью
        — доверяй ответу, если модель даёт спред уверенности
          (не только 25% или 100%)
        — не доверяй, если модель почти всегда говорит либо низкое,
          либо максимальное число

🚀

Пример применения

Задача: Копирайтер готовит статью с фактами (даты, цифры, названия) и хочет понять, каким фактам от ChatGPT можно доверять без перепроверки, а какие лучше проверить в Google.

Промпт:

Ответь на вопрос и укажи процент уверенности в правильности своего ответа (0-100, где 100 = абсолютно уверен).

Вопрос: В каком году была основана компания [название]?

Ответь в формате:
Ответ: [твой ответ]
Уверенность: [число]%

Результат: Модель даст ответ и число. Если число близко к 50-70% — это сигнал "лучше проверь". Если число 95-100% — риск ошибки ниже (у топовых моделей высокая заявленная уверенность реально коррелирует с правильностью). Но если вы используете дешёвую/быструю модель (мини-версию), к её "100% уверен" стоит относиться скептически — исследование показывает, что у таких моделей высокая уверенность и правильность слабо связаны.


🧠

Почему это работает

LLM обучены звучать уверенно — это часть их "голоса" по умолчанию, независимо от того, знают ли они правильный ответ. Прямая просьба назвать число заставляет модель остановиться и присвоить конкретную цифру, а не просто уверенно сформулировать фразу.

Сильная сторона LLM здесь — способность точно выполнять формат вывода (JSON, число). Это единственное, что использует метод: не заглядывать во "внутренности" модели (недоступны через API), а получить сигнал через текстовый вывод.

Рычаг управления: масштаб и уровень рассуждений модели напрямую влияют на честность этой оценки. В исследовании более "думающие" версии моделей (высокий reasoning effort в GPT-5) давали более честную калибровку, чем быстрые версии той же линейки. Если в чате есть переключатель "глубокого мышления" — включайте его для задач, где важна не только точность, но и честная оценка риска ошибки.


📋

Шаблон промпта

{вопрос}

Ответь в формате:
Ответ: [твой ответ]
Уверенность: [число от 0 до 100, где 100 — абсолютно уверен, 25 — чистое гадание среди 4 вариантов]

Подставь свой {вопрос} — работает лучше для вопросов с конкретным фактическим ответом (даты, цифры, факты), а не для творческих или открытых задач.

🚀 Быстрый старт — вставь в чат:

Вот шаблон запроса уверенности у LLM. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой у вас тип вопроса (факт, дата, вычисление) — потому что метод работает надёжно только на вопросах с проверяемым ответом, а не на творческих запросах.


⚠️

Ограничения

⚠️ Не гарантия честности: заявленный процент — это текст, который модель генерирует по инструкции, а не прямой доступ к её "внутреннему" состоянию. Он может отражать паттерн следования инструкциям, а не реальную неуверенность.

⚠️ Работает только на вопросах с чётким ответом: метод проверен на фактических вопросах с вариантами A-D (математика, факты, пространственные задачи). Для творческих или открытых задач ("напиши текст", "оцени идею") такая калибровка не проверялась и, скорее всего, не работает так же.

⚠️ Бюджетные модели дают ложную уверенность: дешёвые/быстрые версии моделей (мини, nano, flash-lite) резко хуже калиброваны — их высокая заявленная уверенность слабо связана с правильностью. Для важных решений не полагайтесь на процент уверенности от лёгких версий моделей.


🔍

Как исследовали

Команда собрала 200 вопросов вручную (без помощи LLM, чтобы исключить утечку в обучающие данные) в четырёх категориях: пространственные задачи, точная математика, "вспомни точное слово из книги" и заведомо неизвестные факты (типа цвета киоска в конкретный день). 15 топовых моделей прогнали через эти вопросы трижды, прося каждый раз указать ответ и процент уверенности, и сравнили с реальным человеком-тестировщиком.

Главный неожиданный результат: самая точная модель (Gemini 3.1 Pro, 82,7% правильных ответов) — не самая честная в оценке своей уверенности. Лучшую калибровку показал Claude Opus 4.6, а два топовых модели даже обошли человека по честности оценки. При этом свежая модель Gemini 3.1 Flash-Lite оказалась худшей по калибровке во всём исследовании — хуже, чем предыдущее поколение той же линейки. Это говорит о том, что "новее" не значит "честнее" в самооценке — release date не гарантия.

Отдельно любопытно: на вопросах с заведомо неизвестным ответом сильные модели говорили "не уверен" (25%), даже когда угадывали правильно намного чаще случайности — то есть чрезмерная скромность там, где могли бы быть увереннее.


📋 Дайджест исследования

Ключевая суть

Парадокс: топовая модель угадывает правильно даже вопросы уровня «какого цвета был киоск на углу улицы в Мадриде» — но сама говорит «не уверена». А бюджетная mini-версия лажает в половине случаев — и клянётся, что права на 100%. Метод ConfidenceBench позволяет понять, каким ответам LLM можно доверять без перепроверки — модель просто указывает процент уверенности рядом с ответом. Фишка — не лезть во внутренности модели (это невозможно через API), а получить сигнал через обычный текстовый вывод: JSON с полями answer и probability. Топовые модели (Claude Opus, Gemini Pro) дают честную оценку — чем выше процент, тем чаще ответ верный, а бюджетные (мини, нано, flash-lite) почти всегда выдают либо 25% — чистое гадание, либо 100% — железно уверен, без промежуточных значений.

Принцип работы

Правило простое: один запрос, строгий формат {answer, probability}. Никакого дожимания модели до «подумай ещё» — просто просишь число от 0 до 100. Смотри не на сам процент, а на разброс чисел по разным вопросам — если модель выдаёт только 25 или 100 и ничего между, она не различает где права, а где угадывает.

Почему работает

LLM обучены звучать уверенно по умолчанию — это часть их «голоса», даже когда они реально не знают ответ. Прямая просьба назвать конкретное число заставляет модель остановиться и присвоить цифру, а не просто уверенно сформулировать фразу. Ключевой рычаг — глубина рассуждений: у GPT-5 с высоким уровнем размышлений число честнее совпадает с реальной правильностью, чем у быстрых версий той же модели. Дешёвые версии экономят на размышлении — и вместе с этим теряют способность отличить, где они действительно правы, а где просто угадали.

Когда применять

Работа с фактами → проверка дат, цифр, названий компаний от LLM, особенно когда нужно быстро решить, что перепроверить в Google, а что взять на веру. Не подходит для творческих задач — оценка идей, текстов, открытых вопросов такой проверкой не тестировалась.

Мини-рецепт

1. Задай вопрос в жёстком формате: ответ + число уверенности от 0 до 100.
2. Прогони несколько разных вопросов — смотри на разброс чисел, а не на одно значение.
3. Если модель почти всегда говорит 25% или 100% — не доверяй её проценту, ответ перепроверяй отдельно.
4. Для важных фактов включи режим глубоких размышлений (если есть переключатель) — число будет честнее.

Примеры

[ПЛОХО] : Ты уверен в этом ответе?
[ХОРОШО] : Ответь на вопрос и укажи процент уверенности (0-100, где 100 = абсолютно уверен). Вопрос: В каком году основана компания Tesla? Формат ответа: Ответ: [ответ] Уверенность: [число]%
Источник: ConfidenceBench: Evaluating Confidence Calibration in Large Language Models
ArXiv ID: 2607.20526 | Сгенерировано: 2026-07-24 04:27

Проблемы LLM

ПроблемаСутьКак обойти
Уверенный тон не значит правильный ответМодель по умолчанию звучит уверенно в любом ответе. Не важно, знает она правду или гадает. По тону текста нельзя понять, стоит ли доверять фактуПроси явно указать процент уверенности числом (0-100), отдельно от самого ответа. Число заставляет модель остановиться и дать конкретную оценку, а не просто уверенную формулировку
Слабые модели не различают уверенность градациейДешёвые и быстрые версии моделей почти никогда не дают промежуточные числа уверенности. Говорят либо "100%", либо резко падают до уровня случайного угадывания. Число от такой модели бесполезно — оно не отличает надёжный ответ от догадкиНе доверяй проценту уверенности от лёгких версий моделей (мини, nano, flash-lite). Для важных решений используй топовую или "думающую" версию модели

Методы

МетодСуть
Запрос числовой уверенности в строгом форматеПроси модель вместе с ответом указать число от 0 до 100 — насколько она уверена в правильности. Ответ: [X] Уверенность: [число]%. Почему работает: явное требование числа заставляет модель присвоить конкретную оценку, а не выдать привычную уверенную фразу. Использует сильную сторону LLM — точное следование формату вывода. Работает: вопросы с проверяемым фактическим ответом (даты, цифры, факты, математика). Не работает: творческие и открытые задачи без единственно верного ответа

Тезисы

ТезисКомментарий
Более "думающие" версии модели честнее оценивают свою уверенностьКогда модель тратит больше ресурсов на рассуждения перед ответом, её заявленная уверенность точнее совпадает с реальной правильностью. Быстрые версии той же модели дают число уверенности, слабо связанное с точностью. Механизм: глубокое рассуждение даёт модели шанс "проверить себя", а не выдать первую уверенную фразу. Применяй: если в чате есть переключатель глубины мышления — включай его для задач, где важна не только точность, но и честная оценка риска ошибки
📖 Простыми словами

ConfidenceBench: Evaluating Confidence Calibration inLargeLanguageModels

arXiv: 2607.20526

Проблема в том, что современные нейронки — это патологические лжецы, которые сами верят в свою ложь. Когда ты спрашиваешь ChatGPT о чем-то, он не лезет в базу знаний, а просто предсказывает следующее слово, стараясь звучать максимально убедительно. Исследование ConfidenceBench доказывает: у моделей напрочь отсутствует калибровка уверенности. Это значит, что ИИ может выдать полную чушь с тем же лицом и тем же уровнем пафоса, с которым он цитирует таблицу умножения. Модель может быть чертовски умной, но она абсолютно не понимает границ своего незнания.

Это как нанять на работу стажера, который на любой вопрос отвечает: "Сделаю в лучшем виде, босс!". Ты даешь ему составить годовой отчет или починить кран — он кивает с одинаковой голливудской улыбкой. В итоге отчет сдан, но цифры там с потолка, а кран течет, хотя стажер искренне считает себя гением. ConfidenceBench — это как раз тест на адекватность такого сотрудника: умеет ли он вовремя сказать "я не знаю", или будет уверенно топить компанию своим оптимизмом.

Авторы проверили кучу моделей и выяснили, что прямая оценка уверенности (когда ты просишь ИИ написать вероятность ответа в процентах) работает из рук вон плохо. Даже топовые модели часто лажают: они могут дать верный ответ, но оценить его в 40%, или выдать бред, будучи уверенными на все 95%. Самое смешное, что самые мощные модели — не всегда самые честные. Они настолько привыкли давать правильные ответы на обучении, что их "датчик сомнения" просто атрофировался. Если модель часто права, она начинает думать, что права всегда.

Этот принцип критически важен везде, где цена ошибки выше нуля. Если ты используешь ИИ для написания кода, медицинских советов или юридических справок, помни: уверенный тон модели — это галлюцинация. Исследование показывает, что нельзя слепо доверять числу, которое выдает нейронка в графе "уверенность". Пока что GEO и другие методы проверки фактов работают лучше, чем самоанализ машины. Принцип универсален: чем сложнее задача, тем сильнее модель склонна выдавать желаемое за действительное, просто чтобы не расстраивать пользователя.

Короче: если ChatGPT клянется, что информация верна на 100% — это повод проверить её дважды. ConfidenceBench подтверждает, что мы пока не научили ИИ сомневаться в себе так, как это делает нормальный человек. Пока разработчики не починят калибровку, единственный способ не сесть в лужу — это внешняя проверка фактов. Не ведись на уверенный голос, всегда держи под рукой Google и помни: красиво сказано — не значит правда.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с