TL;DR
Если попросить модель оценить свою уверенность в ответе (в процентах), окажется, что самая точная модель — не самая честная в этой оценке. Модели умеют давать правильные ответы, но плохо умеют говорить, когда они на самом деле не уверены.
Главная боль: слабые модели (дешёвые версии типа mini, nano, flash-lite) либо говорят "уверен на 100%", либо сразу сваливаются на "не знаю" (25%) — и почти никогда не дают промежуточную честную оценку. При этом на вопросах, где ответ реально невозможно узнать (например, "какого цвета был киоск на углу улицы в Мадриде в такой-то день"), топовые модели наоборот недооценивают свою уверенность — говорят "не знаю", хотя угадывают правильно намного чаще, чем случайность.
Исследователи просто просили модель вместе с ответом указать процент уверенности и сравнивали этот процент с реальной правильностью ответа через три независимых прогона. Оказалось, что дорогие/топовые модели (Claude Opus, Gemini Pro) дают "честную" градацию уверенности — чем выше процент, тем чаще ответ верный. А бюджетные версии этой градации почти не показывают: у них confidence практически не связан с тем, правы они или нет.
Схема метода
ШАГ 1: Задать вопрос модели с требованием ответить в строгом формате:
{"answer": "A/B/C/D", "probability": число от 0 до 100}
(один запрос, без дополнительных шагов)
ШАГ 2: Сравнить процент уверенности с фактической правильностью
— доверяй ответу, если модель даёт спред уверенности
(не только 25% или 100%)
— не доверяй, если модель почти всегда говорит либо низкое,
либо максимальное число
Пример применения
Задача: Копирайтер готовит статью с фактами (даты, цифры, названия) и хочет понять, каким фактам от ChatGPT можно доверять без перепроверки, а какие лучше проверить в Google.
Промпт:
Ответь на вопрос и укажи процент уверенности в правильности своего ответа (0-100, где 100 = абсолютно уверен).
Вопрос: В каком году была основана компания [название]?
Ответь в формате:
Ответ: [твой ответ]
Уверенность: [число]%
Результат: Модель даст ответ и число. Если число близко к 50-70% — это сигнал "лучше проверь". Если число 95-100% — риск ошибки ниже (у топовых моделей высокая заявленная уверенность реально коррелирует с правильностью). Но если вы используете дешёвую/быструю модель (мини-версию), к её "100% уверен" стоит относиться скептически — исследование показывает, что у таких моделей высокая уверенность и правильность слабо связаны.
Почему это работает
LLM обучены звучать уверенно — это часть их "голоса" по умолчанию, независимо от того, знают ли они правильный ответ. Прямая просьба назвать число заставляет модель остановиться и присвоить конкретную цифру, а не просто уверенно сформулировать фразу.
Сильная сторона LLM здесь — способность точно выполнять формат вывода (JSON, число). Это единственное, что использует метод: не заглядывать во "внутренности" модели (недоступны через API), а получить сигнал через текстовый вывод.
Рычаг управления: масштаб и уровень рассуждений модели напрямую влияют на честность этой оценки. В исследовании более "думающие" версии моделей (высокий reasoning effort в GPT-5) давали более честную калибровку, чем быстрые версии той же линейки. Если в чате есть переключатель "глубокого мышления" — включайте его для задач, где важна не только точность, но и честная оценка риска ошибки.
Шаблон промпта
{вопрос}
Ответь в формате:
Ответ: [твой ответ]
Уверенность: [число от 0 до 100, где 100 — абсолютно уверен, 25 — чистое гадание среди 4 вариантов]
Подставь свой {вопрос} — работает лучше для вопросов с конкретным фактическим ответом (даты, цифры, факты), а не для творческих или открытых задач.
🚀 Быстрый старт — вставь в чат:
Вот шаблон запроса уверенности у LLM. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какой у вас тип вопроса (факт, дата, вычисление) — потому что метод работает надёжно только на вопросах с проверяемым ответом, а не на творческих запросах.
Ограничения
⚠️ Не гарантия честности: заявленный процент — это текст, который модель генерирует по инструкции, а не прямой доступ к её "внутреннему" состоянию. Он может отражать паттерн следования инструкциям, а не реальную неуверенность.
⚠️ Работает только на вопросах с чётким ответом: метод проверен на фактических вопросах с вариантами A-D (математика, факты, пространственные задачи). Для творческих или открытых задач ("напиши текст", "оцени идею") такая калибровка не проверялась и, скорее всего, не работает так же.
⚠️ Бюджетные модели дают ложную уверенность: дешёвые/быстрые версии моделей (мини, nano, flash-lite) резко хуже калиброваны — их высокая заявленная уверенность слабо связана с правильностью. Для важных решений не полагайтесь на процент уверенности от лёгких версий моделей.
Как исследовали
Команда собрала 200 вопросов вручную (без помощи LLM, чтобы исключить утечку в обучающие данные) в четырёх категориях: пространственные задачи, точная математика, "вспомни точное слово из книги" и заведомо неизвестные факты (типа цвета киоска в конкретный день). 15 топовых моделей прогнали через эти вопросы трижды, прося каждый раз указать ответ и процент уверенности, и сравнили с реальным человеком-тестировщиком.
Главный неожиданный результат: самая точная модель (Gemini 3.1 Pro, 82,7% правильных ответов) — не самая честная в оценке своей уверенности. Лучшую калибровку показал Claude Opus 4.6, а два топовых модели даже обошли человека по честности оценки. При этом свежая модель Gemini 3.1 Flash-Lite оказалась худшей по калибровке во всём исследовании — хуже, чем предыдущее поколение той же линейки. Это говорит о том, что "новее" не значит "честнее" в самооценке — release date не гарантия.
Отдельно любопытно: на вопросах с заведомо неизвестным ответом сильные модели говорили "не уверен" (25%), даже когда угадывали правильно намного чаще случайности — то есть чрезмерная скромность там, где могли бы быть увереннее.
