3,583 papers
arXiv:2607.22034 71 24 июля 2026 г. FREE

Заявленная уверенность VLM: почему модель говорит «уверен на 90%» даже когда полностью ошибается

КЛЮЧЕВАЯ СУТЬ
Модель говорит «уверен на 90%» и на чётком фото, и на кромешной темноте — где угадывает хуже монетки. Исследование на 3800 ответах двух моделей показывает: это не самоанализ. Это заученная фраза, которая почти не двигается — независимо от того, права модель или нет. Зато внутри, в вероятностях, с которыми модель выбирает слова ответа, прячется куда более честный сигнал об ошибке. Фишка: раз словам об уверенности верить нельзя, спрашивай не «насколько ты уверен», а «что не так с качеством фото» — это переключает модель с пустого шаблона на проверяемый факт.
Адаптировать под запрос

TL;DR

Когда просишь модель оценить фото и сказать, насколько она уверена в ответе, она почти всегда называет одно и то же число — около 90%. Это не результат самоанализа, а заученный шаблон ответа: число практически не меняется независимо от того, правильно модель угадала или нет. При этом внутри самой модели, в вероятностях, с которыми она генерирует слова ответа, есть куда более точный сигнал о собственной ошибке — но этот сигнал недоступен через обычный текстовый ответ.

Представь: загружаешь тёмное нечёткое фото документа в чат и спрашиваешь «что здесь написано, насколько ты уверен». Модель может ответить «уверенность 90%» на чётком фото и то же самое «90%» на кромешной темноте, где угадывает хуже монетки. Число уверенности от модели не связано с реальным качеством её ответа — оно застряло на одном значении.

Исследователи проверили это на 3800 ответах двух маленьких моделей под шестью видами испорченных фото (размытость, темнота, блики, сжатие) и обнаружили: словесная уверенность — почти константа и ничего не предсказывает, а технический сигнал (вероятность сгенерированных токенов) почти безошибочно отличает верные ответы от неверных. Кроме одного случая — сильной темноты, где оба сигнала одинаково слепы, а точность модели рушится до уровня случайного угадывания.


📌

Схема исследования

ШАГ 1: Модель смотрит на фото → отвечает на вопрос + называет число уверенности (0–100%) → «заявленная уверенность»
ШАГ 2: Замеряется вероятность токенов, которые модель реально сгенерировала в ответе → «внутренняя уверенность» (нужен API с доступом к logprobs)
ШАГ 3: Сравнение двух сигналов — какой точнее предсказывает, ошиблась модель или нет

🚀

Пример применения

Задача: Ты фотографируешь этикетку товара на складе при плохом освещении, фото получилось размытым и тёмным. Загружаешь в Claude или ChatGPT с вопросом «что это и насколько ты уверен».

Промпт:

Вот фото товара [вставить фото]. Определи, что это.
Не называй проценты уверенности — вместо этого честно опиши качество самого фото: 
достаточно ли оно четкое, светлое, видны ли детали текста. 
Если фото плохого качества — прямо скажи, что нужно переснять, а не угадывай.

Результат: Если бы ты спросил напрямую «на сколько процентов ты уверен», модель скорее всего назвала бы стабильное число вроде 85-95% — независимо от того, насколько плохое фото. Вместо этого промпт заставляет модель оценивать объективное качество входных данных, а не своё субъективное самоощущение — это надёжнее, потому что не зависит от заученного шаблона ответа.


🧠

Почему это работает

Заявленная уверенность — это выученная манера речи, а не результат реального самоанализа. Модель училась на текстах, где после ответа принято ставить «уверенность: высокая», и воспроизводит эту привычку почти механически, независимо от контекста.

При этом сама механика генерации текста устроена иначе: каждое слово модель выбирает с какой-то вероятностью, и эта вероятность действительно чувствительна к тому, «путается» модель или отвечает уверенно. Но пользователь эту вероятность не видит — она скрыта в технических данных, доступных только через API.

Раз словам о собственной уверенности верить нельзя, разумно сместить вопрос: не «как ты уверен», а «что не так с входными данными». Оценка качества фото — это внешний, проверяемый факт, а не внутреннее ощущение модели, поэтому такой вопрос работает надёжнее.

Рычаги: - Спрашивай про качество данных (чёткость, свет, читаемость), а не про уверенность модели в ответе. - Задай один и тот же вопрос несколько раз разными словами — если ответы расходятся, это более честный сигнал проблемы, чем стабильное число «90%». - На важных задачах (документы, медицинские снимки, финансовые данные) — всегда добавляй запрос на самопроверку качества исходника до того, как просить содержательный ответ.


📋

Шаблон промпта

Вот {фото/скан документа}.
1. Определи, что на нём изображено или что написано.
2. Не называй процент уверенности — вместо этого оцени качество самого изображения: 
   четкость, освещение, есть ли размытость, блики или обрезанные детали.
3. Если качество плохое — прямо скажи, что нужно переснять или уточнить, 
   а не давай приблизительный ответ.

{фото/скан документа} — подставь конкретный объект: этикетка, чек, скан паспорта, фото товара, рукописный текст.


⚠️

Ограничения

⚠️ Работает только для плохих изображений: на чётких фото разница между «словами» и «внутренним» сигналом почти не проявляется — проблема видна именно при деградации: темноте, размытости, шуме.

⚠️ Технический сигнал недоступен в обычном чате: «внутренняя уверенность» (вероятность токенов) видна только через API с доступом к logprobs — обычный пользователь ChatGPT/Claude в браузере её не получит. Практический вывод (не спрашивай про проценты, спрашивай про качество фото) — доступен, сам технический сигнал — нет.

⚠️ При экстремально плохом свете оба сигнала слепы: ни слова модели, ни технические вероятности не предупреждают о резком падении точности. Единственная защита — проверять качество фото до отправки в модель, а не доверять любому её ответу после.

⚠️ Проверено только на маленьких моделях (~2 млрд параметров) и одной задаче (распознавание еды по фото). Неизвестно, сохраняется ли эффект на крупных моделях вроде GPT-4V или Claude с изображениями.


🔍

Как исследовали

Исследователи взяли две маленькие открытые модели — Qwen2-VL и SmolVLM (по ~2 млрд параметров, такие ставят на слабое железо) — и прогнали через них 100 фото еды, испорченных шестью способами: сжатие, размытие, темнота, блики, поворот, пересжатие, каждое на трёх уровнях серьёзности. На каждом фото модель выбирала правильный вариант из четырёх и называла число уверенности. Параллельно замеряли реальную вероятность токенов ответа — техническую метрику, доступную только потому, что модели открытые (у закрытых API типа GPT-4V такого доступа нет).

Результат удивил своей резкостью: словесная уверенность у Qwen2-VL держалась в узком диапазоне 87–90% почти всегда — даже когда точность падала до уровня случайного угадывания при сильной темноте. А вот технический сигнал точно разделял правильные и неправильные ответы почти везде — кроме этого же случая экстремальной темноты, где оба сигнала одинаково перестали работать. Попытка «подкрутить» словесную уверенность стандартным математическим трюком (температурной калибровкой) помогла в лёгких случаях, но усугубила ситуацию в тяжёлых — потому что нельзя откалибровать сигнал, если в нём изначально нет информации о реальном качестве ответа.


📋 Дайджест исследования

Ключевая суть

Модель говорит «уверен на 90%» и на чётком фото, и на кромешной темноте — где угадывает хуже монетки. Исследование на 3800 ответах двух моделей показывает: это не самоанализ. Это заученная фраза, которая почти не двигается — независимо от того, права модель или нет. Зато внутри, в вероятностях, с которыми модель выбирает слова ответа, прячется куда более честный сигнал об ошибке. Фишка: раз словам об уверенности верить нельзя, спрашивай не «насколько ты уверен», а «что не так с качеством фото» — это переключает модель с пустого шаблона на проверяемый факт.

Принцип работы

Два сигнала — две разные истории. Заявленная уверенность — число, которое модель произносит вслух. Оно почти всегда 85-95%, вне зависимости от реальности. Внутренняя уверенность — вероятность токенов при генерации ответа — падает именно там, где модель путается. Модель как студент, который на любой вопрос бодро отвечает «уверен процентов на 90». Но рука у него дрожит, когда он не знает ответа. Дрожь руки — вероятность токена — выдаёт правду, слова врут.

Почему работает

Заявленная уверенность — выученная манера речи из текстов, где после ответа принято писать «уверенность: высокая». Модель воспроизводит этот шаблон механически, а не проверяет себя заново каждый раз. Вероятность токена — другое дело. Она напрямую завязана на то, сколько вариантов слов модель перебирала перед выбором. Когда модель путается, вероятность токена реально падает — а число в тексте ответа даже не шевелится. Есть исключение: в кромешной темноте падает и точность, и оба сигнала сразу — модель слепа полностью, даже внутри себя.

Когда применять

Работает для фото плохого качества → распознавание документов, чеков, этикеток, сканов при слабом свете или размытости, особенно когда решаешь — доверять ответу модели или переснимать. НЕ подходит как замена реальной проверки при экстремально плохом освещении — там ни слова модели, ни технический сигнал не предупредят о провале точности.

Мини-рецепт

1. Забудь про проценты: не спрашивай модель «на сколько ты уверен» — этот вопрос почти всегда даст 85-95%, независимо от правды.
2. Спроси про фото, а не про ответ: попроси оценить чёткость, свет, размытость, блики — это проверяемый факт, а не самоощущение модели.
3. Продублируй вопрос: задай его 2-3 раза разными словами. Если ответы расходятся — вот честный сигнал проблемы, а не стабильное «90%».
4. На важных задачах (документы, медицинские снимки, финансовые данные): сначала сам проверь качество фото на глаз, до того как отправлять модели.

Примеры

[ПЛОХО] : Вот фото чека, что здесь написано? На сколько процентов ты уверен?
[ХОРОШО] : Вот фото чека. Определи текст. Не называй процент уверенности — вместо этого оцени качество самого фото: четкость, освещение, размытость, блики. Если качество плохое — скажи, что нужно переснять, а не угадывай.
Источник: Small Vision-Language Models Know When They Are Wrong But Cannot Say So: A Two-Model Study of Stated versus Internal Confidence Under Realistic Image Degradation
ArXiv ID: 2607.22034 | Сгенерировано: 2026-07-27 08:25

Проблемы LLM

ПроблемаСутьКак обойти
Число уверенности — заученная фраза, а не реальная оценкаПросишь модель оценить уверенность в процентах. Модель почти всегда называет одно и то же число, около 90%. Число не меняется даже когда качество входных данных резко падает — фото тёмное, размытое, нечитаемое. Это не результат анализа, а привычная фраза из обучающих текстов, где после ответа принято писать «уверенность: высокая»Не спрашивай про процент уверенности. Спрашивай про объективное качество входных данных: чёткость, освещение, читаемость. Если данные плохие — проси модель прямо сказать «нужно переснять», а не давать приблизительный ответ

Методы

МетодСуть
Вопрос о качестве данных вместо вопроса об уверенностиМеняй формулировку с «как ты уверен» на «что не так со входом». Опиши качество фото: четкость, свет, размытость. Если плохое — скажи, что нужно переснять, а не давай приблизительный ответ. Работает потому что качество входа — проверяемый внешний факт, а не внутреннее ощущение модели, основанное на заученном шаблоне речи. Применяй для любых задач с шумными или неоднозначными входами: сканы документов, фото, рукописный текст, аудио с шумом. Не работает как гарантия при экстремально плохом качестве данных — модель может вообще не заметить проблему и всё равно дать уверенный неверный ответ

Тезисы

ТезисКомментарий
Вероятность генерации слова честнее слов о своей уверенностиКогда модель отвечает, она выбирает каждое слово с определённой вероятностью. Эта вероятность реально снижается, когда модель «путается» — в отличие от текстовой фразы про уверенность, которая почти не меняется. Механизм разный: текст об уверенности — заученный стиль ответа, вероятность слова — прямое следствие того, насколько чётко модель «видит» правильный вариант. Ограничение: этот сигнал скрыт внутри модели и виден только через API с доступом к логарифмам вероятностей (logprobs) — в обычном чате его нет. Применяй: если работаешь через API, используй вероятность токенов ответа как индикатор ошибки вместо того, чтобы просить модель назвать процент уверенности словами
📖 Простыми словами

Small Vision-LanguageModelsKnow When They Are Wrong But Cannot Say So: A Two-ModelStudy of Stated versus Internal Confidence Under Realistic Image Degradation

arXiv: 2607.22034

Маленькие мультимодальные модели — это патологические лжецы, которые даже не осознают, что врут. Когда ты просишь нейронку распознать размытое фото и оценить свою уверенность, она работает не как аналитик, а как запрограммированный оптимист. Корень проблемы в том, что текстовый ответ модели и её внутреннее состояние — это две разные вселенные. Внутри неё цифры так и кричат об ошибке, но на выходе она выдает заученный шаблон, потому что её так обучили: всегда казаться уверенной, даже если перед глазами «черный квадрат».

Это как если бы ты спросил дорогу у прохожего, который понятия не имеет, где нужная улица, но из вежливости или гордости с каменным лицом отвечает: «Идите прямо, уверен на 95%». Внутри он паникует и сомневается, но его речевой аппарат настроен выдавать только уверенный тон. В итоге ты получаешь не честную оценку, а социально одобряемую галлюцинацию, которая не имеет ничего общего с реальностью.

Исследователи проверили это на методе сравнения заявленной и внутренней уверенности. Выяснилось, что в логах вероятностей токенов модель прекрасно «понимает», когда картинка — хлам. Если фото испорчено шумом или темнотой, её внутренний индикатор падает, но в чат она всё равно пишет стандартные 90%. Этот разрыв между тем, что модель чувствует (математически), и тем, что она говорит, делает текстовые оценки уверенности абсолютно бесполезными для контроля ошибок.

Принцип универсален: это касается не только распознавания этикеток на складе, но и медицинских диагнозов по снимкам или проверки документов. Тестировали на Small Vision-Language Models, но болезнь характерна для большинства систем. Если модель говорит, что она «абсолютно уверена» в анализе графика или фото, это не значит ровным счетом ничего. Текстовая уверенность — это просто шум, маскирующий реальную неуверенность алгоритма.

Короче: никогда не верь нейронке на слово, когда она оценивает свою правоту. Если хочешь знать правду, нужно лезть «под капот» и смотреть на вероятности токенов, а не читать вежливые отписки в чате. Пока разработчики не свяжут внутренний термометр модели с её языком, мы будем получать уверенную чушь в 9 из 10 случаев. Не спрашивай модель «насколько ты уверена» — она всё равно соврет, просто потому что так принято.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с