TL;DR
Когда просишь модель оценить фото и сказать, насколько она уверена в ответе, она почти всегда называет одно и то же число — около 90%. Это не результат самоанализа, а заученный шаблон ответа: число практически не меняется независимо от того, правильно модель угадала или нет. При этом внутри самой модели, в вероятностях, с которыми она генерирует слова ответа, есть куда более точный сигнал о собственной ошибке — но этот сигнал недоступен через обычный текстовый ответ.
Представь: загружаешь тёмное нечёткое фото документа в чат и спрашиваешь «что здесь написано, насколько ты уверен». Модель может ответить «уверенность 90%» на чётком фото и то же самое «90%» на кромешной темноте, где угадывает хуже монетки. Число уверенности от модели не связано с реальным качеством её ответа — оно застряло на одном значении.
Исследователи проверили это на 3800 ответах двух маленьких моделей под шестью видами испорченных фото (размытость, темнота, блики, сжатие) и обнаружили: словесная уверенность — почти константа и ничего не предсказывает, а технический сигнал (вероятность сгенерированных токенов) почти безошибочно отличает верные ответы от неверных. Кроме одного случая — сильной темноты, где оба сигнала одинаково слепы, а точность модели рушится до уровня случайного угадывания.
Схема исследования
ШАГ 1: Модель смотрит на фото → отвечает на вопрос + называет число уверенности (0–100%) → «заявленная уверенность»
ШАГ 2: Замеряется вероятность токенов, которые модель реально сгенерировала в ответе → «внутренняя уверенность» (нужен API с доступом к logprobs)
ШАГ 3: Сравнение двух сигналов — какой точнее предсказывает, ошиблась модель или нет
Пример применения
Задача: Ты фотографируешь этикетку товара на складе при плохом освещении, фото получилось размытым и тёмным. Загружаешь в Claude или ChatGPT с вопросом «что это и насколько ты уверен».
Промпт:
Вот фото товара [вставить фото]. Определи, что это.
Не называй проценты уверенности — вместо этого честно опиши качество самого фото:
достаточно ли оно четкое, светлое, видны ли детали текста.
Если фото плохого качества — прямо скажи, что нужно переснять, а не угадывай.
Результат: Если бы ты спросил напрямую «на сколько процентов ты уверен», модель скорее всего назвала бы стабильное число вроде 85-95% — независимо от того, насколько плохое фото. Вместо этого промпт заставляет модель оценивать объективное качество входных данных, а не своё субъективное самоощущение — это надёжнее, потому что не зависит от заученного шаблона ответа.
Почему это работает
Заявленная уверенность — это выученная манера речи, а не результат реального самоанализа. Модель училась на текстах, где после ответа принято ставить «уверенность: высокая», и воспроизводит эту привычку почти механически, независимо от контекста.
При этом сама механика генерации текста устроена иначе: каждое слово модель выбирает с какой-то вероятностью, и эта вероятность действительно чувствительна к тому, «путается» модель или отвечает уверенно. Но пользователь эту вероятность не видит — она скрыта в технических данных, доступных только через API.
Раз словам о собственной уверенности верить нельзя, разумно сместить вопрос: не «как ты уверен», а «что не так с входными данными». Оценка качества фото — это внешний, проверяемый факт, а не внутреннее ощущение модели, поэтому такой вопрос работает надёжнее.
Рычаги: - Спрашивай про качество данных (чёткость, свет, читаемость), а не про уверенность модели в ответе. - Задай один и тот же вопрос несколько раз разными словами — если ответы расходятся, это более честный сигнал проблемы, чем стабильное число «90%». - На важных задачах (документы, медицинские снимки, финансовые данные) — всегда добавляй запрос на самопроверку качества исходника до того, как просить содержательный ответ.
Шаблон промпта
Вот {фото/скан документа}.
1. Определи, что на нём изображено или что написано.
2. Не называй процент уверенности — вместо этого оцени качество самого изображения:
четкость, освещение, есть ли размытость, блики или обрезанные детали.
3. Если качество плохое — прямо скажи, что нужно переснять или уточнить,
а не давай приблизительный ответ.
{фото/скан документа} — подставь конкретный объект: этикетка, чек, скан паспорта, фото товара, рукописный текст.
Ограничения
⚠️ Работает только для плохих изображений: на чётких фото разница между «словами» и «внутренним» сигналом почти не проявляется — проблема видна именно при деградации: темноте, размытости, шуме.
⚠️ Технический сигнал недоступен в обычном чате: «внутренняя уверенность» (вероятность токенов) видна только через API с доступом к logprobs — обычный пользователь ChatGPT/Claude в браузере её не получит. Практический вывод (не спрашивай про проценты, спрашивай про качество фото) — доступен, сам технический сигнал — нет.
⚠️ При экстремально плохом свете оба сигнала слепы: ни слова модели, ни технические вероятности не предупреждают о резком падении точности. Единственная защита — проверять качество фото до отправки в модель, а не доверять любому её ответу после.
⚠️ Проверено только на маленьких моделях (~2 млрд параметров) и одной задаче (распознавание еды по фото). Неизвестно, сохраняется ли эффект на крупных моделях вроде GPT-4V или Claude с изображениями.
Как исследовали
Исследователи взяли две маленькие открытые модели — Qwen2-VL и SmolVLM (по ~2 млрд параметров, такие ставят на слабое железо) — и прогнали через них 100 фото еды, испорченных шестью способами: сжатие, размытие, темнота, блики, поворот, пересжатие, каждое на трёх уровнях серьёзности. На каждом фото модель выбирала правильный вариант из четырёх и называла число уверенности. Параллельно замеряли реальную вероятность токенов ответа — техническую метрику, доступную только потому, что модели открытые (у закрытых API типа GPT-4V такого доступа нет).
Результат удивил своей резкостью: словесная уверенность у Qwen2-VL держалась в узком диапазоне 87–90% почти всегда — даже когда точность падала до уровня случайного угадывания при сильной темноте. А вот технический сигнал точно разделял правильные и неправильные ответы почти везде — кроме этого же случая экстремальной темноты, где оба сигнала одинаково перестали работать. Попытка «подкрутить» словесную уверенность стандартным математическим трюком (температурной калибровкой) помогла в лёгких случаях, но усугубила ситуацию в тяжёлых — потому что нельзя откалибровать сигнал, если в нём изначально нет информации о реальном качестве ответа.
