3,583 papers
arXiv:2608.10008 76 7 авг. 2026 г. FREE

Catalog-Anchored Confidence: почему вопрос «на сколько ты уверен?» не ловит выдуманные рекомендации

КЛЮЧЕВАЯ СУТЬ
Модель говорит «70 из 100». Но права в 92-100% случаев. Это не скромность — это баг самого вопроса. «Насколько уверен» модель слышит как «насколько хороший это совет». Не как «существует ли это на самом деле». Catalog-Anchored Confidence разделяет эти два вопроса. Метод позволяет получить сигнал именно про факт существования объекта, а не про качество совета. Фишка: меняешь не модель, а то, что измеряет её число — и оценка начинает реагировать на выдумку.
Адаптировать под запрос

TL;DR

Catalog-Anchored Confidence — способ спросить LLM об уверенности так, чтобы получить сигнал именно о том, существует ли рекомендованный объект на самом деле, а не о том, насколько это хороший совет. Обычный вопрос «оцени уверенность от 0 до 100» не различает выдуманные и настоящие ответы — модель отвечает на другой вопрос, чем тот, который ты задал.

Когда LLM выдаёт список рекомендаций (фильмы, товары, рестораны), она в 2–8% случаев выдумывает несуществующие названия. Логично спросить «насколько уверен?» и отсечь сомнительные пункты. Но происходит странное: модель систематически недооценивает свою уверенность — говорит «70 из 100», хотя права в 92–100% случаев. Уверенность в её словах почти не связана с тем, реальна ли рекомендация. Причина простая: на вопрос «насколько уверен» модель отвечает как на «насколько хороший это совет», а не «существует ли это в реальности» — и хвалит себя в скромном диапазоне 67–86 независимо от факта.

Если хочешь поймать выдумку — не спрашивай общую уверенность. Спрашивай конкретно: «уверен ли ты, что этот пункт реально существует, а не придуман тобой». Переформулировка меняет то, что измеряет число в ответе, хотя эффект непостоянный и зависит от модели.


🔬

Схема метода

ШАГ 1: LLM генерирует список рекомендаций (топ-N) → список названий
ШАГ 2а (обычный запрос, НЕ работает): "Оцени уверенность 0-100" → генерик-оценка качества совета
ШАГ 2б (catalog-anchored, работает точнее, но нестабильно): 
"Оцени, уверен ли ты, что этот пункт реально существует, а не придуман тобой" → сигнал про существование

Всё можно уместить в один запрос — важна именно формулировка критерия оценки, не количество шагов.


🚀

Пример применения

Задача: Просишь Claude или ChatGPT посоветовать нишевые заведения — кофейни в своём городе, книги для подборки, товары на маркетплейсе. Риск: модель может выдумать название, которого не существует.

Промпт:

Посоветуй 10 кофеен в Ростове-на-Дону с хорошим фильтр-кофе, 
работающих до 22:00.

Для каждой кофейни укажи:
1. Название
2. Оценка от 0 до 100: НЕ насколько тебе нравится это место, 
а насколько ты уверен, что эта кофейня РЕАЛЬНО существует 
и ты не придумал название.

Результат: Модель выдаст список из 10 заведений, рядом с каждым — число. Для широко известных сетевых мест число вероятно будет выше и точнее отражать реальность. Но полностью доверять этому нельзя: на нишевых, локальных объектах эффект нестабилен — стоит дополнительно проверить названия поиском, а не полагаться только на число.


🧠

Почему это работает

У LLM нет отдельного «датчика» для факта существования объекта — она использует один и тот же механизм самооценки и для качества совета, и для факта его реальности. RLHF-обучение приучило модель быть «скромной» в диапазоне 67–86, независимо от того, права она или нет.

Зато LLM чувствительна к формулировке вопроса: если явно указать другой критерий оценки — существование вместо качества — распределение её ответов меняется.

Метод использует эту чувствительность, явно переопределяя, что должна измерять цифра уверенности. Но переопределение критерия — это рычаг, а не гарантированное решение: одну и ту же переформулировку можно применить к разным моделям и получить противоположный эффект (см. ограничения).


📋

Шаблон промпта

{задача рекомендации}

Для каждого пункта в списке укажи:
1. Название
2. Оценка от 0 до 100: НЕ насколько это хороший вариант, 
а насколько ты уверен, что {объект} РЕАЛЬНО существует 
в {источник/каталог}, а не придуман тобой.

Подставь {задача рекомендации} (что рекомендовать), {объект} (тип объекта — книга, товар, кафе, статья), {источник/каталог} (где это должно существовать — конкретный магазин, город, база данных).

🚀 Быстрый старт — вставь в чат:

Вот шаблон для проверки уверенности LLM в реальности рекомендаций. 
Адаптируй под мою задачу: {твоя задача}. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, что именно ты рекомендуешь и в каком «каталоге» это должно существовать — потому что метод работает только если критерий уверенности явно привязан к конкретному факту существования, а не к общему качеству.


⚠️

Ограничения

⚠️ Непредсказуемый эффект по моделям: привязка уверенности к факту существования улучшила калибровку у одной модели (Llama), но ухудшила у другой (Claude) — на одной и той же задаче.

⚠️ Фильтрация по порогу уверенности почти не убирает галлюцинации: модель одинаково «скромна» и на правильных, и на выдуманных пунктах. Отсечка по числу теряет много верных ответов, а не выдумки.

⚠️ На известных объектах проблема не критична: для топовых фильмов, брендов галлюцинаций почти нет — калибровка confidence не так важна. Главная боль — нишевые, локальные объекты, где и выдумок больше, и уверенность модели ещё хуже откалибрована.


🔍

Как исследовали

Исследователи взяли 4 LLM от разных вендоров (Mistral Large, Llama 3.3 70B, GPT-OSS 120B, Claude Sonnet 4.6) и попросили их порекомендовать топ-10 объектов по истории пользователя из трёх разных баз — фильмов (MovieLens), товаров (Amazon Toys) и локальных бизнесов (Yelp). Каждую рекомендацию проверили на существование в базе (с учётом опечаток), а модель попросили честно оценить свою уверенность от 0 до 100.

Доля выдумок сильно зависела от базы: почти 0% на фильмах, до 8% на нишевых товарах и локальных бизнесах — логично, фильмы модель видела в интернете тысячи раз, а локальную кофейню — почти никогда. Но главный сюрприз: даже там, где выдумок почти нет, уверенность модели была занижена на 14–22 процентных пункта относительно реальной точности — и так во всех 12 комбинациях модель×база. Это противоречит обычному нарративу про самоуверенность LLM.

Попытка отфильтровать выдумки строгим статистическим методом (conformal prediction) почти не сработала: убирала максимум 0,7 процентных пункта галлюцинаций, отбрасывая при этом 4–21% нормальных рекомендаций — потому что уверенность модели просто не различает правильные и выдуманные ответы. Дополнительный тест — переформулировать вопрос, явно привязав его к факту существования — дал противоречивый результат: у одной модели резко улучшил точность прогноза, у другой ухудшил ещё сильнее.


💡

Адаптации и экстраполяции

💡 Адаптация для проверки источников: Когда просишь LLM найти научные статьи, книги, судебные кейсы или цитаты — добавь отдельный вопрос: «оцени 0-100, уверен ли ты, что этот источник реально существует, а не придуман тобой» вместо «оцени релевантность». Это не гарантирует точность, но подсвечивает подозрительно низкие числа как сигнал перепроверить вручную (через поиск).

🔧 Техника: две шкалы вместо одной → разделение сигналов. Попроси модель дать ДВА числа на каждый пункт: «уверенность, что это реально существует» и «уверенность, что это подходит под критерии». Расхождение между числами показывает случаи, где модель уверена в качестве совета, но не уверена в его реальности — это и есть кандидат на проверку.


🔗

Ресурсы

Do LLM Recommenders Know When They're Hallucinating? Auditing Confidence Calibration in Catalog Faithfulness, Srijith Ravikumar (независимая работа, не связана с должностью автора в Amazon.com), принята на CIKM '26. Используемый шаблон запроса уверенности — «Just Ask» из Tian et al. (2023, self-rated confidence calibration). Метод фильтрации — split-conformal calibration (Abbasi-Yadkori et al., NeurIPS 2024).


📋 Дайджест исследования

Ключевая суть

Модель говорит «70 из 100». Но права в 92-100% случаев. Это не скромность — это баг самого вопроса. «Насколько уверен» модель слышит как «насколько хороший это совет». Не как «существует ли это на самом деле». Catalog-Anchored Confidence разделяет эти два вопроса. Метод позволяет получить сигнал именно про факт существования объекта, а не про качество совета. Фишка: меняешь не модель, а то, что измеряет её число — и оценка начинает реагировать на выдумку.

Принцип работы

Обычный подход: спросить общую уверенность 0-100 и отсечь низкие оценки. Не работает — модель одинаково «скромна» на правильных и выдуманных пунктах. Правильный подход: переопредели явно, что должна измерять цифра — не «насколько хороший совет», а «существует ли это на самом деле, а не придумано тобой». Один и тот же список, разная формулировка критерия — разный результат.

Почему работает

У модели нет отдельного «датчика» для факта существования объекта. Она использует один и тот же механизм самооценки для качества совета и для факта реальности. Обучение приучило модель отвечать сдержанно — в диапазоне 67-86, независимо от того, права она или нет. Ключевой инсайт: модель чувствительна к формулировке вопроса — поменяй критерий оценки явно, и распределение ответов сдвигается. Но рычаг непредсказуемый: у Llama точность оценки уверенности выросла, у Claude — упала на той же задаче.

Когда применять

Рекомендации нишевых, локальных объектов — кофейни в конкретном городе, товары на маркетплейсе, книги вне топ-листов. Особенно когда риск выдумки высок, а проверить название сложно. Для известных брендов и топовых фильмов метод не нужен — там галлюцинаций почти нет. НЕ подходит как единственный фильтр: отсечка по порогу теряет много верных ответов вместе с выдумками.

Мини-рецепт

1. Опиши задачу: конкретный список рекомендаций, что именно нужно посоветовать.
2. Задай явный критерий: не «насколько хороший совет», а «уверен ли ты, что это реально существует, а не придумано тобой».
3. Привяжи к каталогу: укажи, где именно должен существовать объект — конкретный город, магазин, база данных.
4. Проверь на своей модели: эффект нестабилен между моделями, результат может отличаться на Claude и на Llama.
5. Не доверяй числу слепо: используй оценку как подсказку, а нишевые позиции проверяй вручную поиском.

Примеры

[ПЛОХО] : Посоветуй 10 кофеен в Ростове-на-Дону. Оцени уверенность от 0 до 100 для каждой.
[ХОРОШО] : Посоветуй 10 кофеен в Ростове-на-Дону с хорошим фильтр-кофе, работающих до 22:00. Для каждой укажи оценку 0-100: НЕ насколько тебе нравится место, а насколько ты уверен, что кофейня РЕАЛЬНО существует и ты не придумал название.
Источник: DoLLMRecommenders Know When They're Hallucinating? Auditing Confidence Calibration in Catalog Faithfulness
ArXiv ID: 2608.10008 | Сгенерировано: 2026-08-12 06:28

Проблемы LLM

ПроблемаСутьКак обойти
Оценка уверенности не показывает существует ли объектПросишь модель оценить уверенность от 0 до 100. Модель отвечает на вопрос "насколько хороший совет". А не на вопрос "существует ли это на самом деле". Число почти не связано с тем, выдумка перед тобой или нет. Модель ставит 67–86 баллов почти всегда — и на правде, и на выдумкеНе спрашивай общую уверенность. Спрашивай прямо: "уверен ли ты, что этот объект реально существует, а не придуман тобой". Привязывай оценку к конкретному факту, а не к качеству совета

Методы

МетодСуть
Переопределение критерия уверенностиВ запросе явно пиши что должна измерять цифра: не качество, а факт существования. Оценка 0-100: НЕ насколько хороший вариант, а насколько уверен что объект РЕАЛЬНО существует в {источник}. Работает через чувствительность модели к формулировке — если явно сузить критерий, распределение ответов меняется. Когда применять: нужно отсеять выдуманные пункты в списке рекомендаций, особенно нишевые объекты. Когда не работает: эффект непостоянен между моделями — на одной улучшает калибровку, на другой ухудшает. Не заменяет проверку фактов внешним поиском

Тезисы

ТезисКомментарий
Числовой порог уверенности почти не отделяет выдумку от правдыМодель одинаково "скромна" в оценке и на верных, и на придуманных ответах. Диапазон ответов узкий независимо от того, права модель или нет. Значит отсечка по порогу ("оставить только выше 80") срежет много правильных пунктов, но не уберёт выдумки. Применяй: не доверяй числу как фильтру галлюцинаций. Используй его только как слабый ориентир, а факты проверяй отдельно
📖 Простыми словами

DoLLMRecommenders Know When They're Hallucinating? Auditing Confidence Calibration in Catalog Faithfulness

arXiv: 2608.10008

Проблема в том, что нейронки — патологические лжецы, которые сами не понимают, когда врут. Когда ты просишь ChatGPT посоветовать книгу или кофейню, она может выдать несуществующее название с лицом кирпичом. Исследование 2608.10008 доказывает: стандартные способы спросить модель «ты уверена?» не работают, потому что она путает качество своего совета с реальностью объекта. Модель может быть на 100% уверена, что её выдуманный «Кофе-Боб» — идеальное место для тебя, хотя такого заведения нет в природе. Это фундаментальный баг калибровки уверенности, где внутренний «датчик правды» просто не подключен к реальности.

Это как если бы ты спросил у очень самоуверенного стажёра, где лежит важный договор, а он, чтобы не расстраивать начальника, с горящими глазами описал бы синюю папку на третьей полке. Проблема не в том, что он плохой работник, а в том, что его мозг заточен выдавать приятный ответ, а не проверять наличие папки в шкафу. В итоге ты получаешь галлюцинацию, упакованную в обёртку абсолютной убедительности, потому что стажёр сам верит в свою сказку.

Чтобы починить этот облом, авторы придумали Catalog-Anchored Confidence. Суть в том, чтобы заставить LLM оценивать не «насколько это крутой совет», а «существует ли эта штука в каталоге на самом деле». Исследователи выяснили, что обычное обучение через RLHF (когда люди ставят лайки ответам) сломало моделям адекватность: они привыкли держаться в безопасном диапазоне уверенности 67–86%, даже если несут полную ахинею. Новый метод разделяет эти сущности, заставляя алгоритм фокусироваться на фактологической верности, а не на том, насколько вежливо и красиво сформулирован ответ.

Тестировали это на рекомендациях, но принцип универсален для любой работы с данными, будь то поиск товаров на маркетплейсе, подбор научных статей или юридических прецедентов. Везде, где есть риск, что AI «дофантазирует» детали, нужно использовать якорную проверку по каталогу. Сейчас большинство разработчиков просто надеются на авось, но SEO для AI и работа с рекомендациями скоро упрутся в стену, если не научат модели отличать свои фантазии от реальных объектов в базе данных.

Короче: верить модели на слово, когда она говорит «я уверена» — это путь в никуда. Нужно менять саму механику вопроса, перенося акцент с субъективного ощущения нейронки на жесткую привязку к фактам. Если не внедрить Catalog-Anchored Confidence, мы так и будем получать списки несуществующих отелей и книг, написанные самым убедительным тоном в мире. Либо ты контролируешь галлюцинации через правильную калибровку, либо твой сервис превращается в генератор красивого, но бесполезного мусора.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с