3,583 papers
arXiv:2608.00817 76 1 авг. 2026 г. FREE

Ловушка доверия к цитатам: почему ссылки на источники в ответах AI усиливают доверие — даже когда ответ неверный

КЛЮЧЕВАЯ СУТЬ
92% → 35%: именно так рушится устойчивость врача к неверному совету AI, если рядом с ответом стоит цитата, которая выглядит как подтверждение. Метод CORA позволяет поймать момент, когда мозг путает релевантность источника с его доказательностью. Фишка в том, что человек видит ссылку и перестаёт проверять, доказывает ли она именно это утверждение, а не соседнее — достаточно спросить у модели прямо, и иллюзия рассеивается.
Адаптировать под запрос

TL;DR

Исследователи создали CORA — систему, которая ищет медицинские источники и даёт врачам ответ с цитатами, а врач оценивает, подтверждает ли цитата ответ, и может изменить своё решение. Механика простая: AI отвечает + прикрепляет "доказательства", человек читает и решает — доверять или нет.

Главная находка обжигает: когда врач считал, что цитата подтверждает ответ AI, он охотнее менял своё правильное решение на неправильное — устойчивость к плохому совету упала с 92% до 35%. Причина проста: наличие ссылки на источник создаёт иллюзию проверенности, даже если источник просто "на эту тему", а не доказывает конкретное утверждение. Мозг видит цитату и расслабляется — не проверяет, действительно ли она подтверждает именно этот вывод, а не соседний.

Вывод для практики: нельзя судить о правильности ответа AI по факту наличия ссылки на источник. Нужен отдельный шаг — проверить, доказывает ли цитата именно то утверждение, которое сделал AI, а не просто упоминает похожую тему.


🔬

Схема метода (принцип проверки цитат)

ШАГ 1: Попросить AI ответить на вопрос с указанием источников → ответ + цитаты
ШАГ 2: Для каждой цитаты спросить явно: "эта цитата ДОКАЗЫВАЕТ утверждение или просто НА ЭТУ ТЕМУ?" → пометка сильная/слабая/нет связи
ШАГ 3: Принимать решение только если хотя бы одна цитата реально доказывает, а не просто релевантна

Все три шага можно выполнить в одном диалоге с моделью.


🚀

Пример применения

Задача: Предприниматель спрашивает ChatGPT с включённым веб-поиском, можно ли использовать логотип конкурента в сравнительной рекламе без разрешения. AI отвечает "да, можно" и даёт ссылку на статью закона о рекламе.

Промпт:

Ответь на вопрос: {можно ли использовать логотип конкурента в сравнительной рекламе без разрешения}.

Для каждого утверждения в твоём ответе:
1. Приведи ТОЧНУЮ цитату из источника, которая доказывает именно это утверждение — не просто источник на близкую тему.
2. Если точной цитаты нет, скажи прямо: "источник не подтверждает это утверждение напрямую, он лишь касается похожей темы".
3. Оцени силу подтверждения: сильное / слабое / отсутствует.

Результат: Модель либо покажет конкретный фрагмент закона, который буквально разрешает описанное действие, либо честно признает, что нашла статью "в целом про рекламу", но не про этот конкретный случай. Это сразу видно — без такого запроса вы бы просто увидели "ссылку" и поверили, что вопрос закрыт.


🧠

Почему это работает

LLM с доступом к источникам генерирует ссылки, которые тематически релевантны, но не обязательно доказывают именно то, что она заявляет. Модель не умеет сама надёжно сигналить "эта цитата слабая" — она с одинаковой уверенностью прикрепляет и точное доказательство, и просто похожий по теме текст.

Сильная сторона модели — она отлично умеет сопоставлять конкретную фразу с конкретным утверждением, если её явно об этом попросить. Проблема не в том, что модель не может проверить это сама, а в том, что по умолчанию её никто об этом не просит.

Метод использует эту сильную сторону: явный вопрос "доказывает или просто на тему" заставляет модель (и вас) разделить два разных сигнала, которые иначе слипаются в один — "есть цитата = ответ верный".

Рычаги управления: - Попросить точную цитату (кусок текста), а не просто ссылку — сразу видно, доказывает или нет - Попросить оценку силы связи (сильная/слабая/нет) вместо простого да/нет - Добавить условие: "не меняй свой предыдущий ответ, пока цитата не пройдёт проверку на прямое доказательство" — тормозит автоматическое согласие


📋

Шаблон промпта

Вопрос: {ваш вопрос}

Дай ответ и укажи источники. Для каждого источника:
1. Приведи точный фрагмент текста, который напрямую доказывает твоё утверждение.
2. Если такого фрагмента нет, честно скажи: "источник касается темы, но не доказывает это утверждение".
3. Оцени связь: сильная / слабая / отсутствует.

Прежде чем я приму решение на основе твоего ответа, покажи мне эту оценку.

Подставь в {ваш вопрос} любой запрос, где вы хотите проверить совет AI перед тем, как действовать на его основе.

🚀 Быстрый старт — вставь в чат:

Вот принцип проверки цитат AI. Адаптируй под мою задачу: {ваша задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой именно вопрос вы хотите проверить и какие источники ей доступны — это нужно, чтобы применить проверку "доказывает vs на тему" к вашему конкретному случаю.


⚠️

Ограничения

⚠️ Не готовая техника с гарантией: это осознание риска + один шаг проверки, а не мощный промпт, который решает проблему полностью. Эффект зависит от вашей дисциплины — если пропустите шаг проверки, ловушка сработает как обычно.

⚠️ Работает только при внимательном чтении: если вы бегло смотрите на "оценку силы связи" модели и не читаете саму цитату, эффект метода теряется — вы просто перекладываете ту же иллюзию доверия на новый ярлык.

⚠️ Исследование медицинское, но механизм универсален: проверяли на врачах и дерматологических вопросах — для юридических, финансовых, технических советов принцип вероятно работает так же, но это не проверено напрямую.


🔍

Как исследовали

Исследователи взяли CORA — систему, которая ищет медицинские источники и генерирует ответ с цитатами — и сначала прогнали её на почти 5000 вопросов по дерматологии, сравнив с обычными моделями без поиска (GPT-5, Llama-4, Qwen, Mistral, Gemma). Прирост точности был больше у слабых моделей и на свежих случаях, которые модели не видели при обучении — логично: там где модель "не знает", подсказка источника особенно помогает.

Дальше — главный эксперимент: 46 врачей из 21 страны отвечали на вопросы сначала без помощи, потом видели ответ CORA с цитатами, оценивали, подтверждает ли цитата ответ, и могли поменять свой ответ. Точность выросла с 70,8% до 82,6% — это ожидаемо хорошо.

Но неожиданным оказалось то, что случилось при разбивке по восприятию цитат: когда врач считал цитату подтверждающей, он в разы охотнее принимал совет AI — что отлично, если совет верный (адаптация выросла с 34% до 77%), и катастрофично, если совет неверный (сопротивление упало с 92% до 35%). Именно эта асимметрия — открытие статьи: не сама точность AI, а то, что вид доказательства обманывает одинаково хорошо и когда доказательство настоящее, и когда оно фиктивное.


🔗

Ресурсы

CORA (Citation-Oriented Retrieval Assistant) — Tirtha Chanda, Titus J. Brinker и коллеги, German Cancer Research Center (DKFZ), Heidelberg, совместно с University Heidelberg, Medical University of Vienna, NCT Heidelberg и другими. Использован фреймворк appropriate-reliance (Schemmer et al.) для анализа доверия к AI-советам.


📋 Дайджест исследования

Ключевая суть

92% → 35%: именно так рушится устойчивость врача к неверному совету AI, если рядом с ответом стоит цитата, которая выглядит как подтверждение. Метод CORA позволяет поймать момент, когда мозг путает релевантность источника с его доказательностью. Фишка в том, что человек видит ссылку и перестаёт проверять, доказывает ли она именно это утверждение, а не соседнее — достаточно спросить у модели прямо, и иллюзия рассеивается.

Принцип работы

AI-цитата работает как чек из магазина без указания товара. Видишь бумажку с датой и суммой — думаешь, покупка подтверждена. На деле там просто дата и сумма, а что купили — неизвестно. Так же с источниками: ссылка есть, а доказывает ли она именно твой вывод — вопрос отдельный. Спрашивай прямо: эта цитата доказывает утверждение или просто лежит рядом по теме.

Почему работает

Модель генерит точное доказательство и просто похожий по теме текст с одинаковой уверенностью — сама она эту разницу не подсвечивает. Врачи в исследовании держали правильный ответ в 92% случаев без цитат, но стоило показать им ссылку, которая казалась подтверждающей — устойчивость рухнула до 35%. Модель отлично умеет сопоставлять конкретную фразу с конкретным утверждением — но только если её явно об этом попросить, а не как обычно.

Когда применять

Проверка советов AI → для решений с высокой ценой ошибки: медицина, юриспруденция, финансы, особенно когда модель сама подбирает источники через веб-поиск. Не подходит для быстрых бытовых вопросов, где ошибка ничего не стоит — там доп.шаг проверки просто съедает время без пользы.

Мини-рецепт

1. Задай вопрос с явным требованием источников: не просто ответ, а ответ плюс ссылки.
2. Попроси точную цитату: кусок текста, а не просто адрес источника.
3. Попроси оценку силы связи: сильная, слабая или отсутствует — это разделяет два разных сигнала, которые иначе слипаются.
4. Поставь условие: не менять решение, пока цитата не пройдёт проверку на прямое доказательство.

Примеры

[ПЛОХО] : Можно ли использовать логотип конкурента в сравнительной рекламе? Дай ссылку на закон.
[ХОРОШО] : Ответь на вопрос и для каждого утверждения приведи точную цитату, которая доказывает именно это, а не просто источник на похожую тему. Если точной цитаты нет — скажи прямо. Оцени силу связи: сильная / слабая / отсутствует.
Источник: Large Language Models Improve Physician Accuracy but Lead to False Reliance
ArXiv ID: 2608.00817 | Сгенерировано: 2026-08-04 04:22

Проблемы LLM

ПроблемаСутьКак обойти
Ссылка на источник создаёт иллюзию проверенности ответаМодель прикрепляет к ответу цитату из источника. Человек видит цитату — и перестаёт проверять сам ответ. Не важно, доказывает ли цитата именно это утверждение, или просто написана на похожую тему. Мозг расслабляется от вида "доказательства". Из-за этого человек охотнее меняет верное решение на неверное, если AI дал неправильный совет со ссылкойСпрашивай модель отдельно: "эта цитата доказывает именно это утверждение, или просто на эту тему?" Проси точный фрагмент текста, а не просто ссылку. Принимай решение только если цитата прошла эту проверку

Методы

МетодСуть
Проверка цитаты — "доказывает" против "на тему"Спроси модель: приведи точный фрагмент текста, который доказывает именно это утверждение, а не просто похож по теме. Попроси оценить силу связи: сильная / слабая / нет. Приведи точную цитату, которая доказывает именно это утверждение. Оцени связь: сильная/слабая/нет. Работает, потому что модель хорошо сопоставляет конкретную фразу с конкретным утверждением — если её явно об этом попросить. По умолчанию она этого не делает и с одинаковой уверенностью даёт и точное доказательство, и просто похожий текст. Когда да: любой ответ AI с ссылками на источники, перед тем как довериться совету. Когда нет: если сам не читаешь цитату и просто смотришь на пометку "сильная/слабая" — эффект теряется
📖 Простыми словами

Largelanguagemodelsimprove physician accuracy but lead to false reliance

arXiv: 2608.00817

AI-ассистенты в медицине работают не как справочники, а как уверенные советчики, которые подкрепляют свои слова ссылками. Система CORA устроена просто: она выдает диагноз и прикрепляет к нему цитаты из медицинских источников. Проблема в том, что на уровне архитектуры LLM не понимает разницы между реальным доказательством и просто текстом на ту же тему. Модель генерирует ответ, а потом подтягивает наиболее похожие куски текста, создавая иллюзию обоснованности, даже если цитата прямо противоречит выводу или вообще не содержит ответа.

Это как если бы ты пришел к адвокату, и он уверенно заявил, что ты выиграешь суд, хлопнув по столу толстым томом Уголовного кодекса. Ты видишь книгу, видишь серьезное лицо и веришь, хотя на открытой странице может быть написан рецепт яблочного пирога или параграф о правилах рыболовства. Наличие источника магическим образом отключает у человека критическое мышление: мы смотрим на сам факт наличия ссылки, а не на то, что там реально написано. Формально доказательство есть, а по факту — пустышка.

В цифрах это выглядит как ложное доверие: врачи с помощью AI ставят диагнозы точнее, но когда модель ошибается и подсовывает левую цитату, они слепо идут за ней в пропасть. Система не умеет сигнализировать о своей неуверенности — она с одинаковым пафосом выдает и железные факты, и полную ахинею. В итоге человек перестает проверять, превращаясь из эксперта в оператора, который просто нажимает кнопку «согласен», потому что текст выглядит солидно и снабжен какими-то цифрами.

Этот эффект универсален и выходит далеко за пределы медицины. Будь то юрист, проверяющий законность рекламы, или программист, ищущий баг в коде — магия цитирования работает везде одинаково. Мы привыкли, что ссылка — это гарантия качества, но для нейросети это просто статистически вероятный кусок текста. В эпоху GEO и поиска с поддержкой AI мы рискуем захлебнуться в ответах, которые выглядят как истина в последней инстанции, но на деле являются лишь набором релевантных, но бесполезных слов.

Главный вывод: AI реально повышает точность работы, но только до тех пор, пока он прав. Как только модель лажает, она тянет тебя за собой, потому что ты расслабился и поверил ссылкам. Нельзя доверять системе проверку самой себя — если AI выдал цитату, это не значит, что он ее прочитал и понял. Проверяй источники руками, иначе станешь жертвой собственной лени в тот самый момент, когда цена ошибки будет максимальной.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с