TL;DR
Исследователи создали CORA — систему, которая ищет медицинские источники и даёт врачам ответ с цитатами, а врач оценивает, подтверждает ли цитата ответ, и может изменить своё решение. Механика простая: AI отвечает + прикрепляет "доказательства", человек читает и решает — доверять или нет.
Главная находка обжигает: когда врач считал, что цитата подтверждает ответ AI, он охотнее менял своё правильное решение на неправильное — устойчивость к плохому совету упала с 92% до 35%. Причина проста: наличие ссылки на источник создаёт иллюзию проверенности, даже если источник просто "на эту тему", а не доказывает конкретное утверждение. Мозг видит цитату и расслабляется — не проверяет, действительно ли она подтверждает именно этот вывод, а не соседний.
Вывод для практики: нельзя судить о правильности ответа AI по факту наличия ссылки на источник. Нужен отдельный шаг — проверить, доказывает ли цитата именно то утверждение, которое сделал AI, а не просто упоминает похожую тему.
Схема метода (принцип проверки цитат)
ШАГ 1: Попросить AI ответить на вопрос с указанием источников → ответ + цитаты
ШАГ 2: Для каждой цитаты спросить явно: "эта цитата ДОКАЗЫВАЕТ утверждение или просто НА ЭТУ ТЕМУ?" → пометка сильная/слабая/нет связи
ШАГ 3: Принимать решение только если хотя бы одна цитата реально доказывает, а не просто релевантна
Все три шага можно выполнить в одном диалоге с моделью.
Пример применения
Задача: Предприниматель спрашивает ChatGPT с включённым веб-поиском, можно ли использовать логотип конкурента в сравнительной рекламе без разрешения. AI отвечает "да, можно" и даёт ссылку на статью закона о рекламе.
Промпт:
Ответь на вопрос: {можно ли использовать логотип конкурента в сравнительной рекламе без разрешения}.
Для каждого утверждения в твоём ответе:
1. Приведи ТОЧНУЮ цитату из источника, которая доказывает именно это утверждение — не просто источник на близкую тему.
2. Если точной цитаты нет, скажи прямо: "источник не подтверждает это утверждение напрямую, он лишь касается похожей темы".
3. Оцени силу подтверждения: сильное / слабое / отсутствует.
Результат: Модель либо покажет конкретный фрагмент закона, который буквально разрешает описанное действие, либо честно признает, что нашла статью "в целом про рекламу", но не про этот конкретный случай. Это сразу видно — без такого запроса вы бы просто увидели "ссылку" и поверили, что вопрос закрыт.
Почему это работает
LLM с доступом к источникам генерирует ссылки, которые тематически релевантны, но не обязательно доказывают именно то, что она заявляет. Модель не умеет сама надёжно сигналить "эта цитата слабая" — она с одинаковой уверенностью прикрепляет и точное доказательство, и просто похожий по теме текст.
Сильная сторона модели — она отлично умеет сопоставлять конкретную фразу с конкретным утверждением, если её явно об этом попросить. Проблема не в том, что модель не может проверить это сама, а в том, что по умолчанию её никто об этом не просит.
Метод использует эту сильную сторону: явный вопрос "доказывает или просто на тему" заставляет модель (и вас) разделить два разных сигнала, которые иначе слипаются в один — "есть цитата = ответ верный".
Рычаги управления: - Попросить точную цитату (кусок текста), а не просто ссылку — сразу видно, доказывает или нет - Попросить оценку силы связи (сильная/слабая/нет) вместо простого да/нет - Добавить условие: "не меняй свой предыдущий ответ, пока цитата не пройдёт проверку на прямое доказательство" — тормозит автоматическое согласие
Шаблон промпта
Вопрос: {ваш вопрос}
Дай ответ и укажи источники. Для каждого источника:
1. Приведи точный фрагмент текста, который напрямую доказывает твоё утверждение.
2. Если такого фрагмента нет, честно скажи: "источник касается темы, но не доказывает это утверждение".
3. Оцени связь: сильная / слабая / отсутствует.
Прежде чем я приму решение на основе твоего ответа, покажи мне эту оценку.
Подставь в {ваш вопрос} любой запрос, где вы хотите проверить совет AI перед тем, как действовать на его основе.
🚀 Быстрый старт — вставь в чат:
Вот принцип проверки цитат AI. Адаптируй под мою задачу: {ваша задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какой именно вопрос вы хотите проверить и какие источники ей доступны — это нужно, чтобы применить проверку "доказывает vs на тему" к вашему конкретному случаю.
Ограничения
⚠️ Не готовая техника с гарантией: это осознание риска + один шаг проверки, а не мощный промпт, который решает проблему полностью. Эффект зависит от вашей дисциплины — если пропустите шаг проверки, ловушка сработает как обычно.
⚠️ Работает только при внимательном чтении: если вы бегло смотрите на "оценку силы связи" модели и не читаете саму цитату, эффект метода теряется — вы просто перекладываете ту же иллюзию доверия на новый ярлык.
⚠️ Исследование медицинское, но механизм универсален: проверяли на врачах и дерматологических вопросах — для юридических, финансовых, технических советов принцип вероятно работает так же, но это не проверено напрямую.
Как исследовали
Исследователи взяли CORA — систему, которая ищет медицинские источники и генерирует ответ с цитатами — и сначала прогнали её на почти 5000 вопросов по дерматологии, сравнив с обычными моделями без поиска (GPT-5, Llama-4, Qwen, Mistral, Gemma). Прирост точности был больше у слабых моделей и на свежих случаях, которые модели не видели при обучении — логично: там где модель "не знает", подсказка источника особенно помогает.
Дальше — главный эксперимент: 46 врачей из 21 страны отвечали на вопросы сначала без помощи, потом видели ответ CORA с цитатами, оценивали, подтверждает ли цитата ответ, и могли поменять свой ответ. Точность выросла с 70,8% до 82,6% — это ожидаемо хорошо.
Но неожиданным оказалось то, что случилось при разбивке по восприятию цитат: когда врач считал цитату подтверждающей, он в разы охотнее принимал совет AI — что отлично, если совет верный (адаптация выросла с 34% до 77%), и катастрофично, если совет неверный (сопротивление упало с 92% до 35%). Именно эта асимметрия — открытие статьи: не сама точность AI, а то, что вид доказательства обманывает одинаково хорошо и когда доказательство настоящее, и когда оно фиктивное.
Ресурсы
CORA (Citation-Oriented Retrieval Assistant) — Tirtha Chanda, Titus J. Brinker и коллеги, German Cancer Research Center (DKFZ), Heidelberg, совместно с University Heidelberg, Medical University of Vienna, NCT Heidelberg и другими. Использован фреймворк appropriate-reliance (Schemmer et al.) для анализа доверия к AI-советам.
