Модели почти не сопротивляются данным, которые противоречат их внутренним знаниям. Если вы дадите LLM набор фактов — даже заведомо неверных или полностью выдуманных — и попросите написать по ним текст, модель в большинстве случаев послушно перескажет именно эти данные, а не «поправит» их на основе того, что помнит сама. Разница в точности пересказа между реальными фактами и придуманными — на уровне статистической погрешности.
Боль тут в другом месте. Когда вы просите другую модель оценить, насколько первая модель была верна входным данным — например, попросить LLM выступить судьёй качества текста — результат сильно зависит от того, какую модель взяли судьёй. Одна модель-судья (DeepSeek) увидела «эффект недоверия к данным» в 3-4 раза сильнее, чем другая (Kimi K3), хотя обе неплохо совпадали со средними человеческими оценками. То есть проблема не в генераторе текста, а в судье — и по общим метрикам это не видно.
Авторы проверили это на 9 открытых моделях, которые писали тексты по реальным, слегка искажённым и полностью выдуманным фактам на четырёх языках, а потом сверили оценки пяти разных LLM-судей с ручной разметкой людей на отдельной выборке — только так вскрылось, что предубеждение судьи маскируется под «свойство» генератора.
Схема исследования
ШАГ 1: Взять реальные факты (RDF-триплеты) → создать 3 версии
- Факт (реальный)
- Контрфакт (тот же факт, но с подменённой сущностью)
- Вымысел (полностью выдуманная сущность)
ШАГ 2: Попросить 9 моделей написать текст по каждой версии
→ на 4 языках (английский, чешский, словацкий, верхнелужицкий)
ШАГ 3: Попросить 5 разных LLM-судей оценить верность текста исходным данным (шкала 1-5)
ШАГ 4: Сверить оценки судей с ручной разметкой людей
→ выбрать самого надёжного судью
Пример применения
Задача: Вы делаете подборку отзывов о продукте и просите ChatGPT написать саммари, а потом просите Claude оценить, насколько саммари точно передало отзывы (без доступа к оригиналам, просто «оцени по шкале 1-10, насколько точен пересказ»).
Промпт для проверки надёжности оценки:
Вот оригинальные отзывы:
{отзывы}
Вот саммари, сделанное другой моделью:
{саммари}
Оцени по шкале 1-5, насколько саммари точно передаёт отзывы.
Отдельно укажи: что упущено, что искажено, что добавлено
и не имеет опоры в оригинале.
Результат: Оценка придёт числом плюс список конкретных несовпадений. Но если вы прогоните тот же промпт через две разные модели-судьи (например, Claude и GPT), числа могут разойтись заметно — не потому что саммари стало хуже, а потому что у судей разная «щедрость» к неточностям. Разница может быть в разы, а не в проценты.
Почему это работает
LLM обучены продолжать текст в стиле, который им дали в промпте — если вы дали таблицу данных и попросили её пересказать, сильный сигнал «следуй тексту в контексте» обычно перебивает слабый сигнал «а я помню, что это неправда». Модель не «сомневается» вслух, если её явно об этом не просят — она просто выполняет задачу пересказа.
При этом когда модель выступает судьёй, она оценивает не факты, а своё внутреннее ощущение правдоподобности. Если вход кажется судье «странным» или «неправдоподобным», он занижает оценку не из-за реальной неточности текста, а из-за собственного недоверия к сюжету — и это недоверие у разных моделей выражено по-разному.
Рычаг для практики: если вы используете LLM как судью для чего-то важного (проверка фактов, оценка качества, ревью текста) — прогоните оценку через две разные модели и сравните. Если разница большая — доверять единичной оценке рискованно. Явно просить модель «не сомневайся, оценивай построже» почти не помогает — эффект недоверия сидит глубже инструкции.
Шаблон промпта
Для проверки надёжности LLM-судьи используйте кросс-проверку:
Ты оцениваешь текст {текст_1} на соответствие исходным данным {исходные_данные}.
Оцени по шкале 1-5. Не учитывай, кажутся ли данные тебе правдоподобными —
считай их авторитетными и единственно верными.
Укажи конкретно: что упущено, что искажено, что добавлено без опоры в данных.
Прогоните этот же промпт в двух разных моделях (например, ChatGPT и Claude) и сравните итоговые числа и список замечаний.
🚀 Быстрый старт — вставь в чат:
Мне нужно проверить надёжность оценки [опиши свою задачу:
например, "верности пересказа отзывов" или "точности перевода"].
Помоги составить промпт-судью, который явно просит модель
считать входные данные авторитетными и не занижать оценку
из-за собственного недоверия к содержанию.
[вставить шаблон выше]
LLM спросит, что именно вы оцениваете и по какой шкале — потому что метод работает только если критерий оценки чётко зафиксирован, иначе разные судьи будут расходиться ещё сильнее.
Ограничения
⚠️ Инсайт слабый по величине: разница в верности между «правдой» и «выдумкой» — около 1% от шкалы оценки. Это статистически значимо, но практически едва заметно. Не стройте на этом далекоидущие выводы про «недоверие LLM к данным» — эффект скорее теоретический.
⚠️ Инструкция «доверяй только данным» почти не работает: явно попросить модель не спорить с входными данными меняет результат на доли процента. Не тратьте промпт-бюджет на длинные disclaimers — модель это и так делает по умолчанию.
⚠️ Редкие языки/темы страдают по стилю, не по фактам: если работаете с нишевым языком или малоизвестной темой, ожидайте что текст останется точным, но станет менее гладким и естественным — это отдельная проблема от фактической точности.
Как исследовали
Исследователи взяли реальные вопросы-ответы о местных чешских и словацких фактах (местные знания реже «зашиты» в модель заранее — так честнее проверять) и превратили их в RDF-триплеты: связки вида «субъект-предикат-объект». Из каждого факта сделали три версии — настоящую, с подменённой сущностью и полностью вымышленную, — и попросили 9 открытых моделей написать по ним текст на четырёх языках.
Дальше — самое интересное: чтобы оценить тысячи текстов, авторы использовали LLM-судей, но сначала вручную разметили выборку из 540+108 примеров и проверили, какой судья лучше совпадает с людьми. Оказалось, что DeepSeek неплохо совпадал на тренировочной выборке, но резко «портился» на отложенной — явный признак переобучения промпта под конкретные примеры. Kimi K3 оказался стабильнее и его выбрали основным судьёй.
Самый ценный вывод: на одних и тех же текстах DeepSeek увидел разницу между правдой и вымыслом в 3-4 раза больше, чем Kimi, хотя по общим метрикам согласия с людьми оба судьи выглядели прилично. Это означает, что общая метрика «согласия с человеком» не гарантирует отсутствие систематического перекоса именно в том измерении, которое вас интересует — нужна отдельная проверка на отложенных данных.
Ресурсы
Do LLMs Make More Mistakes If They Do Not Believe the Input Data? — Peter Kochelka, Aleš Manuel Papáček, Vojtěch Dvořák, Ondřej Dušek. Charles University, Faculty of Mathematics and Physics, Прага. Код и данные: github.com/pkochelka/counterfactual-faithfulness
