3,583 papers
arXiv:2609.09363 70 8 сент. 2026 г. FREE

Context-Memory Conflict: LLM почти не спорит с данными, которые ей дают — а вот LLM-судья может завраться в разы сильнее

КЛЮЧЕВАЯ СУТЬ
Парадокс: LLM почти не спорит с фальшивыми данными. Разница в точности пересказа правды и вымысла — всего 1%, статистическая погрешность. Но стоит попросить одну модель посудить текст другой — оценки расходятся в 3-4 раза. Просто из-за выбора судьи. Это исследование показывает: если нужна проверка фактов или ревью текста через LLM-судью, доверять одному судье рискованно. Фишка: судья оценивает не сам текст, а своё внутреннее чувство правдоподобности — если сюжет кажется странным, оценка падает даже без реальных ошибок.
Адаптировать под запрос

Модели почти не сопротивляются данным, которые противоречат их внутренним знаниям. Если вы дадите LLM набор фактов — даже заведомо неверных или полностью выдуманных — и попросите написать по ним текст, модель в большинстве случаев послушно перескажет именно эти данные, а не «поправит» их на основе того, что помнит сама. Разница в точности пересказа между реальными фактами и придуманными — на уровне статистической погрешности.

Боль тут в другом месте. Когда вы просите другую модель оценить, насколько первая модель была верна входным данным — например, попросить LLM выступить судьёй качества текста — результат сильно зависит от того, какую модель взяли судьёй. Одна модель-судья (DeepSeek) увидела «эффект недоверия к данным» в 3-4 раза сильнее, чем другая (Kimi K3), хотя обе неплохо совпадали со средними человеческими оценками. То есть проблема не в генераторе текста, а в судье — и по общим метрикам это не видно.

Авторы проверили это на 9 открытых моделях, которые писали тексты по реальным, слегка искажённым и полностью выдуманным фактам на четырёх языках, а потом сверили оценки пяти разных LLM-судей с ручной разметкой людей на отдельной выборке — только так вскрылось, что предубеждение судьи маскируется под «свойство» генератора.

📌

Схема исследования

ШАГ 1: Взять реальные факты (RDF-триплеты) → создать 3 версии
        - Факт (реальный)
        - Контрфакт (тот же факт, но с подменённой сущностью)
        - Вымысел (полностью выдуманная сущность)

ШАГ 2: Попросить 9 моделей написать текст по каждой версии
        → на 4 языках (английский, чешский, словацкий, верхнелужицкий)

ШАГ 3: Попросить 5 разных LLM-судей оценить верность текста исходным данным (шкала 1-5)

ШАГ 4: Сверить оценки судей с ручной разметкой людей
        → выбрать самого надёжного судью

🚀

Пример применения

Задача: Вы делаете подборку отзывов о продукте и просите ChatGPT написать саммари, а потом просите Claude оценить, насколько саммари точно передало отзывы (без доступа к оригиналам, просто «оцени по шкале 1-10, насколько точен пересказ»).

Промпт для проверки надёжности оценки:

Вот оригинальные отзывы:
{отзывы}

Вот саммари, сделанное другой моделью:
{саммари}

Оцени по шкале 1-5, насколько саммари точно передаёт отзывы.
Отдельно укажи: что упущено, что искажено, что добавлено 
и не имеет опоры в оригинале.

Результат: Оценка придёт числом плюс список конкретных несовпадений. Но если вы прогоните тот же промпт через две разные модели-судьи (например, Claude и GPT), числа могут разойтись заметно — не потому что саммари стало хуже, а потому что у судей разная «щедрость» к неточностям. Разница может быть в разы, а не в проценты.


🧠

Почему это работает

LLM обучены продолжать текст в стиле, который им дали в промпте — если вы дали таблицу данных и попросили её пересказать, сильный сигнал «следуй тексту в контексте» обычно перебивает слабый сигнал «а я помню, что это неправда». Модель не «сомневается» вслух, если её явно об этом не просят — она просто выполняет задачу пересказа.

При этом когда модель выступает судьёй, она оценивает не факты, а своё внутреннее ощущение правдоподобности. Если вход кажется судье «странным» или «неправдоподобным», он занижает оценку не из-за реальной неточности текста, а из-за собственного недоверия к сюжету — и это недоверие у разных моделей выражено по-разному.

Рычаг для практики: если вы используете LLM как судью для чего-то важного (проверка фактов, оценка качества, ревью текста) — прогоните оценку через две разные модели и сравните. Если разница большая — доверять единичной оценке рискованно. Явно просить модель «не сомневайся, оценивай построже» почти не помогает — эффект недоверия сидит глубже инструкции.


📋

Шаблон промпта

Для проверки надёжности LLM-судьи используйте кросс-проверку:

Ты оцениваешь текст {текст_1} на соответствие исходным данным {исходные_данные}.
Оцени по шкале 1-5. Не учитывай, кажутся ли данные тебе правдоподобными — 
считай их авторитетными и единственно верными.
Укажи конкретно: что упущено, что искажено, что добавлено без опоры в данных.

Прогоните этот же промпт в двух разных моделях (например, ChatGPT и Claude) и сравните итоговые числа и список замечаний.

🚀 Быстрый старт — вставь в чат:

Мне нужно проверить надёжность оценки [опиши свою задачу: 
например, "верности пересказа отзывов" или "точности перевода"].
Помоги составить промпт-судью, который явно просит модель 
считать входные данные авторитетными и не занижать оценку 
из-за собственного недоверия к содержанию.

[вставить шаблон выше]

LLM спросит, что именно вы оцениваете и по какой шкале — потому что метод работает только если критерий оценки чётко зафиксирован, иначе разные судьи будут расходиться ещё сильнее.


⚠️

Ограничения

⚠️ Инсайт слабый по величине: разница в верности между «правдой» и «выдумкой» — около 1% от шкалы оценки. Это статистически значимо, но практически едва заметно. Не стройте на этом далекоидущие выводы про «недоверие LLM к данным» — эффект скорее теоретический.

⚠️ Инструкция «доверяй только данным» почти не работает: явно попросить модель не спорить с входными данными меняет результат на доли процента. Не тратьте промпт-бюджет на длинные disclaimers — модель это и так делает по умолчанию.

⚠️ Редкие языки/темы страдают по стилю, не по фактам: если работаете с нишевым языком или малоизвестной темой, ожидайте что текст останется точным, но станет менее гладким и естественным — это отдельная проблема от фактической точности.


🔍

Как исследовали

Исследователи взяли реальные вопросы-ответы о местных чешских и словацких фактах (местные знания реже «зашиты» в модель заранее — так честнее проверять) и превратили их в RDF-триплеты: связки вида «субъект-предикат-объект». Из каждого факта сделали три версии — настоящую, с подменённой сущностью и полностью вымышленную, — и попросили 9 открытых моделей написать по ним текст на четырёх языках.

Дальше — самое интересное: чтобы оценить тысячи текстов, авторы использовали LLM-судей, но сначала вручную разметили выборку из 540+108 примеров и проверили, какой судья лучше совпадает с людьми. Оказалось, что DeepSeek неплохо совпадал на тренировочной выборке, но резко «портился» на отложенной — явный признак переобучения промпта под конкретные примеры. Kimi K3 оказался стабильнее и его выбрали основным судьёй.

Самый ценный вывод: на одних и тех же текстах DeepSeek увидел разницу между правдой и вымыслом в 3-4 раза больше, чем Kimi, хотя по общим метрикам согласия с людьми оба судьи выглядели прилично. Это означает, что общая метрика «согласия с человеком» не гарантирует отсутствие систематического перекоса именно в том измерении, которое вас интересует — нужна отдельная проверка на отложенных данных.


🔗

Ресурсы

Do LLMs Make More Mistakes If They Do Not Believe the Input Data? — Peter Kochelka, Aleš Manuel Papáček, Vojtěch Dvořák, Ondřej Dušek. Charles University, Faculty of Mathematics and Physics, Прага. Код и данные: github.com/pkochelka/counterfactual-faithfulness


📋 Дайджест исследования

Ключевая суть

Парадокс: LLM почти не спорит с фальшивыми данными. Разница в точности пересказа правды и вымысла — всего 1%, статистическая погрешность. Но стоит попросить одну модель посудить текст другой — оценки расходятся в 3-4 раза. Просто из-за выбора судьи. Это исследование показывает: если нужна проверка фактов или ревью текста через LLM-судью, доверять одному судье рискованно. Фишка: судья оценивает не сам текст, а своё внутреннее чувство правдоподобности — если сюжет кажется странным, оценка падает даже без реальных ошибок.

Принцип работы

Тут работает два разных механизма. Генератор просто продолжает текст в стиле промпта. Сигнал «следуй контексту» перебивает слабый сигнал «а я помню, что это неправда». Судья — другое дело. Он не сверяет факты построчно, а прикидывает: похожа вся история на правду или нет. Одна и та же неточность у разных судей получает разный вердикт — не потому что текст изменился, а потому что у судей разная «щедрость» к странным сюжетам.

Почему работает

Генератор обучен продолжать текст, а не спорить с ним. Отсюда и мизерная разница — около 1% — между пересказом правды и вымысла. У судьи всё иначе: он оценивает не факт, а внутреннее ощущение «похоже на правду или нет». DeepSeek увидел эффект недоверия в 3-4 раза сильнее, чем Kimi K3. Хотя обе модели неплохо совпадали со средними оценками людей по отдельности. Проблема прячется не в тексте и не в фактах — она прячется в характере конкретного судьи. По обычным метрикам это не видно, пока не сверишь с ручной разметкой людей.

Когда применять

LLM как судья → для проверки фактов, ревью текста, оценки точности пересказа. Особенно когда решение судьи влияет на что-то важное: публикацию, оплату, автоматическую фильтрацию контента. Не подходит как единственный источник истины: один судья без сверки с людьми или второй моделью может выдать искажённую картину, которая выглядит как «проблема текста», а на деле это «характер судьи».

Мини-рецепт

1. Выбери задачу оценки: где нужен LLM-судья — проверка фактов, оценка саммари, ревью текста.
2. Прогони один и тот же промпт через две разные модели: например, ChatGPT и Claude, с одинаковым критерием оценки.
3. Сравни числа: если разница большая — в разы, а не в проценты — доверять единичной оценке рискованно.
4. Зафиксируй критерий чётко: шкала и что именно оценивается, иначе судьи разойдутся ещё сильнее.
5. Не трать промпт-бюджет на дисклеймеры типа «не спорь с данными» — это почти не меняет результат, модель и так следует контексту по умолчанию.

Примеры

[ПЛОХО] : Оцени по шкале 1-10, насколько точно саммари передаёт отзывы.
[ХОРОШО] : Вот оригинальные отзывы: {отзывы}. Вот саммари: {саммари}. Оцени по шкале 1-5 точность передачи. Считай отзывы авторитетными и единственно верными, не занижай оценку за собственное недоверие к содержанию. Укажи отдельно: что упущено, что искажено, что добавлено без опоры в оригинале. Прогони этот же промпт через вторую модель-судью и сравни числа.
Источник: DoLLMs Make More Mistakes If They Do Not Believe the Input Data?
ArXiv ID: 2609.09363 | Сгенерировано: 2026-09-10 04:25

Проблемы LLM

ПроблемаСутьКак обойти
LLM-судья путает правдоподобность с точностьюПросишь модель оценить, насколько текст верен исходным данным. Судья смотрит не на текст, а на то, звучит ли история правдоподобно ему самому. Если данные кажутся судье странными или выдуманными — он занижает оценку, даже если текст пересказал их верно. Разные модели-судьи расходятся в оценке в 3-4 раза на одном и том же тексте. По общим метрикам это незаметно — выглядит как "свойство генератора", а не баг судьиПрогони оценку через двух разных судей (например, две разные модели). Сравни числа. Если разница большая — не доверяй единичной оценке, перепроверь вручную

Методы

МетодСуть
Кросс-проверка судей — ловит скрытую предвзятость оценкиДай одну и ту же пару "текст + исходные данные" двум разным моделям-судьям. Попроси оценить точность по шкале и указать конкретные несовпадения. Оцени по шкале 1-5, считай данные авторитетными, укажи что упущено/искажено/добавлено. Сравни итоговые числа. Большой разброс между судьями = оценке нельзя доверять напрямую, нужна ручная проверка. Почему работает: у каждой модели свой порог "недоверия к сюжету" — то, что одной кажется неправдоподобным, другая пропускает без вопросов. Один судья эту разницу не покажет. Когда применять: факт-чекинг, ревью текста, оценка качества пересказа/перевода — везде где судья работает без доступа к "правильному ответу". Когда не работает: если задача не критичная и разовая оценка приемлема
📖 Простыми словами

DoLLMsMake More Mistakes If They Do Not Believe the Input Data?

arXiv: 2609.09363

Нейросети не страдают от когнитивного диссонанса. Когда ты скармливаешь модели откровенную дичь и просишь сделать выжимку, внимание к контексту намертво глушит её внутреннюю память. Модель не думает «что за чушь мне подсунули» — для неё команда пересказа всегда перевешивает любые фоновые знания о мире.

Это как нанять синхронного переводчика на переговоры: даже если спикер несёт бред про плоскую Землю, переводчик обязан переводить слово в слово, а не спорить с клиентом. Формально всё четко, задача выполнена на отлично — просто потому, что инструкция важнее здравого смысла.

Внутри LLM зашита жесткая иерархия: сильный сигнал следования контексту легко бьёт слабый сигнал параметрической памяти. Дай сетке пачку выдуманных отзывов с задачей «составь саммари» — она послушно выдаст структурированный текст, потому что без прямого триггера на верификацию фактов модель никогда не включит режим скептика.

Тестировали на анализе текстов, но паттерн универсален для любых RAG-систем и контент-пайплайнов. Если ты просишь одну модель оценить точность работы другой без доступа к первоисточнику, она просто сымитирует экспертизу и влепит оценку 10 из 10 на основе красивого слога, полностью проигнорировав реальность.

Главный вывод: никогда не надейся, что AI почует неладное и сам укажет на кривые вводные данные. Хочешь честной валидации — всегда передавай исходники для сверки и явно задавай промпт на фактчекинг. Без этого ты просто получишь инструмент, который виртуозно упакует любую лажу.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с