TL;DR
Исследователи заставили LLM переписывать цитатные предложения в реальных научных статьях — модель видела текст до и после цитаты, но сама цитата и предложение были скрыты, и модель должна была угадать, кого процитировать и как. Это позволило сравнить напрямую: что бы написал человек и что пишет модель на том же самом месте в тексте.
Оказалось: когда автор-человек критикует чужую работу («этот метод не учитывает X»), модель в 12–31% случаев переписывает это как одобрение («этот метод показывает X»). Обратное — превращение похвалы в критику — случается почти в разы реже (4–8%). Модель как бы не умеет спорить — она сглаживает несогласие в нейтральный или хвалебный тон. Плюс модель тянется к раскрученным, старым и известным работам, а не к свежим и нишевым — особенно там, где нужна критика.
Суть в том, что если вы просите LLM написать сравнительный анализ, обзор литературы или критический разбор чьей-то работы — модель по умолчанию сглаживает конфликт. Чтобы получить настоящую критику, а не вежливый пересказ, нужно явно и жёстко прописывать это в промпте.
Схема того, что происходило в исследовании
ШАГ 1: Берём реальную научную статью → вырезаем одно предложение с цитатой,
оставляем контекст (предложение до и после)
ШАГ 2: LLM заполняет пропуск → предлагает автора(ов) и пишет своё предложение
ШАГ 3: Отдельная LLM-судья (без доступа к именам авторов) оценивает тон:
похвала / критика / нейтральное упоминание
ШАГ 4: Сравнивают тон человека и тон модели на том же самом месте текста
Пример применения
Задача: Вы готовите для клиента аналитическую записку — сравнение вашего продукта с конкурентами, где важно честно показать слабые места чужих решений (а не только хвалить всех подряд).
Промпт без учёта находки (типичная ошибка):
Сравни наш подход к автоматизации складского учёта с решениями Ozon и Wildberries.
Укажи сильные и слабые стороны каждого.
Результат без доработки: модель скорее всего опишет всех «в целом хорошо», аккуратно избегая прямой критики конкурентов, и предпочтёт ссылаться на известные крупные кейсы, а не на свежие нишевые примеры.
Промпт с антидотом:
Сравни наш подход к автоматизации складского учёта с решениями Ozon и Wildberries.
Требования:
- Для каждого решения найди минимум одну реальную слабость или ограничение —
не смягчай формулировки, пиши прямо ("не справляется с X", "проигрывает по Y")
- Не ограничивайся только самыми известными и растиражированными кейсами —
включи хотя бы один менее очевидный, более свежий пример
- Явно помечай, где ты хвалишь, а где критикуешь — не сваливай всё в нейтральный тон
Результат: модель выдаст текст с явно разграниченными блоками похвалы и критики по каждому конкуренту, с попыткой включить не только самые «хайповые» примеры, а и менее очевидные.
Почему это работает
LLM обучены быть полезными и не конфликтными — это заложено в их тренировке через обратную связь от людей, которые чаще ставят высокие оценки вежливым и одобрительным ответам. Отсюда привычка модели сглаживать несогласие, даже когда контекст явно требует критики.
При этом модель хорошо умеет следовать явным жёстким инструкциям по формату и тону, если их прописать прямо, а не полагаться на «понимание контекста». Она также по умолчанию тянется к тому, что чаще встречалось в обучающих данных — то есть к известным, растиражированным источникам, а не к свежим и нишевым.
Метод-антидот использует эту сильную сторону: явные инструкции («не смягчай», «найди минимум одну слабость», «включи менее очевидный пример») перекрывают встроенную склонность модели к вежливости и популярности.
Рычаги управления: - Слово «не смягчай формулировки» → убирает автоматическое сглаживание критики - Требование «минимум одна слабость на каждый пункт» → вынуждает модель искать реальные недостатки, а не только достоинства - Просьба «включи менее очевидный/свежий пример» → противодействует тяге к популярным и старым источникам
Ограничения
⚠️ Область применения: находка касается ситуаций, где LLM пишет сравнительный или критический текст со ссылками на реальные источники — обзоры литературы, сравнения продуктов, оценка чужих работ. Для творческих или нейтральных задач эффект не проверялся.
⚠️ Модель может путать факты: при генерации реальных цитат модели в исследовании часто выдумывали или искажали ссылки — от 18% до 60% предложенных источников не удалось найти в реальной базе данных. Если просите модель ссылаться на реальные работы, статистику, кейсы — обязательно проверяйте, существуют ли они.
⚠️ Инструкция не убирает bias полностью, а компенсирует его: явный промпт снижает эффект сглаживания, но не устраняет встроенную склонность модели к вежливости — при длинных диалогах эффект может «выветриваться».
Как исследовали
Команда взяла 1 746 статей с топовых конференций по обработке языка (ACL, EMNLP, NAACL 2025) — из них вырезали 63 944 цитатных контекста с более чем 132 000 отдельных ссылок. Каждое цитатное предложение заменяли на пропуск и просили шесть популярных LLM (GPT-5.1, Claude, Gemini, DeepSeek, Llama-4, Qwen) заполнить его — угадать автора и написать своё предложение.
Важная деталь дизайна: все статьи были опубликованы после даты обучения моделей, так что модель не могла просто «вспомнить» реальную цитату — ей приходилось генерировать её с нуля, опираясь только на контекст. Отдельная LLM-судья (без доступа к именам авторов) размечала тон каждого предложения — похвала, критика или нейтральное упоминание — и её разметка совпадала с оценками трёх людей-разметчиков достаточно хорошо.
Неожиданным оказалось не то, что модели предпочитают известные работы (это уже показывали раньше), а то, что сила этого искажения меняется в зависимости от тона цитаты: при критике модель тянется к особенно старым работам, при нейтральном упоминании — избегает крупных коллективов авторов, при похвале — сильнее всего тянется к самым раскрученным именам. То есть bias не универсален, а «прячется» в разных местах в зависимости от того, что модель пытается сказать.
Ресурсы
Citing Less Critically: LLMs Reshape the Rhetoric and Reach of Scientific Citation — Yixuan Liu, Lin Chen, Zhuoqi Liu, Jianglin Lu, Dakota Murray (Northeastern University, University at Albany SUNY). Код: github.com/liu-yi-xuan/llm_citation_intent/
