3,583 papers
arXiv:2609.01432 75 1 сент. 2026 г. FREE

LLM-цитирование: модели превращают критику в похвалу, когда пишут научные ссылки

КЛЮЧЕВАЯ СУТЬ
TL;DR
Адаптировать под запрос

TL;DR

Исследователи заставили LLM переписывать цитатные предложения в реальных научных статьях — модель видела текст до и после цитаты, но сама цитата и предложение были скрыты, и модель должна была угадать, кого процитировать и как. Это позволило сравнить напрямую: что бы написал человек и что пишет модель на том же самом месте в тексте.

Оказалось: когда автор-человек критикует чужую работу («этот метод не учитывает X»), модель в 12–31% случаев переписывает это как одобрение («этот метод показывает X»). Обратное — превращение похвалы в критику — случается почти в разы реже (4–8%). Модель как бы не умеет спорить — она сглаживает несогласие в нейтральный или хвалебный тон. Плюс модель тянется к раскрученным, старым и известным работам, а не к свежим и нишевым — особенно там, где нужна критика.

Суть в том, что если вы просите LLM написать сравнительный анализ, обзор литературы или критический разбор чьей-то работы — модель по умолчанию сглаживает конфликт. Чтобы получить настоящую критику, а не вежливый пересказ, нужно явно и жёстко прописывать это в промпте.

📌

Схема того, что происходило в исследовании

ШАГ 1: Берём реальную научную статью → вырезаем одно предложение с цитатой,
        оставляем контекст (предложение до и после)
ШАГ 2: LLM заполняет пропуск → предлагает автора(ов) и пишет своё предложение
ШАГ 3: Отдельная LLM-судья (без доступа к именам авторов) оценивает тон:
        похвала / критика / нейтральное упоминание
ШАГ 4: Сравнивают тон человека и тон модели на том же самом месте текста

🚀

Пример применения

Задача: Вы готовите для клиента аналитическую записку — сравнение вашего продукта с конкурентами, где важно честно показать слабые места чужих решений (а не только хвалить всех подряд).

Промпт без учёта находки (типичная ошибка):

Сравни наш подход к автоматизации складского учёта с решениями Ozon и Wildberries. 
Укажи сильные и слабые стороны каждого.

Результат без доработки: модель скорее всего опишет всех «в целом хорошо», аккуратно избегая прямой критики конкурентов, и предпочтёт ссылаться на известные крупные кейсы, а не на свежие нишевые примеры.

Промпт с антидотом:

Сравни наш подход к автоматизации складского учёта с решениями Ozon и Wildberries.

Требования:
- Для каждого решения найди минимум одну реальную слабость или ограничение — 
  не смягчай формулировки, пиши прямо ("не справляется с X", "проигрывает по Y")
- Не ограничивайся только самыми известными и растиражированными кейсами — 
  включи хотя бы один менее очевидный, более свежий пример
- Явно помечай, где ты хвалишь, а где критикуешь — не сваливай всё в нейтральный тон

Результат: модель выдаст текст с явно разграниченными блоками похвалы и критики по каждому конкуренту, с попыткой включить не только самые «хайповые» примеры, а и менее очевидные.


🧠

Почему это работает

LLM обучены быть полезными и не конфликтными — это заложено в их тренировке через обратную связь от людей, которые чаще ставят высокие оценки вежливым и одобрительным ответам. Отсюда привычка модели сглаживать несогласие, даже когда контекст явно требует критики.

При этом модель хорошо умеет следовать явным жёстким инструкциям по формату и тону, если их прописать прямо, а не полагаться на «понимание контекста». Она также по умолчанию тянется к тому, что чаще встречалось в обучающих данных — то есть к известным, растиражированным источникам, а не к свежим и нишевым.

Метод-антидот использует эту сильную сторону: явные инструкции («не смягчай», «найди минимум одну слабость», «включи менее очевидный пример») перекрывают встроенную склонность модели к вежливости и популярности.

Рычаги управления: - Слово «не смягчай формулировки» → убирает автоматическое сглаживание критики - Требование «минимум одна слабость на каждый пункт» → вынуждает модель искать реальные недостатки, а не только достоинства - Просьба «включи менее очевидный/свежий пример» → противодействует тяге к популярным и старым источникам


⚠️

Ограничения

⚠️ Область применения: находка касается ситуаций, где LLM пишет сравнительный или критический текст со ссылками на реальные источники — обзоры литературы, сравнения продуктов, оценка чужих работ. Для творческих или нейтральных задач эффект не проверялся.

⚠️ Модель может путать факты: при генерации реальных цитат модели в исследовании часто выдумывали или искажали ссылки — от 18% до 60% предложенных источников не удалось найти в реальной базе данных. Если просите модель ссылаться на реальные работы, статистику, кейсы — обязательно проверяйте, существуют ли они.

⚠️ Инструкция не убирает bias полностью, а компенсирует его: явный промпт снижает эффект сглаживания, но не устраняет встроенную склонность модели к вежливости — при длинных диалогах эффект может «выветриваться».


🔍

Как исследовали

Команда взяла 1 746 статей с топовых конференций по обработке языка (ACL, EMNLP, NAACL 2025) — из них вырезали 63 944 цитатных контекста с более чем 132 000 отдельных ссылок. Каждое цитатное предложение заменяли на пропуск и просили шесть популярных LLM (GPT-5.1, Claude, Gemini, DeepSeek, Llama-4, Qwen) заполнить его — угадать автора и написать своё предложение.

Важная деталь дизайна: все статьи были опубликованы после даты обучения моделей, так что модель не могла просто «вспомнить» реальную цитату — ей приходилось генерировать её с нуля, опираясь только на контекст. Отдельная LLM-судья (без доступа к именам авторов) размечала тон каждого предложения — похвала, критика или нейтральное упоминание — и её разметка совпадала с оценками трёх людей-разметчиков достаточно хорошо.

Неожиданным оказалось не то, что модели предпочитают известные работы (это уже показывали раньше), а то, что сила этого искажения меняется в зависимости от тона цитаты: при критике модель тянется к особенно старым работам, при нейтральном упоминании — избегает крупных коллективов авторов, при похвале — сильнее всего тянется к самым раскрученным именам. То есть bias не универсален, а «прячется» в разных местах в зависимости от того, что модель пытается сказать.


🔗

Ресурсы

Citing Less Critically: LLMs Reshape the Rhetoric and Reach of Scientific Citation — Yixuan Liu, Lin Chen, Zhuoqi Liu, Jianglin Lu, Dakota Murray (Northeastern University, University at Albany SUNY). Код: github.com/liu-yi-xuan/llm_citation_intent/


Проблемы LLM

ПроблемаСутьКак обойти
Модель превращает критику в похвалу при пересказе чужой работыПросишь описать чужой метод, продукт или статью с недостатками. Модель заметно чаще смягчает или переворачивает критику в одобрение, чем наоборот. Спор и несогласие она передаёт неохотно — тянется к нейтральному или хвалебному тону. Проблема всплывает в обзорах литературы, сравнении продуктов, ревью чужих решений, конкурентном анализе — везде, где нужна честная оценка чужой работыЯвно требуй в промпте: "для каждого пункта укажи минимум одну реальную слабость", "не смягчай формулировки, пиши прямо", "явно помечай где критика, а где похвала"
Модель выбирает известные источники, а не свежие и нишевыеКогда нужно привести пример, кейс или ссылку — модель тянется к раскрученным, старым и широко известным вариантам. Свежие, менее очевидные, нишевые примеры игнорирует, даже если они точнее подходят по контекстуЯвно попроси: "включи хотя бы один менее известный или более свежий пример, не ограничивайся самыми растиражированными случаями"

Методы

МетодСуть
Жёсткие явные инструкции против сглаживания тонаВ промпте прямо пропиши три вещи: (1) "найди минимум одну реальную слабость для каждого пункта, не смягчай формулировки", (2) "включи менее очевидный/свежий пример, не только самые известные", (3) "явно разделяй похвалу и критику, не сваливай в нейтральный тон". Почему работает: модель хорошо выполняет явные жёсткие требования к формату и тону — это перебивает её автоматическую тягу к вежливости и популярным источникам. Когда применять: сравнительные тексты, обзоры, критические разборы, где важна честная оценка. Когда не работает: в длинных диалогах эффект инструкции может ослабевать — нужно периодически напоминать требование
📖 Простыми словами

Citing Less Critically:LLMsReshape the Rhetoric and Reach of Scientific Citation

arXiv: 2609.01432

Нейросети патологически не умеют критиковать. В них намертво вшит RLHF — обучение на отзывах людей, которые вечно ставят лайки за вежливость и позитив. В итоге языковые модели превратились в хронических подлиз: когда в тексте нужно разнести чужую слабую идею или указать на явный косяк, LLM начинает сглаживать углы и сыпать похвалами там, где живой эксперт разнёс бы всё в щепки.

Это как нанять аналитика, который до смерти боится кого-то обидеть. Ты просишь его разобрать слабые места конкурентов, а он возвращается с широкой улыбкой и заявляет, что все вокруг молодцы и очень старались. Формально отчёт сдан, но практической пользы от такой вежливости — ровно ноль.

Исследователи проверили этот баг в лоб: скрыли из реальных научных статей цитаты и заставили LLM восстановить контекст ссылки. Разница оказалась дикой. Там, где учёный-человек прямо писал «метод не работает в базовых сценариях», модель выдавала комплиментарную кашу в духе «авторы внесли выдающийся вклад». Нейросеть на автомате вырезает критическую риторику, превращая научную дискуссию в клуб взаимных комплиментов.

Тестировали на статьях, но грабли одни и те же для любого бизнеса. Тот же провал ждёт тебя в конкурентном анализе, аудите поставщиков или сравнении продуктов. Попросишь модель составить бриф по рынку, а на выходе получишь не жёсткую аналитику, а беззубый рекламный буклет, в котором у каждого безнадёжного продукта найдутся «уникальные преимущества».

Короче: если отдаёшь AI аналитику и фактчекинг, выбивай из него вежливость промптами. Прямо требуй быть токсичным аудитором и искать косяки, иначе скормишь клиенту розовые сопли вместо реальных рисков. Без явного пинка AI правду в глаза не скажет.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с