3,583 papers
arXiv:2607.23442 70 26 июля 2026 г. FREE

Prior-argument similarity: LLM в длинных дебатах повторяют старые аргументы новыми словами — особенно на китайском

КЛЮЧЕВАЯ СУТЬ
Обнаружено: в дебатах на 8 раундов LLM после 4-5 реплики начинает пересказывать старые аргументы другими словами — а на китайском языке это происходит стабильно чаще, чем на английском, во всех проверенных моделях и способах измерения. Метод с явной инструкцией на новизну позволяет получать в длинном брейнштроме или дебате реально разные доводы, а не переформулировки уже сказанного. Модель просят на каждом шаге назвать новый пример, механизм или компромисс — конкретное требование работает лучше абстрактного «будь креативнее». Результат — заметно меньше повторов, хотя разрыв между языками не исчезает совсем.
Адаптировать под запрос

TL;DR

Когда LLM ведут многоходовую дискуссию (8 раундов дебатов), позже реплики часто не добавляют новых доводов, а перефразируют то, что уже было сказано раньше — просто другими словами. Исследователи измерили это через смысловую близость аргументов внутри одного диалога, а не через совпадение слов.

Главная находка: на китайском языке это возвращение к старым аргументам происходит стабильно чаще, чем на английском — и это подтвердилось во всех проверках: разных моделях (GPT-5.5, Claude, DeepSeek, Mistral), разных способах измерения смысла, ручной проверке людьми. На испанском, арабском, французском и русском результат нестабильный — то выше английского, то ниже, зависит от способа измерения. А вот с китайским разрыв всегда в одну сторону.

Что можно сделать: добавить в промпт явную инструкцию на разнообразие — попросить модель на каждом шаге ввести хотя бы один новый аргумент, пример, причинный механизм, эффект на заинтересованные стороны или компромисс, и развивать мысль, а не просто повторять её другими словами. Это снижает общий уровень повторов, но не убирает разрыв между языками полностью.


🔬

Схема метода

Diversity-aware промпт (одна инструкция, добавляется к обычному запросу на реплику):

ШАГ 1: Дать модели контекст → мотив/тема + позиция + история предыдущих реплик
ШАГ 2: Добавить инструкцию разнообразия → "введи минимум один новый аргумент/пример/
       механизм/эффект/компромисс, не встречавшийся ранее; развивай, а не повторяй"
ШАГ 3: Получить реплику → модель генерирует новый вклад, а не пересказ

Выполняется в одном промпте, без отдельных запросов.


🚀

Пример применения

Задача: Вы прогоняете в чате длинный брейнсторм-дебат — например, обсуждаете с ассистентом стоит ли вашей компании переходить на 4-дневную рабочую неделю, и просите модель отыграть 6-8 раундов "за" и "против", чтобы собрать все аргументы для внутренней презентации.

Промпт:

Проведи дебаты на тему: "Компании стоит перейти на 4-дневную рабочую неделю".

Роли: Сторона А — за переход, Сторона Б — против.
Формат: 8 раундов (открытие, 3 раунда доводов и контрдоводов, закрытие).

В каждом раунде: введи минимум один новый аргумент, пример, причинный механизм,
эффект на сотрудников/клиентов/бизнес или компромисс, которого не было раньше.
Развивай мысль дальше, а не повторяй ранее сказанное другими словами.

Начинай с открытия Стороны А.

Результат: Модель выдаст 8 реплик по очереди от каждой стороны. По сравнению с обычным запросом без инструкции разнообразия, вы получите больше разных доводов и меньше ситуаций, когда четвёртый раунд просто пересказывает то, что уже прозвучало в первом. Полностью повторов это не убирает — но заметно снижает.


🧠

Почему это работает

LLM в длинном диалоге держит в контексте всю историю реплик, но у неё нет встроенного "счётчика" — что уже было сказано, а что нет. Без явной команды модель по умолчанию выбирает путь наименьшего сопротивления: перефразировать уже прозвучавшую мысль звучит как новый аргумент, но по смыслу это повтор.

Модель хорошо умеет следовать явной инструкции формата — если сказать "введи что-то новое", она реально старается это сделать, потому что это конкретное, проверяемое требование, а не абстрактный призыв "будь креативным".

Метод использует эту сильную сторону: вместо надежды, что модель сама заметит повтор, вы явно называете категории новизны (новый пример, механизм, эффект на стейкхолдера, компромисс) — и модель по каждой из них ищет что добавить, а не что повторить.

Рычаг управления: список категорий новизны можно менять под задачу. Для бизнес-дебата — "эффект на бюджет", "риск для бренда", "прецеденты конкурентов". Для творческого брейнсторма — "новая метафора", "неожиданная аналогия".


📋

Шаблон промпта

Тема/мотив: {тема дебата или обсуждения}
Роли: {сторона А — позиция}, {сторона Б — позиция}
Количество раундов: {число}

Правило для каждой реплики:
Введи минимум один новый {аргумент/пример/причинный механизм/эффект на 
заинтересованные стороны/компромисс}, которого не было в предыдущих репликах.
Развивай мысль дальше, а не повторяй ранее сказанное другими словами.

Начни с реплики {сторона А}, раунд 1.

Плейсхолдеры: {тема дебата} — конкретный вопрос для обсуждения, {число} — сколько раундов реплик, {аргумент/пример/...} — категории новизны, релевантные вашей теме.

🚀 Быстрый старт — вставь в чат:

Вот шаблон для дебатов без повторов. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит какие роли и позиции нужны, сколько раундов, и какие категории новизны релевантны вашей теме — потому что именно эти поля определяют, где искать новый контент на каждом шаге.


⚠️

Ограничения

⚠️ Эффект неполный: инструкция разнообразия снижает общий уровень повторов, но не убирает разрыв между языками — на китайском повторение всё равно выше, чем на английском, даже с этой инструкцией.

⚠️ Метод — диагностика, не гарантия: высокое смысловое сходство между репликами не всегда означает "плохой повтор" — это может быть уместный рефрен, уточнение или ответ на контраргумент. Автоматическая оценка слабо совпадает с человеческой разметкой на уровне отдельных пар реплик.

⚠️ Причина разрыва не установлена: исследование не объясняет, почему именно китайский язык даёт такой эффект — это может быть особенность языка, особенность обучающих данных моделей или геометрия эмбеддингов. Дальнейший анализ показал, что часть эффекта связана с самим языком, но не весь.


🔗

Ресурсы

Huiqian Lai, Syracuse University — "Do LLM Debates Repeat Arguments Differently Across Languages?". Дебаты построены на архиве World Universities Debating Championship (WUDC). Модели: GPT-5.5, Claude Opus 4.7, DeepSeek-V3.2, Mistral Large 3. Оценка смыслового сходства через эмбеддинги BGE-M3, multilingual-E5-large, LaBSE.


📋 Дайджест исследования

Ключевая суть

Обнаружено: в дебатах на 8 раундов LLM после 4-5 реплики начинает пересказывать старые аргументы другими словами — а на китайском языке это происходит стабильно чаще, чем на английском, во всех проверенных моделях и способах измерения. Метод с явной инструкцией на новизну позволяет получать в длинном брейнштроме или дебате реально разные доводы, а не переформулировки уже сказанного. Модель просят на каждом шаге назвать новый пример, механизм или компромисс — конкретное требование работает лучше абстрактного «будь креативнее». Результат — заметно меньше повторов, хотя разрыв между языками не исчезает совсем.

Принцип работы

LLM в диалоге не считает, что уже прозвучало — она просто тянет семантически похожий поток дальше. Без счётчика повторов модель выбирает путь наименьшего сопротивления — перефразировать старую мысль звучит как новый аргумент, а по смыслу это дубль. Явная категория новизны (новый пример, механизм, эффект, компромисс) — конкретное и проверяемое требование, в отличие от размытого «будь оригинальнее». Категории новизны — рычаг: для бизнес-дебата это «эффект на бюджет», для брейншторма — «новая аналогия».

Почему работает

Модель отлично выполняет проверяемые правила формата, но плохо следит за смыслом сама. Просишь просто «продолжай дебаты» — модель держит всю историю в контексте, но не отмечает, что уже сказано. Конкретная категория новизны даёт модели точную цель поиска, а не размытый призыв — и она реально ищет новое, а не переформулирует старое. На китайском разрыв сохраняется даже с этой инструкцией — почему именно, учёные не разобрались, возможно дело в данных обучения или в самой структуре языка.

Когда применять

Длинные диалоги с LLM → многораундовые дебаты, брейнштормы, серии итераций одной темы, особенно когда нужно собрать максимум разных доводов для презентации или анализа. Не подходит для коротких диалогов в 2-3 реплики — там повтор физически не успевает накопиться.

Мини-рецепт

1. Задай тему и роли: Тема: переход на 4-дневную неделю. Сторона А — за, Сторона Б — против
2. Определи число раундов: 6-8 реплик — тот диапазон, где повторы начинают вылезать
3. Впиши категории новизны: новый пример, причинный механизм, эффект на сотрудников/клиентов/бизнес, компромисс
4. Явно запрети пересказ: Развивай мысль дальше, а не повторяй ранее сказанное другими словами

Примеры

[ПЛОХО] : Проведи дебаты на тему перехода на 4-дневную неделю, 8 раундов, за и против
[ХОРОШО] : Проведи дебаты, 8 раундов. В каждой реплике введи минимум один новый аргумент, пример или эффект на сотрудников/бизнес, которого не было раньше. Развивай мысль дальше, а не повторяй ранее сказанное другими словами
Источник: Do LLM Debates Repeat Arguments Differently Across Languages?
ArXiv ID: 2607.23442 | Сгенерировано: 2026-07-28 04:29

Проблемы LLM

ПроблемаСутьКак обойти
В длинном диалоге модель повторяет старые мысли новыми словамиМодель держит в памяти всю историю реплик, но не отслеживает что уже сказано. В долгом брейнсторме, дебатах или серии итераций 4-й, 5-й раунд часто пересказывает 1-й раунд другими словами. Выглядит как новый аргумент, а по смыслу — повтор. Проблема растёт с числом раундовЯвно попроси ввести новую категорию контента на каждом шаге: новый пример, механизм, эффект на кого-то, компромисс. Скажи "развивай мысль, а не переформулируй сказанное"

Методы

МетодСуть
Категории новизны против смысловых повторовНа каждом шаге длинного диалога требуй минимум один новый элемент из конкретного списка: пример, причинный механизм, эффект на заинтересованную сторону, компромисс. "Введи минимум один новый [аргумент/пример/механизм/эффект/компромисс], которого не было ранее". Почему работает: модель хорошо выполняет конкретные проверяемые требования, а не абстрактные призывы вроде "будь креативнее" — конкретную категорию легче проверить и заполнить. Список категорий меняй под задачу: для бизнес-дебата — "риск для бренда", для творческого брейнсторма — "новая метафора". Работает: многораундовые дебаты, брейнштормы, серии итераций (5+ шагов). Не работает как полное решение: снижает повторы, но не убирает их полностью
📖 Простыми словами

DoLLMDebates Repeat Arguments Differently AcrossLanguages?

arXiv: 2607.23442

Когда ты заставляешь нейронку спорить саму с собой в длинном диалоге, она быстро превращается в типичного демагога. Фундаментальная проблема в том, что у LLM нет внутреннего стоп-крана на повторы: она видит историю переписки и искренне считает, что пересказать ту же мысль другими словами — это и есть развитие дискуссии. В итоге вместо глубокого анализа ты получаешь смысловую петлю, где модель просто пережевывает уже сказанное, маскируя это новой лексикой.

Это как бесконечный спор с таксистом о политике: через десять минут ты понимаешь, что он уже в пятый раз прогоняет один и тот же тезис, просто меняя «несправедливо» на «не по-людски». Формально диалог идет, слова меняются, но информационная ценность стремится к нулю. Ты ждешь новых аргументов, а получаешь тот же винегрет, только в профиль — модель просто идет по пути наименьшего сопротивления.

Исследователи копнули вглубь и проверили это через семантическую близость. Оказалось, что в дебатах на 8 раундов модели начинают безбожно лажать: они не просто повторяются, они делают это системно на разных языках. Если ты попросишь нейронку накидать аргументы за четырехдневную рабочую неделю, то к пятому раунду она начнет выдавать перефразированный мусор. Вместо новых данных о продуктивности она будет в сотый раз обсасывать «баланс работы и жизни», просто жонглируя синонимами.

Этот принцип универсален для любого длинного брейншторма или многоходовой проверки гипотез. Тестировали на дебатах, но это касается и написания кода, и создания контент-планов: как только контекст раздувается, когнитивная энтропия берет свое. Ты думаешь, что выжимаешь из AI максимум креатива, а на деле просто смотришь, как он ходит по кругу в пределах одной и той же мыслительной комнаты.

Короче: не надейся, что длинный диалог с моделью автоматически родит истину — после третьего-четвертого раунда начинается информационная деградация. Если хочешь свежих идей, лучше прерывай дебаты и давай новые вводные, иначе рискуешь получить отчет, где 80% текста — это просто эхо первой страницы. Кто не умеет вовремя остановить нейронку, тот тонет в красивой, но пустой воде.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с