3,583 papers
arXiv:2608.23541 79 24 авг. 2026 г. FREE

Interaction Tax: как обмен полными ответами между LLM убивает разнообразие решений

КЛЮЧЕВАЯ СУТЬ
Когда несколько разных LLM решают одну задачу и видят полные ответы друг друга, их решения сходятся в одно и то же за один раунд обсуждения — именно то разнообразие, ради которого стоило брать несколько моделей, исчезает. Исследователи называют это налогом на взаимодействие (interaction tax).
Адаптировать под запрос

TL;DR

Когда несколько разных LLM решают одну задачу и видят полные ответы друг друга, их решения сходятся в одно и то же за один раунд обсуждения — именно то разнообразие, ради которого стоило брать несколько моделей, исчезает. Исследователи называют это налогом на взаимодействие (interaction tax).

Боль в том, что дебаты, цепочки критики и другие форматы "AI-агенты обсуждают между собой" — популярный подход, который интуитивно кажется правильным — на деле часто не улучшает результат, а иногда портит его. Модель, увидев чужое решение, начинает подстраиваться под него вместо того, чтобы искать свой путь. В одном из тестов GPT-4o на всех попытках выдавала один и тот же тривиальный, слабый ответ — и после обсуждения все три модели скопировали именно его, хотя у Claude и Gemini были более сильные варианты.

Решение простое: не показывать моделям ответы друг друга до последнего момента. Сгенерировать решения независимо, потом сравнить и выбрать лучшее (или синтезировать одним финальным запросом, где все варианты видны одновременно). Критику давать только тогда, когда ошибку легко найти и конкретно исправить — иначе она может ухудшить хорошее решение.


🔬

Схема метода

ШАГ 1: Дать одинаковую задачу 2-3 разным моделям ОТДЕЛЬНО (без показа чужих ответов) → независимые решения
ШАГ 2: Собрать все решения в одном месте → оценить или синтезировать
ШАГ 3 (опционально): Если нужна критика — просить искать конкретную, проверяемую ошибку, а не общий фидбек

Шаг 1 выполняется в разных чатах/моделях параллельно. Шаг 2 — в отдельном запросе, где все варианты подаются модели одновременно, а не по очереди.


🚀

Пример применения

Задача: Маркетолог распределяет рекламный бюджет 500 000 ₽ между Яндекс Директ, VK Рекламой и Telegram Ads, чтобы максимизировать заявки. Хочется нестандартное, а не шаблонное решение.

Промпт (отдельно в ChatGPT, отдельно в Claude, отдельно в Gemini — без показа друг другу):

У меня 500 000 рублей рекламного бюджета на месяц. Нужно распределить его между 
Яндекс Директом, VK Рекламой и Telegram Ads так, чтобы максимизировать количество 
заявок при среднем чеке 3000 рублей. Аудитория — женщины 25-40, товар — курсы по 
нутрициологии.

Предложи своё распределение бюджета по каналам в рублях и обоснуй логику.

Промпт синтеза (в четвёртом чате, после сбора всех трёх ответов):

Вот три независимых плана распределения рекламного бюджета:

План 1 (ChatGPT): {вставить ответ}
План 2 (Claude): {вставить ответ}
План 3 (Gemini): {вставить ответ}

Оцени каждый по потенциальному количеству заявок и рискам. Выбери лучший план 
целиком ИЛИ собери гибрид, взяв сильные решения из каждого. Обоснуй итоговый выбор.

Результат: Три модели выдадут заметно разные акценты (одна сделает упор на VK, другая — на Telegram, третья предложит нестандартный сплит с тестовым бюджетом). Финальный синтез покажет сравнение всех трёх и итоговое обоснованное решение — вместо того, чтобы все три модели с самого начала сошлись на одном "усреднённом" варианте.


🧠

Почему это работает

Модель, видя чужое готовое решение, не генерирует альтернативу с нуля — она достраивает и подправляет то, что уже перед глазами. Это происходит быстро, буквально за один обмен репликами, а не постепенно.

Сильная сторона разных моделей — они по-разному обучены и находят структурно разные решения одной задачи, если работают в изоляции. Разные модели выигрывали на разных типах задач в исследовании: одна была лучше в геометрических задачах, другая — в комбинаторных.

Метод просто защищает независимость до момента выбора. Как только решения собраны — без всякого "обсуждения" — сравнение или синтез сохраняет то разнообразие, которое дало бы преимущество.

Рычаги управления: - Момент показа чужих ответов → раньше показал = быстрее сходятся, позже (после сбора всех вариантов) = разнообразие сохраняется - Тип обратной связи → полное решение вызывает сильную конвергенцию, оценка/скор — слабее - Критика → полезна только если ошибку легко найти и точечно исправить (например "превышен лимит бюджета на 20%"), для расплывчатых проблем — вредна


📋

Шаблон промпта

Этап 1 — независимая генерация (повторить в 2-3 разных моделях или чатах):

{задача}. 

Предложи своё решение с обоснованием. Работай самостоятельно, без учёта каких-либо 
других мнений.

Этап 2 — синтез (в отдельном чате, после сбора всех ответов):

Вот несколько независимых решений задачи «{задача}»:

Решение 1: {ответ_1}
Решение 2: {ответ_2}
Решение 3: {ответ_3}

Оцени каждое по критерию: {критерий_успеха}.
Выбери лучшее решение целиком ИЛИ собери гибридное решение, взяв сильные части 
из каждого. Обоснуй итоговый выбор.

Подставь: {задача} — конкретная формулировка (маршрут, бюджет, стратегия), {критерий_успеха} — по чему сравнивать (стоимость, риск, скорость, охват).

🚀 Быстрый старт — вставь в чат:

Вот принцип независимой генерации решений разными AI. Помоги мне применить его к 
моей задаче: {твоя задача}. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой критерий использовать для сравнения решений и сколько независимых вариантов собрать — потому что без этого синтез превратится в обычное "усреднение", а не в осознанный выбор.


⚠️

Ограничения

⚠️ Домен исследования узкий: метод проверяли только на задачах с чётким автоматическим "судьёй" — оптимизация маршрутов, упаковка, математические головоломки. Для творческих и субъективных задач (тексты, идеи, стратегии без единственно верного ответа) эффект напрямую не проверялся.

⚠️ Критика работает избирательно: если ошибку легко найти и точечно исправить (например, "превышен лимит по весу") — критика сильно помогает. Если ошибка расплывчатая или требует перебора комбинаций — критика в половине случаев портит уже неплохое решение.

⚠️ Синтез не спасает, если модели сходятся сами: если одна из моделей упорно выдаёт один и тот же слабый, но "безопасный" ответ на любых попытках, финальный синтез рискует скопировать именно его — разнообразие других моделей не поможет.


🔍

Как исследовали

Команда взяла 11 оптимизационных задач с точным автоматическим оценщиком — от упаковки кругов до задачи о рюкзаке — и прогнала их через 10 разных схем взаимодействия: от одиночного запроса до полноценных дебатов, цепочек критики и MoA (независимая генерация + синтез), используя Claude, GPT-4o и Gemini.

Главное измерение — насколько решения разных моделей похожи друг на друга до и после обмена ответами. Оказалось: расстояние между решениями падает почти на треть сразу после первого раунда полного обмена — не постепенно, а мгновенно.

Самое неожиданное: ни одна схема взаимодействия стабильно не побила простой одиночный запрос, кроме MoA — единственной схемы, где модели никогда не видят чужие ответы до момента синтеза. При этом критика поднимала успешность с 0% до 47-73% на задаче с легко находимой ошибкой (рюкзак), но обрушивала её до 0% на задаче, где ошибку сложно локализовать (арифметические прогрессии). Это и натолкнуло авторов на вывод: дело не в количестве агентов, а в том, какую информацию они друг другу показывают и когда.


🔗

Ресурсы

The Interaction Tax: When Communication Erases Diversity in Multi-Agent Teams — Summer Eunhyung Ann, Haokun Liu, Chenhao Tan, University of Chicago. Код и данные: github.com/SummerAnn/interaction-tax


Проблемы LLM

ПроблемаСутьКак обойти
Показ чужого ответа убивает разнообразие решенийНесколько разных моделей решают одну задачу. Если дать им увидеть готовый ответ друг друга — все сходятся на одном варианте за один обмен. Разнообразие, ради которого брали разные модели, пропадает. Модель не генерирует альтернативу — она подправляет то, что уже перед глазамиГенерируй решения от каждой модели отдельно, в разных чатах. Не показывай чужие ответы до момента финального сравнения. Собери все решения одним запросом только в конце — для оценки или синтеза

Методы

МетодСуть
Независимая генерация + отложенный синтезДай одну задачу 2-3 разным моделям отдельно, без показа чужих ответов. Собери все решения в одном финальном запросе — попроси оценить каждое и выбрать лучшее или собрать гибрид. Почему работает: разные модели обучены по-разному и находят структурно разные подходы, если работают изолированно. Ранний показ чужого решения запускает подстройку вместо поиска своего пути. Когда применять: нужно разнообразие вариантов, есть чёткий критерий сравнения на финальном шаге. Когда не работает: если одна из моделей упорно выдаёт один и тот же слабый ответ на любых попытках — синтез рискует скопировать именно его, разнообразие остальных не спасёт

Тезисы

ТезисКомментарий
Критика улучшает решение только если ошибка конкретная и легко исправимаяКогда указываешь на точечную, проверяемую проблему ("превышен лимит бюджета на 20%") — модель точно знает что и как исправить, решение становится лучше. Когда фидбек расплывчатый ("подумай ещё", "можно лучше") — модель начинает переделывать хорошее решение вслепую и часто портит его. Применяй: давай критику только когда можешь назвать точную ошибку и способ её проверить. Для остального — не критикуй, лучше сравнивай готовые варианты
📖 Простыми словами

The Interaction Tax: When Communication Erases Diversity in Multi-AgentTeams

arXiv: 2608.23541

Мультиагентные системы страдают от жесткого группового мышления. Как только ты сводишь несколько разных моделей в один чат и даешь им читать ответы друг друга, их уникальность моментально испаряется. Это чистая механика LLM: видя чужой текст, модель не генерирует альтернативу с нуля, а тупо достраивает и шлифует чужую мысль. Исследователи назвали этот облом налогом на взаимодействие (interaction tax).

Это как устроить брейншторм в офисе, где самый шустрый коллега первым выпаливает банальную идею. Все остальные тут же забивают на свои черновики и начинают коллективно полировать эту чушь. Формально работала вся команда, а по факту вы потратили час на первый попавшийся шаблон. Вместо мозгового штурма получился унылый конформизм.

Разнообразие идей схлопывается в ноль за ровно один раунд обсуждения. Дай трем агентам задачу распределить бюджет в 500 000 рублей между Директом, ВК и Телеграмом — и вместо трех разных смелых гипотез ты получишь одну размазанную кашу. Модели видят чужой вариант, пугаются спорить и выдают усредненное шаблонное решение.

Тестировали на мультиагентных сетях, но принцип универсален: от сложных связок в AutoGen и CrewAI до банального код-ревью. Если заставлять модели «совещаться вслух», никакой синергии не будет — ты просто получишь дорогой генератор банальщины. Единственное, что реально спасает — слепая генерация, когда агенты не знают о существовании ответов коллег.

Короче: хочешь свежих идей — заткни моделям рты и запрети им общаться на старте. Сначала изолированные ответы, потом сведение. Иначе хваленая мультиагентность превратится в слив токенов на ветер и коллективную посредственность.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с