TL;DR
Когда несколько разных LLM решают одну задачу и видят полные ответы друг друга, их решения сходятся в одно и то же за один раунд обсуждения — именно то разнообразие, ради которого стоило брать несколько моделей, исчезает. Исследователи называют это налогом на взаимодействие (interaction tax).
Боль в том, что дебаты, цепочки критики и другие форматы "AI-агенты обсуждают между собой" — популярный подход, который интуитивно кажется правильным — на деле часто не улучшает результат, а иногда портит его. Модель, увидев чужое решение, начинает подстраиваться под него вместо того, чтобы искать свой путь. В одном из тестов GPT-4o на всех попытках выдавала один и тот же тривиальный, слабый ответ — и после обсуждения все три модели скопировали именно его, хотя у Claude и Gemini были более сильные варианты.
Решение простое: не показывать моделям ответы друг друга до последнего момента. Сгенерировать решения независимо, потом сравнить и выбрать лучшее (или синтезировать одним финальным запросом, где все варианты видны одновременно). Критику давать только тогда, когда ошибку легко найти и конкретно исправить — иначе она может ухудшить хорошее решение.
Схема метода
ШАГ 1: Дать одинаковую задачу 2-3 разным моделям ОТДЕЛЬНО (без показа чужих ответов) → независимые решения
ШАГ 2: Собрать все решения в одном месте → оценить или синтезировать
ШАГ 3 (опционально): Если нужна критика — просить искать конкретную, проверяемую ошибку, а не общий фидбек
Шаг 1 выполняется в разных чатах/моделях параллельно. Шаг 2 — в отдельном запросе, где все варианты подаются модели одновременно, а не по очереди.
Пример применения
Задача: Маркетолог распределяет рекламный бюджет 500 000 ₽ между Яндекс Директ, VK Рекламой и Telegram Ads, чтобы максимизировать заявки. Хочется нестандартное, а не шаблонное решение.
Промпт (отдельно в ChatGPT, отдельно в Claude, отдельно в Gemini — без показа друг другу):
У меня 500 000 рублей рекламного бюджета на месяц. Нужно распределить его между
Яндекс Директом, VK Рекламой и Telegram Ads так, чтобы максимизировать количество
заявок при среднем чеке 3000 рублей. Аудитория — женщины 25-40, товар — курсы по
нутрициологии.
Предложи своё распределение бюджета по каналам в рублях и обоснуй логику.
Промпт синтеза (в четвёртом чате, после сбора всех трёх ответов):
Вот три независимых плана распределения рекламного бюджета:
План 1 (ChatGPT): {вставить ответ}
План 2 (Claude): {вставить ответ}
План 3 (Gemini): {вставить ответ}
Оцени каждый по потенциальному количеству заявок и рискам. Выбери лучший план
целиком ИЛИ собери гибрид, взяв сильные решения из каждого. Обоснуй итоговый выбор.
Результат: Три модели выдадут заметно разные акценты (одна сделает упор на VK, другая — на Telegram, третья предложит нестандартный сплит с тестовым бюджетом). Финальный синтез покажет сравнение всех трёх и итоговое обоснованное решение — вместо того, чтобы все три модели с самого начала сошлись на одном "усреднённом" варианте.
Почему это работает
Модель, видя чужое готовое решение, не генерирует альтернативу с нуля — она достраивает и подправляет то, что уже перед глазами. Это происходит быстро, буквально за один обмен репликами, а не постепенно.
Сильная сторона разных моделей — они по-разному обучены и находят структурно разные решения одной задачи, если работают в изоляции. Разные модели выигрывали на разных типах задач в исследовании: одна была лучше в геометрических задачах, другая — в комбинаторных.
Метод просто защищает независимость до момента выбора. Как только решения собраны — без всякого "обсуждения" — сравнение или синтез сохраняет то разнообразие, которое дало бы преимущество.
Рычаги управления: - Момент показа чужих ответов → раньше показал = быстрее сходятся, позже (после сбора всех вариантов) = разнообразие сохраняется - Тип обратной связи → полное решение вызывает сильную конвергенцию, оценка/скор — слабее - Критика → полезна только если ошибку легко найти и точечно исправить (например "превышен лимит бюджета на 20%"), для расплывчатых проблем — вредна
Шаблон промпта
Этап 1 — независимая генерация (повторить в 2-3 разных моделях или чатах):
{задача}.
Предложи своё решение с обоснованием. Работай самостоятельно, без учёта каких-либо
других мнений.
Этап 2 — синтез (в отдельном чате, после сбора всех ответов):
Вот несколько независимых решений задачи «{задача}»:
Решение 1: {ответ_1}
Решение 2: {ответ_2}
Решение 3: {ответ_3}
Оцени каждое по критерию: {критерий_успеха}.
Выбери лучшее решение целиком ИЛИ собери гибридное решение, взяв сильные части
из каждого. Обоснуй итоговый выбор.
Подставь: {задача} — конкретная формулировка (маршрут, бюджет, стратегия), {критерий_успеха} — по чему сравнивать (стоимость, риск, скорость, охват).
🚀 Быстрый старт — вставь в чат:
Вот принцип независимой генерации решений разными AI. Помоги мне применить его к
моей задаче: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какой критерий использовать для сравнения решений и сколько независимых вариантов собрать — потому что без этого синтез превратится в обычное "усреднение", а не в осознанный выбор.
Ограничения
⚠️ Домен исследования узкий: метод проверяли только на задачах с чётким автоматическим "судьёй" — оптимизация маршрутов, упаковка, математические головоломки. Для творческих и субъективных задач (тексты, идеи, стратегии без единственно верного ответа) эффект напрямую не проверялся.
⚠️ Критика работает избирательно: если ошибку легко найти и точечно исправить (например, "превышен лимит по весу") — критика сильно помогает. Если ошибка расплывчатая или требует перебора комбинаций — критика в половине случаев портит уже неплохое решение.
⚠️ Синтез не спасает, если модели сходятся сами: если одна из моделей упорно выдаёт один и тот же слабый, но "безопасный" ответ на любых попытках, финальный синтез рискует скопировать именно его — разнообразие других моделей не поможет.
Как исследовали
Команда взяла 11 оптимизационных задач с точным автоматическим оценщиком — от упаковки кругов до задачи о рюкзаке — и прогнала их через 10 разных схем взаимодействия: от одиночного запроса до полноценных дебатов, цепочек критики и MoA (независимая генерация + синтез), используя Claude, GPT-4o и Gemini.
Главное измерение — насколько решения разных моделей похожи друг на друга до и после обмена ответами. Оказалось: расстояние между решениями падает почти на треть сразу после первого раунда полного обмена — не постепенно, а мгновенно.
Самое неожиданное: ни одна схема взаимодействия стабильно не побила простой одиночный запрос, кроме MoA — единственной схемы, где модели никогда не видят чужие ответы до момента синтеза. При этом критика поднимала успешность с 0% до 47-73% на задаче с легко находимой ошибкой (рюкзак), но обрушивала её до 0% на задаче, где ошибку сложно локализовать (арифметические прогрессии). Это и натолкнуло авторов на вывод: дело не в количестве агентов, а в том, какую информацию они друг другу показывают и когда.
Ресурсы
The Interaction Tax: When Communication Erases Diversity in Multi-Agent Teams — Summer Eunhyung Ann, Haokun Liu, Chenhao Tan, University of Chicago. Код и данные: github.com/SummerAnn/interaction-tax
