TL;DR
Когда несколько ИИ реагируют на одну и ту же информацию, часть их реакции — это правильная реакция на факты, а часть — "лишний" отклик на нарратив, тренд, формулировку. Исследование показало: чем мощнее модель, тем сильнее этот "лишний" отклик совпадает с отликом других мощных моделей. Они не ошибаются вразнобой — они ошибаются синхронно.
Это разрушает интуитивное ожидание "спроси несколько ИИ — получишь взвешенное среднее мнение". Если все советчики — топовые модели, их "лишние" реакции не гасят друг друга статистически, как гасились бы случайные ошибки. Причина простая: топовые модели учились на похожих данных и одинаково настраивались через RLHF, поэтому у них в голове формируются одни и те же ассоциации, даже если это разные компании — OpenAI, Anthropic, Google.
Хуже всего это работает, когда все "советчики" видят один и тот же искажённый контекст (фейковую новость, предвзятый нарратив). Тогда они не просто не спасают друг друга — они усиливают одну и ту же ошибку, и чем больше таких "советчиков" вы добавляете, тем хуже итоговый результат. При этом если контекст правдивый — эффект противоположный: чем больше умных агентов, тем точнее общий результат.
Схема метода (структура исследования)
RQ1: Коррелируют ли топовые LLM в "нестандартной" части своих реакций?
→ 7 моделей, 64 сценария, замер корреляции остатков после вычета реакции на факт
→ Вывод: да, и корреляция растёт с capability модели
RQ2: Что происходит, если таких моделей в системе становится больше?
→ Симуляция рынка, LLM-трейдеры разной мощности заменяют шумовых трейдеров
→ Вывод: если сигнал верный — чем больше умных агентов, тем точнее система
RQ3: Что если все агенты видят одинаковую (неверную) информацию?
→ Та же симуляция + всем агентам подсовывают одинаковый ложный нарратив
→ Вывод: эффект переворачивается — умные агенты синхронно уходят от истины,
и чем их больше, тем хуже (хуже, чем просто случайный шум)
Пример применения
⚠️ Важно: это не промпт-техника, а предупреждение о слабости мультиагентных ИИ-сетапов. Пример показывает, как избежать ловушки.
Задача: Вы делаете промпт "Совет экспертов" — просите ChatGPT симулировать 4-5 разных ролей (финансист, маркетолог, юрист, скептик), чтобы получить разностороннюю оценку идеи открыть кофейню у метро.
Промпт (наивный, с риском):
Представь совет из 5 экспертов: финансовый аналитик, маркетолог,
юрист, операционный директор, скептик-инвестор.
Каждый оценивает идею: открыть кофейню у метро Юго-Западная.
Вот вся вводная информация: [один и тот же блок данных о районе,
конкурентах, ставке аренды — общий для всех].
Дай мнение каждого эксперта.
Результат: Если модель мощная (GPT-5, Claude Opus), "эксперты" внутри одного контекста скорее всего придут к похожим выводам — потому что все они реагируют на одни и те же данные одной и той же "головой". Иллюзия разнообразия мнений будет, а реальной проверки — нет. Если во вводных данных есть перекос (например, заниженная оценка конкуренции), все пять "экспертов" унаследуют эту ошибку одинаково.
Как исправить (сильная зона принципа): давайте разным ролям разные наборы данных или явно просите один-два "агента" оспорить исходные цифры, а не просто надеть разные шляпы на одну и ту же информацию.
Почему это работает
LLM не спорят по-настоящему — они генерируют текст, продолжающий паттерн роли. Слабость в том, что "лишняя" часть ответа (не связанная напрямую с фактами в промпте) у мощных моделей формируется из похожих внутренних ассоциаций, потому что модели тренировали похожим образом на похожих данных.
Сильная сторона LLM — они хорошо реагируют на явный, чёткий сигнал (цифра, факт, прямое указание). Это подтверждает эксперимент: когда сигнал верный, чем больше LLM-агентов, тем точнее система — они все корректно "тянут" к истине.
Провал происходит там, где нет явного сигнала, а есть нарратив или нейтральная информация — тогда включается "лишняя" реакция, и она у мощных моделей одинаковая. Рычаг управления для вас: разнообразие источников данных для агентов важнее разнообразия ролей/промптов. Также можно специально подмешивать модели разной мощности (не только топовые), чтобы получить реальное расхождение мнений, а не косметическое.
Шаблон промпта
Это не техника, а принцип для дизайна мультиагентных сетапов. Вот шаблон, который использует находку исследования:
Мне нужна проверка идеи: {описание идеи/решения}.
Раунд 1 — соберите позиции с разной вводной:
Агент А получает данные: {набор данных A}
Агент Б получает данные: {немного другой набор данных B —
другой источник, другой временной срез, другая выборка}
Агент В: специально ищи, что могло быть искажено или
преувеличено в исходных данных
Раунд 2 — сравните позиции:
Где Агент А и Агент Б расходятся из-за разных данных?
Где все три сходятся, несмотря на разные данные —
это сильный сигнал, а не совпадение реакции на один контекст?
Дай финальный вывод, отдельно отметив:
какие выводы держатся на разных источниках данных,
а какие — на одном общем предположении.
Что подставлять: {описание идеи/решения} — ваша реальная задача; {набор данных} — разные версии контекста (разные статьи, разные периоды, разные источники), а не один и тот же текст для всех агентов.
🚀 Быстрый старт — вставь в чат:
Вот принцип из исследования про мультиагентные ИИ-системы: если все
"советчики" получают одинаковый контекст, их мнения совпадают не
потому что это правда, а потому что они одинаково устроены.
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы разнообразить вводные данные для каждого агента.
[вставить шаблон выше]
LLM спросит, какие у вас есть разные источники/версии информации для задачи — потому что без разницы во вводных данных мультиагентный промпт превращается в театр, а не в реальную проверку.
Ограничения
⚠️ Домен исследования: всё проверено на финансовом рынке (симуляция), где есть чёткая "истина" — фундаментальная цена актива. В задачах без объективной истины (креативные оценки, субъективные советы) механизм может работать иначе — авторы прямо называют это открытым вопросом.
⚠️ Смешивание провайдеров не спасает: интуитивный совет "используй модели от разных компаний для разнообразия" не сработал в исследовании — корреляция ошибок зависит от мощности модели, а не от бренда/провайдера.
⚠️ Не техника, а предупреждение: здесь нет пошагового промпта, который гарантированно решает проблему — только принцип, который нужно применять вручную при дизайне своих мультиагентных сетапов.
Как исследовали
Команда взяла 7 топовых языковых моделей и прогнала их через 64 финансовых сценария (с разным разрывом между ценой и справедливой стоимостью, трендом, волатильностью). Из каждого ответа вычли "правильную" реакцию на факт (цену) и оставили "лишнюю" часть — и посчитали, насколько эта лишняя часть похожа между парами моделей. Оказалось, что чем выше у модели общий уровень (по MMLU-Pro и рейтингу LMSYS Arena — стандартным замерам общего интеллекта модели, не финансовых знаний), тем сильнее совпадение.
Дальше — агентная симуляция рынка: LLM заменяли "шумовых" (случайных) трейдеров на биржевой площадке с искусственно контролируемой "истинной" ценой актива, которая дважды резко менялась. Пока LLM видели правдивую информацию, чем больше их было в системе, тем точнее рынок отражал реальную цену — это ожидаемо и хорошо. Но когда всем агентам одновременно подсовывали одинаковый ложный нарратив ("аналитики уверены, что актив переоценён на 25-30%"), результат оказался неожиданным: ошибка в оценке цены выросла в 5-7 раз относительно базового уровня, а рынок стал хуже, чем если бы там были просто случайные шумовые трейдеры без всякого интеллекта. Это и есть главный сюрприз: коллективная умная ошибка страшнее коллективной случайной глупости.
Ресурсы
Why Better Models Can Create Riskier Systems: Evidence from LLM Agents in Financial Markets — Jillian Ross, Eric So, Zoe De Simone, Charles Pozniak, Andrew W. Lo (MIT Sloan, MIT EECS, Harvard Kennedy School). Препринт, 2024-2025.
