3,583 papers
arXiv:2609.04373 71 3 сент. 2026 г. FREE

Капабилити-парадокс: чем умнее модели, тем более одинаково они ошибаются — и это ломает идею "спроси несколько ИИ для разных мнений"

КЛЮЧЕВАЯ СУТЬ
Обнаружено: топовые модели ошибаются не вразнобой, а синхронно. Их «лишняя» реакция на нарратив — та часть ответа, что не связана напрямую с фактами — совпадает почти как у клонов. Причём даже если это GPT, Claude и Gemini от трёх разных компаний. Находка объясняет, почему промпт «собери совет из 5 экспертов» часто даёт иллюзию разных мнений вместо реальной проверки идеи. Дело не в ролях, а в одинаковых данных на входе — подсунь всем пяти «экспертам» один блок вводных, и они дружно унаследуют один и тот же перекос, независимо от бренда модели.
Адаптировать под запрос

TL;DR

Когда несколько ИИ реагируют на одну и ту же информацию, часть их реакции — это правильная реакция на факты, а часть — "лишний" отклик на нарратив, тренд, формулировку. Исследование показало: чем мощнее модель, тем сильнее этот "лишний" отклик совпадает с отликом других мощных моделей. Они не ошибаются вразнобой — они ошибаются синхронно.

Это разрушает интуитивное ожидание "спроси несколько ИИ — получишь взвешенное среднее мнение". Если все советчики — топовые модели, их "лишние" реакции не гасят друг друга статистически, как гасились бы случайные ошибки. Причина простая: топовые модели учились на похожих данных и одинаково настраивались через RLHF, поэтому у них в голове формируются одни и те же ассоциации, даже если это разные компании — OpenAI, Anthropic, Google.

Хуже всего это работает, когда все "советчики" видят один и тот же искажённый контекст (фейковую новость, предвзятый нарратив). Тогда они не просто не спасают друг друга — они усиливают одну и ту же ошибку, и чем больше таких "советчиков" вы добавляете, тем хуже итоговый результат. При этом если контекст правдивый — эффект противоположный: чем больше умных агентов, тем точнее общий результат.


🔬

Схема метода (структура исследования)

RQ1: Коррелируют ли топовые LLM в "нестандартной" части своих реакций?
→ 7 моделей, 64 сценария, замер корреляции остатков после вычета реакции на факт
→ Вывод: да, и корреляция растёт с capability модели

RQ2: Что происходит, если таких моделей в системе становится больше?
→ Симуляция рынка, LLM-трейдеры разной мощности заменяют шумовых трейдеров
→ Вывод: если сигнал верный — чем больше умных агентов, тем точнее система

RQ3: Что если все агенты видят одинаковую (неверную) информацию?
→ Та же симуляция + всем агентам подсовывают одинаковый ложный нарратив
→ Вывод: эффект переворачивается — умные агенты синхронно уходят от истины,
   и чем их больше, тем хуже (хуже, чем просто случайный шум)

🚀

Пример применения

⚠️ Важно: это не промпт-техника, а предупреждение о слабости мультиагентных ИИ-сетапов. Пример показывает, как избежать ловушки.

Задача: Вы делаете промпт "Совет экспертов" — просите ChatGPT симулировать 4-5 разных ролей (финансист, маркетолог, юрист, скептик), чтобы получить разностороннюю оценку идеи открыть кофейню у метро.

Промпт (наивный, с риском):

Представь совет из 5 экспертов: финансовый аналитик, маркетолог, 
юрист, операционный директор, скептик-инвестор. 
Каждый оценивает идею: открыть кофейню у метро Юго-Западная.
Вот вся вводная информация: [один и тот же блок данных о районе, 
конкурентах, ставке аренды — общий для всех].
Дай мнение каждого эксперта.

Результат: Если модель мощная (GPT-5, Claude Opus), "эксперты" внутри одного контекста скорее всего придут к похожим выводам — потому что все они реагируют на одни и те же данные одной и той же "головой". Иллюзия разнообразия мнений будет, а реальной проверки — нет. Если во вводных данных есть перекос (например, заниженная оценка конкуренции), все пять "экспертов" унаследуют эту ошибку одинаково.

Как исправить (сильная зона принципа): давайте разным ролям разные наборы данных или явно просите один-два "агента" оспорить исходные цифры, а не просто надеть разные шляпы на одну и ту же информацию.


🧠

Почему это работает

LLM не спорят по-настоящему — они генерируют текст, продолжающий паттерн роли. Слабость в том, что "лишняя" часть ответа (не связанная напрямую с фактами в промпте) у мощных моделей формируется из похожих внутренних ассоциаций, потому что модели тренировали похожим образом на похожих данных.

Сильная сторона LLM — они хорошо реагируют на явный, чёткий сигнал (цифра, факт, прямое указание). Это подтверждает эксперимент: когда сигнал верный, чем больше LLM-агентов, тем точнее система — они все корректно "тянут" к истине.

Провал происходит там, где нет явного сигнала, а есть нарратив или нейтральная информация — тогда включается "лишняя" реакция, и она у мощных моделей одинаковая. Рычаг управления для вас: разнообразие источников данных для агентов важнее разнообразия ролей/промптов. Также можно специально подмешивать модели разной мощности (не только топовые), чтобы получить реальное расхождение мнений, а не косметическое.


📋

Шаблон промпта

Это не техника, а принцип для дизайна мультиагентных сетапов. Вот шаблон, который использует находку исследования:

Мне нужна проверка идеи: {описание идеи/решения}.

Раунд 1 — соберите позиции с разной вводной:
Агент А получает данные: {набор данных A}
Агент Б получает данные: {немного другой набор данных B — 
другой источник, другой временной срез, другая выборка}
Агент В: специально ищи, что могло быть искажено или 
преувеличено в исходных данных

Раунд 2 — сравните позиции:
Где Агент А и Агент Б расходятся из-за разных данных?
Где все три сходятся, несмотря на разные данные — 
это сильный сигнал, а не совпадение реакции на один контекст?

Дай финальный вывод, отдельно отметив: 
какие выводы держатся на разных источниках данных, 
а какие — на одном общем предположении.

Что подставлять: {описание идеи/решения} — ваша реальная задача; {набор данных} — разные версии контекста (разные статьи, разные периоды, разные источники), а не один и тот же текст для всех агентов.

🚀 Быстрый старт — вставь в чат:

Вот принцип из исследования про мультиагентные ИИ-системы: если все 
"советчики" получают одинаковый контекст, их мнения совпадают не 
потому что это правда, а потому что они одинаково устроены. 
Адаптируй под мою задачу: {твоя задача}. 
Задавай вопросы, чтобы разнообразить вводные данные для каждого агента.

[вставить шаблон выше]

LLM спросит, какие у вас есть разные источники/версии информации для задачи — потому что без разницы во вводных данных мультиагентный промпт превращается в театр, а не в реальную проверку.


⚠️

Ограничения

⚠️ Домен исследования: всё проверено на финансовом рынке (симуляция), где есть чёткая "истина" — фундаментальная цена актива. В задачах без объективной истины (креативные оценки, субъективные советы) механизм может работать иначе — авторы прямо называют это открытым вопросом.

⚠️ Смешивание провайдеров не спасает: интуитивный совет "используй модели от разных компаний для разнообразия" не сработал в исследовании — корреляция ошибок зависит от мощности модели, а не от бренда/провайдера.

⚠️ Не техника, а предупреждение: здесь нет пошагового промпта, который гарантированно решает проблему — только принцип, который нужно применять вручную при дизайне своих мультиагентных сетапов.


🔍

Как исследовали

Команда взяла 7 топовых языковых моделей и прогнала их через 64 финансовых сценария (с разным разрывом между ценой и справедливой стоимостью, трендом, волатильностью). Из каждого ответа вычли "правильную" реакцию на факт (цену) и оставили "лишнюю" часть — и посчитали, насколько эта лишняя часть похожа между парами моделей. Оказалось, что чем выше у модели общий уровень (по MMLU-Pro и рейтингу LMSYS Arena — стандартным замерам общего интеллекта модели, не финансовых знаний), тем сильнее совпадение.

Дальше — агентная симуляция рынка: LLM заменяли "шумовых" (случайных) трейдеров на биржевой площадке с искусственно контролируемой "истинной" ценой актива, которая дважды резко менялась. Пока LLM видели правдивую информацию, чем больше их было в системе, тем точнее рынок отражал реальную цену — это ожидаемо и хорошо. Но когда всем агентам одновременно подсовывали одинаковый ложный нарратив ("аналитики уверены, что актив переоценён на 25-30%"), результат оказался неожиданным: ошибка в оценке цены выросла в 5-7 раз относительно базового уровня, а рынок стал хуже, чем если бы там были просто случайные шумовые трейдеры без всякого интеллекта. Это и есть главный сюрприз: коллективная умная ошибка страшнее коллективной случайной глупости.


🔗

Ресурсы

Why Better Models Can Create Riskier Systems: Evidence from LLM Agents in Financial Markets — Jillian Ross, Eric So, Zoe De Simone, Charles Pozniak, Andrew W. Lo (MIT Sloan, MIT EECS, Harvard Kennedy School). Препринт, 2024-2025.


📋 Дайджест исследования

Ключевая суть

Обнаружено: топовые модели ошибаются не вразнобой, а синхронно. Их «лишняя» реакция на нарратив — та часть ответа, что не связана напрямую с фактами — совпадает почти как у клонов. Причём даже если это GPT, Claude и Gemini от трёх разных компаний. Находка объясняет, почему промпт «собери совет из 5 экспертов» часто даёт иллюзию разных мнений вместо реальной проверки идеи. Дело не в ролях, а в одинаковых данных на входе — подсунь всем пяти «экспертам» один блок вводных, и они дружно унаследуют один и тот же перекос, независимо от бренда модели.

Принцип работы

Правило простое: разнообразие ролей — косметика, разнообразие источников данных — единственное что реально работает. Если в промпте чёткий сигнал (конкретная цифра, факт) — даже 10 топовых агентов дружно тянут к истине, и это прекрасно. Но если сигнал — это нарратив без жёсткого факта, чем больше умных агентов вы добавляете, тем сильнее они синхронно уезжают в одну сторону от правды. Прикол в том, что это работает наоборот интуиции: больше «умных советчиков» не значит больше надёжности.

Почему работает

LLM не спорят по-настоящему — они продолжают текстовый паттерн роли поверх одного и того же контекста. Топ-модели тренировали на похожих данных и одинаково пришлифовывали через дообучение с обратной связью от людей (RLHF). Поэтому их «лишние» ассоциации совпадают, даже если разработчики — разные компании. Смешивание провайдеров (GPT плюс Claude плюс Gemini) не спасает — совпадение ошибок зависит от мощности модели, а не от бренда. Цифры из симуляции рынка жёсткие: при верном сигнале больше умных агентов — точнее цена, при ложном нарративе больше умных агентов — хуже результат, хуже даже случайного шума.

Когда применять

Мультиагентные ИИ-сетапы → конкретно там, где вы просите несколько ролей оценить одну идею на основе общего блока вводных данных. Особенно опасно в финансовых прогнозах, бизнес-оценках и любых задачах без жёсткого проверяемого факта. Не подходит как единственная защита от предвзятости — если у вас нет способа дать агентам разные источники, даже 10 «разных» агентов не спасут от общей ошибки.

Мини-рецепт

1. Меняй данные, не роли: дай каждому агенту свой источник — другую статью, другой временной срез, другую выборку, а не один общий текст.
2. Добавь агента-скептика: <роль>найди что искажено в исходных данных, а не оцени их.
3. Проверяй тип совпадения: если агенты с разными данными сошлись во мнении — это сильный сигнал. Если сошлись агенты с одинаковыми данными — это не сигнал, это эхо одной модели.
4. Не гонись за топовыми моделями ради разнообразия: подмешай модель послабее — она не унаследует те же тонкие ассоциации, что топовая, и даст реальный контраст.

Примеры

[ПЛОХО] : Представь совет из 5 экспертов: финансист, юрист, маркетолог, операционный директор, скептик-инвестор. Вот данные о районе: [один блок текста]. Дай мнение каждого эксперта.
[ХОРОШО] : Агент А — оцени идею по источнику 1: [статья X]. Агент Б — оцени по источнику 2: [статья Y, другой период]. Агент В — найди, что могло быть искажено в обоих источниках. Сравни выводы: где они держатся на разных данных, а где — только на одном общем предположении?
Источник: Why Better Models Can Create Riskier Systems: Evidence from LLM Agents in Financial Markets
ArXiv ID: 2609.04373 | Сгенерировано: 2026-09-07 04:34

Проблемы LLM

ПроблемаСутьКак обойти
Совет из нескольких ИИ создаёт видимость разных мнений, а не реальную проверкуПросишь несколько ролей (или разных моделей) оценить одну идею с одним набором вводных данных. Мощные модели отвечают почти одинаково — они одинаково реагируют на нарратив и тон, независимо от бренда-разработчика (OpenAI, Anthropic, Google). Смена ролей или смена компании не создаёт настоящего разнообразия мнений. Особенно опасно если во вводных есть искажение — все "советчики" унаследуют его одинаково, и чем больше таких агентов — тем хуже итогДай каждому агенту РАЗНЫЙ набор данных, а не разные роли на одинаковых данных. Подмешай модели разной мощности, а не только топовые. Попроси одного агента явно оспорить исходные цифры

Методы

МетодСуть
Разные данные агентам вместо разных ролей — реальная проверка идеиНе давай всем "экспертам" один и тот же блок вводных. Дай каждому свой источник, свой временной срез, свою выборку. Одного агента попроси специально искать искажения в данных. Затем сравни позиции: совпадение несмотря на разные данные — сильный сигнал; расхождение из-за разных данных — повод разобраться. Почему работает: модели хорошо реагируют на явные факты, но одинаково "додумывают" при нехватке информации. Разные данные ломают эту синхронность додумывания. Когда да: нужна реальная проверка гипотезы или решения через несколько ИИ-агентов. Когда нет: задача требует единого консенсуса на одних и тех же фактах

Тезисы

ТезисКомментарий
Чем мощнее модель, тем сильнее её "лишняя" часть ответа совпадает с другими мощными моделямиОтвет модели состоит из двух частей: реакция на явные факты и "лишняя" реакция на нарратив, тон, формулировку. Топовые модели тренированы на похожих данных и настроены похожим образом через дообучение с обратной связью от людей. Поэтому их "лишняя" часть совпадает даже у разных компаний-разработчиков. Применяй: не жди, что несколько топовых моделей на одном контексте дадут независимые мнения — они скорее совпадут, чем усреднятся
📖 Простыми словами

Why BetterModelsCan Create Riskier Systems: Evidence fromLLMAgentsin Financial Markets

arXiv: 2609.04373

Все думают, что толпа умных нейросетей надежнее одной. Это миф: чем мощнее LLM, тем синхроннее они лажают. Модели реагируют не только на сухие факты, но и на формулировки, хайп и скрытый нарратив. Поскольку топовые сетки обучены на одном и том же интернете, их ассоциативные слепые зоны совпадают почти на 100%. Они не выдают независимые мнения — они хором поддаются одинаковым искажениям.

Это как посадить в одну комнату пять отличников из одной элитной школы и спросить их мнение о стартапе. Они не устроят реальный спор — они читали одни и те же модные книжки, мыслят одинаковыми штампами и дружно инвестируют в пустышку с умным видом. Иллюзия консилиума налицо, а реальной независимой проверки нет и в помине.

В исследовании на финансовых рынках это показало катастрофический эффект: возникает синхронизированный шум. Вместо того чтобы компенсировать ошибки друг друга, продвинутые агенты выдают «лишний» отклик на эмоциональный окрас новости в одну и ту же сторону. Слабые модели тупят вразнобой и тем самым гасят общий бред, а сильные — сбиваются в стадный инстинкт и одновременно обваливают систему.

Тестировали на биржевых ботах, но принцип универсален для любых мультиагентных систем. Строишь ли ты консилиум из пяти ИИ-агентов для аудита кода, валидации стартап-идей или юридического анализа — они все страдают от одного недуга. ИИ-эхокамера убивает объективность везде, где один умный алгоритм проверяет выводы другого такого же.

Короче: связка из трех топовых LLM не дает «консенсус экспертов». Ты получаешь не страховку от ошибок, а умноженный системный риск. Если строишь сложную автономную систему, не надейся на одинаковые модели — разбавляй их принципиально разными источниками, жесткими правилами и внешними данными. Иначе твоя дорогая связка агентов пойдет на дно строем и с песней.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с