3,583 papers
arXiv:2608.06108 73 6 авг. 2026 г. FREE

Consensus Bias: почему топовые LLM проигрывают в реальной торговле, хотя лучше всех сдают экзамены

КЛЮЧЕВАЯ СУТЬ
Модели, которые лучше всех решают тесты (GPT-5, Claude Sonnet 4.5), торгуют на бирже хуже, чем модели с более низким баллом на бенчмарках (DeepSeek-V3). Причина — при генерации текста модель тянется к статистическому консенсусу обучающих данных, то есть повторяет то, что уже заложено в цену рынком, вместо того, чтобы искать независимый, контрарный взгляд, который и даёт прибыль.
Адаптировать под запрос

TL;DR

Модели, которые лучше всех решают тесты (GPT-5, Claude Sonnet 4.5), торгуют на бирже хуже, чем модели с более низким баллом на бенчмарках (DeepSeek-V3). Причина — при генерации текста модель тянется к статистическому консенсусу обучающих данных, то есть повторяет то, что уже заложено в цену рынком, вместо того, чтобы искать независимый, контрарный взгляд, который и даёт прибыль.

Боль конкретна: в живом 7-недельном эксперименте GPT-5 закрылся в минус 1%, Claude Sonnet 4.5 — почти в нуле, оба хуже пассивного индекса S&P 500 (+4.3%). При этом у обоих моделей был доступ к тем же новостям, что и у человека-эксперта (Кэти Вуд, Билл Миллер), которые заработали +8-10% за тот же период на тех же событиях. Вторая находка — Reasoning Fragmentation: когда модели заваливают большим объёмом разнородных новостей, они скатываются в узкое, негибкое мышление и упускают переломные моменты рынка, вместо того чтобы связать события в цельную картину наперёд.

Решение авторов — не промпт-техника, а диагностический фреймворк P→E→R→D→O (Профиль инвестора → Событие → Рассуждение → Решение → Результат), который заставляет модель явно проходить все этапы принятия решения, а не просто выдавать вывод. Из этого можно вытащить практический принцип: если хочешь от LLM нетривиальный анализ — нужно явно просить её не соглашаться с общим мнением, а искать contrarian-взгляд.


🔬

Схема метода (фреймворк P→E→R→D→O)

ШАГ 1: Person → задай профиль (кто принимает решение, какие ограничения, риск-профиль)
ШАГ 2: Events → дай модели сырые, необработанные события (новости, данные)
ШАГ 3: Reasoning → попроси связать события в единую логическую нить, отделяя шум от сигнала
ШАГ 4: Decision → конкретное действие, вытекающее из Reasoning
ШАГ 5: Outcome → прогноз результата и условие, при котором тезис будет неверным

Все 5 шагов — в одном промпте, последовательно.


🚀

Пример применения

Задача: Ты ведёшь Telegram-канал про инвестиции и хочешь получить от Claude не "консенсусный" разбор новости, а острый, contrarian-взгляд — как делают частные аналитики типа Финансиста или ФинЖени.

Промпт:

Ты — независимый инвестиционный аналитик с профилем: агрессивный риск-аппетит, 
горизонт 1-3 месяца, специализация — российский рынок акций.

Вот событие: Центробанк неожиданно снизил ключевую ставку на 200 б.п. 
Рынок отреагировал ростом индекса Мосбиржи на 3%.

Пройди по цепочке:
1. EVENTS — перечисли 3-5 фактов из новости, включая менее заметные детали, 
   не только заголовок.
2. REASONING — свяжи эти факты в тезис. ВАЖНО: не повторяй очевидный консенсус 
   "рынок вырастет". Найди, где консенсус может ошибаться — что рынок 
   недооценил или переоценил.
3. DECISION — конкретное действие: какие сектора/акции, лонг или шорт.
4. Условие провала — при каком развитии событий твой тезис окажется неверным.

Отвечай по пунктам, без общих фраз типа "требуется дальнейший анализ".

Результат: Модель выдаст структурированный разбор из 4 блоков. В блоке REASONING явное требование "не повторяй консенсус" заставит модель искать контраргумент, а не просто пересказывать очевидную реакцию рынка. Условие провала в конце — защита от того, что модель выдаст один уверенный сценарий без критики самого себя.


🧠

Почему это работает

LLM обучена предсказывать следующее слово так, чтобы текст был правдоподобным, а не чтобы решение было выгодным. Поэтому, если не задать иначе, модель выдаёт самый вероятный (= консенсусный) вывод — то же самое, что уже думают все и что уже заложено в цену. Прибыль же требует ровно противоположного: увидеть то, что рынок ещё не заметил.

Модель хорошо умеет следовать явной структуре рассуждения, если её задать словами. Именно это использует фреймворк P→E→R→D→O — он не даёт модели "просто ответить", а заставляет пройти шаги, включая явный запрос на контрарность и самопроверку через условие провала.

Рычаги управления: - Убери фразу "не повторяй консенсус" → получишь усреднённый, безопасный ответ (полезно для проверки базового мнения рынка) - Добавь "условие провала" в конец → модель честнее оценивает риски своего же тезиса - Задай конкретный профиль риска (агрессивный/консервативный) вместо общего "инвестор" → острее и специфичнее решение


📋

Шаблон промпта

Ты — {роль: инвестор/аналитик/консультант} с профилем: {риск-профиль}, 
горизонт {срок}, специализация {область}.

Вот событие: {описание события/новости}.

Пройди по цепочке:
1. СОБЫТИЯ — перечисли {число} фактов, включая неочевидные детали.
2. РАССУЖДЕНИЕ — свяжи факты в тезис. Не повторяй общепринятое мнение — 
   найди, где консенсус может ошибаться.
3. РЕШЕНИЕ — конкретное действие.
4. Условие, при котором тезис окажется неверным.

🚀 Быстрый старт — вставь в чат:

Вот шаблон фреймворка P→E→R→D→O для инвестиционного/аналитического рассуждения. 
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про твой риск-профиль, горизонт анализа и конкретное событие — потому что без этих деталей модель не сможет построить цепочку рассуждения и скатится в общие фразы.


⚠️

Ограничения

⚠️ Не гарантирует прибыль: фреймворк структурирует мышление модели, но не даёт ей доступа к реальным рыночным данным в реальном времени — без актуальных новостей "contrarian взгляд" может быть просто неверным.

⚠️ Работает хуже при перегрузке данными: если дать модели слишком много разнородных новостей одновременно, она склонна теряться (авторы называют это Reasoning Fragmentation) — лучше давать события порционно, по одному кластеру за раз.

⚠️ Contrarian-инструкция не панацея: явный запрос "не повторяй консенсус" может заставить модель искать противоречие искусственно, даже когда консенсус верен — используй как один из инструментов, не как правило.


🔍

Как исследовали

Исследователи запустили живую 7-недельную торговую арену (19 ноября 2025 — 9 января 2026), где пять LLM (GPT-5, Claude Sonnet 4.5, DeepSeek-V3, Qwen3-Max, Gemini 2.5 Pro) торговали настоящими рыночными данными с капиталом $10,000 каждая, соревнуясь с двумя реальными инвесторами — Биллом Миллером и Кэти Вуд. Модели сами искали новости и данные через инструменты поиска, что убрало эффект "подгонки под прошлое".

Параллельно команда собрала бенчмарк из 201 247 размеченных инвестиционных решений от 151 реального инвестора — каждое решение разложено на цепочку Событие→Рассуждение→Решение→Результат. Модели тестировали на задаче "дай инвестиционный тезис по свежим событиям" и сравнивали с реальными решениями экспертов через LLM-судью.

Удивительный результат: модели с лучшими баллами на общих бенчмарках (GPT-5: 73.5, Claude: 77.2) показали худшую прибыль, а модель с более низким баллом (DeepSeek-V3: 64.6) заработала +14.2% — больше индекса S&P 500. Разбор конкретных решений показал: провальные модели либо фиксировались на самой громкой новости, либо выдавали общие фразы без специфики, тогда как человек-эксперт связывал разные источники (отчёты о прибыли, геополитику, отраслевые данные) в цельную картину.


Проблемы LLM

ПроблемаСутьКак обойти
Модель по умолчанию выдаёт консенсусный ответ (Consensus Bias)LLM училась предсказывать самое вероятное продолжение текста. Самое вероятное — это то, что уже думает большинство. Когда просишь прогноз или анализ, модель выдаёт то, что уже заложено в ожидания рынка/аудитории. Ценность анализа — увидеть то, что все пропустили. Без специальной инструкции модель сама никогда не пойдёт против общего мненияПрямо проси искать альтернативный взгляд: "не повторяй общепринятое мнение, найди где консенсус может ошибаться". В конце добавь пункт "условие провала" — при каком сценарии вывод окажется неверным
Рассуждение рассыпается при перегрузке разнородными данными (Reasoning Fragmentation)Когда даёшь модели много разных фактов, новостей, событий сразу, она не связывает их в одну картину. Рассуждает узко, кусками. Пропускает переломные моменты и общую логику. Ломается именно от объёма и разнородности входных данных, не от длины текста как таковогоПодавай данные порциями, по смысловым кластерам, а не всё сразу. После каждой порции проси обновить единый тезис, а не начинать рассуждение заново

Методы

МетодСуть
Контрарный запрос + условие провалаПроси модель искать альтернативу общепринятому мнению и в конце указать условие, при котором её вывод окажется неверным. Не повторяй консенсус — найди, где общее мнение может ошибаться + Укажи условие, при котором твой тезис будет неверным. Почему работает: модель хорошо следует явно заданной структуре рассуждения, но без инструкции выдаёт самый вероятный (усреднённый) ответ. Явный запрос на контрарность ломает эту склонность. Условие провала заставляет модель критично оценить собственный вывод, а не выдать один уверенный сценарий без самопроверки. Работает: анализ, прогнозы, оценка рисков, критика идей — где нужен нетривиальный взгляд. Не работает: задачи с объективно правильным ответом (факт-чек, расчёты) — там искусственный поиск противоречия только вредит
📖 Простыми словами

Evaluating Investment Logic inLargeLanguageModels: A Real-World Benchmark Towards Personalzied FinancialAgents

arXiv: 2608.06108

Твои любимые нейронки — это отличные отличники, которые на бирже превращаются в полных лохов. Исследование 2608.06108 вскрыло фундаментальный баг: модели вроде GPT-4 или Claude 3.5, которые щелкают тесты как орешки, в реальном трейдинге сливают тем, кто в рейтингах стоит ниже, например DeepSeek-V3. Проблема в самой природе LLM: они обучены быть «нормальными» и предсказуемыми, а рынок наказывает за нормальность. Модель просто выдает самый вероятный текст, который по сути является статистическим консенсусом, то есть пересказом того, что уже и так знают все вокруг.

Это как если бы ты пришел за советом к мудрому старцу, а он просто зачитал тебе вчерашнюю газету. Формально не придерешься, всё логично и складно, но толку ноль, потому что эта информация уже в цене. В инвестициях ты зарабатываешь только тогда, когда видишь то, чего не видят остальные, а нейронка по определению пытается быть максимально похожей на большинство. Она стремится к «правильному» ответу из учебника, в то время как прибыль лежит в зоне неправильных, контрарных решений.

Чтобы заставить AI работать на твой кошелек, нужно выбивать его из этой зоны комфорта через специфические промпты на поиск аномалий. Вместо того чтобы спрашивать «что будет с акциями Apple», нужно требовать анализ скрытых рисков или «взгляд вопреки рынку». Если не задать жесткую установку на поиск противоречий, модель выдаст тебе «безопасный» прогноз, который на деле — просто белый шум, ведущий к убыткам. Эффективность здесь измеряется не красотой слога, а способностью модели идти против толпы, что для стандартно обученного AI — задача почти противоестественная.

Этот принцип универсален и выходит далеко за рамки биржи: он работает в маркетинге, стратегии и любом креативе. Тестировали на акциях, но эффект консенсуса убивает любую оригинальную идею в зачатке. Если ты просишь ChatGPT написать пост для блога без уточнений, ты получаешь среднюю температуру по больнице — скучно, вторично и бесполезно. SEO-подход в мышлении AI заставляет его выдавать «правильные» ответы, которые в реальном мире не стоят ни копейки, потому что их может сгенерировать любой конкурент одним кликом.

Короче: топовые баллы в бенчмарках не значат ровным счетом ничего, если модель не умеет в независимую логику. Хватит верить в «умные» модели — они просто очень хорошо мимикрируют под толпу. Чтобы не слить бюджет, нужно либо выбирать модели с низким уровнем консенсуса, либо жестко ломать их стандартные паттерны поведения. Кто продолжит слепо доверять «мнению» AI, тот останется с красивыми отчетами и пустыми карманами.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с