3,583 papers
arXiv:2608.04008 75 4 авг. 2026 г. FREE

WorldCup Arena: LLM-прогнозы повторяют мнение букмекера и не умеют оценивать редкие исходы

КЛЮЧЕВАЯ СУТЬ
6 топовых LLM (Claude, GPT, Gemini и другие) с включённым глубоким анализом и живым поиском предсказывали каждый матч чемпионата мира до его начала — 104 матча, результата которых ещё не существовало в момент вопроса. Диагностика показывает, в каких вопросах модель реально думает, а в каких просто повторяет ставку букмекера — совпадение с фаворитом в 85-90% случаев. Модель почти никогда не предсказывает ничьи и редкие исходы — 28% всех прогнозов счёта это один и тот же результат 2:1. При этом точность падает именно в самых важных матчах (полуфиналы — 8.3%), а растёт на простых обобщённых вопросах типа «кто выйдет из группы».
Адаптировать под запрос

TL;DR

Шесть топовых LLM (Claude, GPT, Gemini, Kimi, GLM, Seed) с включённым «расширенным размышлением» и живым веб-поиском предсказывали каждый матч чемпионата мира по футболу до его начала — 104 матча, 39 дней, семь показателей на каждый матч. Ответа не существовало в момент вопроса, поэтому исключена любая утечка данных из интернета — модели реально угадывали будущее, а не вспоминали прошлое.

Главная находка: модели не думают самостоятельно, а копируют фаворита букмекера — соглашаются с ним в 85–90% матчей, и их средняя точность (63.9%) почти не отличается от точности механического «ставь на фаворита» (64.4%). Они почти никогда не предсказывают ничьи (реально было 27, модели предсказали 8–14) и боятся редких исходов — 28% всех прогнозов счёта это один и тот же результат 2:1. Ещё страннее: точность падает именно в самых интересных, информационно насыщенных матчах (полуфиналы — 8.3% точности) и растёт на понятных вопросах уровня «кто выйдет из группы» (модели там на 20–44 балла лучше, чем в отдельных матчах).

Статья не даёт готовую технику-исправление — это диагностика. Но из находок вытекает конкретная контрмера: если просишь LLM спрогнозировать что-то неопределённое, не верь ей на близких по силам ситуациях, не собирай мнения нескольких LLM как «независимые голоса» (они сговариваются одинаково), и явно проси перечислить редкие исходы и вероятности, а не соглашайся на один «очевидный» ответ.


📌

Схема исследования

ШАГ 1 (перед каждым матчем, отдельный запрос): 
  LLM получает досье команд + фиксированную линию букмекера + контекст 
  (погода, судья, стадион) → выдаёт JSON с 7 прогнозами (исход, счёт, тотал и т.д.)

ШАГ 2 (после матча): 
  Результат фиксируется, следующий прогноз строится только на прошлых данных

ШАГ 3 (в конце турнира): 
  4494 прогноза сверяются с реальностью → считается точность по рынкам, 
  согласие между моделями, точность по раундам турнира

🚀

Пример применения (адаптация принципа, не из статьи)

Задача: Аналитик в брокерской компании просит ChatGPT спрогнозировать, превысит ли выручка «Магнита» в квартальном отчёте консенсус-прогноз аналитиков.

Промпт (наивный, воспроизводит проблему из статьи):

Спрогнозируй, превысит ли выручка Магнита за 3 квартал консенсус-прогноз аналитиков. 
Дай один ответ: да или нет.

Результат наивного промпта: модель скорее всего просто повторит консенсус — скажет то, что уже написано в аналитических отчётах, без реальной добавленной ценности. Это ровно то, что показала статья: LLM в 85-90% случаев просто озвучивает «линию рынка».

Промпт с контрмерой (по мотивам находок статьи):

Спрогнозируй, превысит ли выручка Магнита за 3 квартал консенсус-прогноз аналитиков.

Сделай это в два шага:
1. Отдельно опиши, что говорит рыночный консенсус (текущие прогнозы, ожидания) — 
   без своего мнения.
2. Отдельно — твой независимый анализ: какие есть данные ЗА пределами консенсуса 
   (последние новости, разовые факторы), которые могут сдвинуть результат в любую сторону.
3. Перечисли 2-3 сценария, включая маловероятные (например, "выручка сильно не совпадёт 
   с прогнозом из-за X"), и дай вероятность каждому.
4. Явно укажи: насколько ситуация "близкая" (когда легко ошибиться) или "явная" 
   (когда прогноз очевиден) — и насколько ты доверяешь своему ответу именно в этой ситуации.

Результат: модель разделит «что все и так знают» от собственного анализа, назовёт не только очевидный сценарий, но и хвостовые риски с вероятностями — вместо одного самоуверенного ответа, слепо повторяющего консенсус.


📌

Почему это происходит (механика находки)

LLM учится предсказывать самый типичный, ожидаемый по паттернам ответ — по сути, пересказывает то, что уже есть в найденных источниках (те же коэффициенты букмекеров), а не открывает скрытую информацию. У модели нет «инсайда» — только то, что уже написано в интернете и что она нашла поиском.

При этом LLM хорошо работает с обобщёнными, агрегированными вопросами — «кто выйдет в плейофф» это агрегат многих факторов, где ошибки взаимно гасятся. А узкий вопрос «какой будет точный счёт этого конкретного матча» требует реальной оценки неопределённости — и здесь модель просто съезжает на «безопасный», самый частый ответ.

Отсюда рычаг: если явно разделить в промпте «рыночный консенсус» и «собственный независимый анализ», а также принудительно попросить перечислить редкие/маловероятные исходы с вероятностями — модель перестаёт слепо повторять очевидное и начинает честнее взвешивать неопределённость.


⚠️

Ограничения

⚠️ Одно событие: все выводы держатся на одном турнире (104 матча). Разница между лучшей и худшей моделью статистически не очень значима — рейтинг мог бы выглядеть иначе на другом турнире.

⚠️ Домен с явным рынком-консенсусом: футбол — особый случай, там есть букмекерская линия как «эталон для сравнения». В задачах без такого явного рыночного консенсуса выводы про «копирование фаворита» могут работать иначе.

⚠️ Это диагностика, не готовая техника: сама статья не предлагает промпт-решение. Предложенный выше шаблон (разделение консенсуса и своего анализа) — экстраполяция автора саммари на основе находок, не протестированная в исследовании напрямую.

⚠️ Не работает как призыв «просто добавь текст»: проблема системная — модель по своей природе тянется к модальному ответу. Промпт с просьбой «учесть редкие исходы» смягчает эффект, но не устраняет его полностью.


🔍

Как исследовали

Исследователи взяли реальный чемпионат мира по футболу 2026 года — событие, которое буквально не могло присутствовать в обучающих данных моделей, потому что ещё не случилось. Каждый день на протяжении 39 дней шесть флагманских моделей (все с максимальным «размышлением» и собственным веб-поиском провайдера) получали досье команд и должны были до начала каждого матча зафиксировать прогноз по семи показателям — исход, точный счёт, тоталы и так далее. Всего собрали 4494 прогноза, и результаты сверяли с реальными исходами после матчей.

Три «замка» защищали чистоту эксперимента: снимок данных фиксировался на момент прогноза (без будущих результатов), прогноз всегда отправлялся до начала матча (несмотря на то, что модели умеют искать в реальном времени), а шаблон и веса баллов были заморожены заранее. Любопытная деталь: полные досье команд занимали 420 тысяч токенов — больше контекста самой маленькой модели, поэтому для предтурнирных вопросов сделали сжатую версию на 118 тысяч токенов, одинаковую для всех.

Результат удивил исследователей: модели почти не отличались друг от друга (разброс между первым и последним — всего 84 балла из ~1700 возможных), а порядок в середине рейтинга менялся при смене метода подсчёта баллов — только лидер и последнее место держались стабильно. Это привело к выводу, что нынешнее поколение флагманских LLM решает задачу прогнозирования одним общим способом — а не так, что одна модель принципиально умнее другой в этом деле.


📋 Дайджест исследования

Ключевая суть

6 топовых LLM (Claude, GPT, Gemini и другие) с включённым глубоким анализом и живым поиском предсказывали каждый матч чемпионата мира до его начала — 104 матча, результата которых ещё не существовало в момент вопроса. Диагностика показывает, в каких вопросах модель реально думает, а в каких просто повторяет ставку букмекера — совпадение с фаворитом в 85-90% случаев. Модель почти никогда не предсказывает ничьи и редкие исходы — 28% всех прогнозов счёта это один и тот же результат 2:1. При этом точность падает именно в самых важных матчах (полуфиналы — 8.3%), а растёт на простых обобщённых вопросах типа «кто выйдет из группы».

Принцип работы

LLM ведёт себя как студент, который вместо решения задачи списывает ответ у отличника — в этом случае у букмекерской линии. Согласие с фаворитом достигает 85-90%, а точность моделей (63.9%) почти не отличается от механического правила «ставь на фаворита» (64.4%). Разные модели от разных компаний — а сходятся на одном и том же ответе, будто сговорились.

Почему работает

У модели нет инсайда — только то, что нашёл веб-поиск, а там те же коэффициенты букмекеров. Узкий вопрос вроде «какой будет точный счёт» требует реальной оценки неопределённости, и модель съезжает на самый частый, безопасный ответ. На обобщённых вопросах типа «кто выйдет в плейофф» ошибки взаимно гасятся — там модели показывают результат на 20-44 балла выше, чем в прогнозах отдельных матчей.

Когда применять

Прогнозирование с высокой неопределённостью → особенно там, где есть явный рыночный консенсус (ставки, прогнозы аналитиков, опросы). Критично для редких, хвостовых исходов — модель их систематически недооценивает. НЕ подходит как единственный источник, если нужен нестандартный прогноз против рынка — модель будет просто повторять общее мнение.

Мини-рецепт

1. Разделяй в промпте два шага: сначала попроси описать «что говорит рыночный консенсус» отдельно, без мнения модели.
2. Заставь перечислить редкие исходы: «Назови 2-3 сценария, включая маловероятные, с вероятностью каждому» — модель по умолчанию их пропускает.
3. Спрашивай про уверенность явно: «Эта ситуация явная или близкая по силам?» — и снижай доверие там, где модель признаёт неопределённость.
4. Не собирай несколько LLM как «независимые голоса»: они сговариваются на одном и том же ответе, усреднение не даёт прироста точности.

Примеры

[ПЛОХО] : Спрогнозируй, превысит ли выручка Магнита за 3 квартал консенсус-прогноз аналитиков. Дай один ответ: да или нет.
[ХОРОШО] : Сначала отдельно опиши, что говорит рыночный консенсус — без своего мнения. Потом дай независимый анализ: какие факторы за пределами консенсуса могут сдвинуть результат. Перечисли 2-3 сценария, включая маловероятные, с вероятностью каждому. Укажи, насколько ситуация явная или близкая по силам — и своё доверие к ответу.
Источник: WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament
ArXiv ID: 2608.04008 | Сгенерировано: 2026-08-05 06:28

Проблемы LLM

ПроблемаСутьКак обойти
Модель повторяет чужой консенсус вместо своего анализаЕсли для прогноза есть общедоступное "общепринятое" мнение — рыночная линия, консенсус аналитиков, прогноз букмекера — модель почти всегда просто озвучивает его. Своей добавленной ценности почти нет: точность модели почти не отличается от механического "соглашайся с большинством"Раздели запрос на два блока: "что говорит консенсус/рынок" отдельно, "твой независимый анализ, где ты можешь не согласиться" — отдельно. Проси явно назвать, чем твой вывод отличается от общепринятого
Модель избегает редких исходов, выбирает один типичный ответКогда возможных исходов много и они не равновероятны, модель почти никогда не называет редкий вариант. Она раз за разом выдаёт один и тот же "самый безопасный" ответ, даже если реальность разнообразнееПроси не один ответ, а список из 3-5 возможных исходов с вероятностью для каждого, включая маловероятные. Не принимай единственный "очевидный" вариант как финальный ответ

Методы

МетодСуть
Разделение консенсуса и независимого анализа — против слепого повторенияПопроси модель сначала выписать "что говорит общепринятое мнение/рынок" отдельным пунктом, без своей оценки. Затем отдельным пунктом — "что я вижу за пределами этого мнения" (новые факты, разовые события, нетипичные сигналы). В конце — список альтернативных сценариев с вероятностями, включая редкие. Работает потому что модель по умолчанию сваливается в пересказ найденного в интернете консенсуса; принудительное разделение шагов заставляет её отдельно поискать расхождения. Применяй когда: прогноз неопределённого события, где есть публичный консенсус (рынок, экспертные оценки, ставки). Не работает когда: вопрос без внешнего консенсуса вообще — тогда нет с чем сравнивать

Тезисы

ТезисКомментарий
Агрегированные вопросы модель решает точнее, чем узкие детализированныеКогда вопрос — это сумма многих факторов ("кто в итоге выйдет в следующий раунд"), мелкие ошибки в оценке отдельных факторов гасят друг друга. Когда вопрос узкий и точечный ("какой будет точный результат этого одного события"), усреднения не происходит — модель просто выбирает самый типичный вариант, и точность падает именно в самых интересных, сложных случаях. Применяй: если тебе важна точность прогноза, формулируй вопрос как диапазон или категорию ("выручка выше/ниже консенсуса", "кто попадёт в топ-4"), а не как точное узкое число или единичный исход
📖 Простыми словами

WorldCup Arena: Prospective, Leakage-Free Evaluation of FrontierLLMson a Live Tournament

arXiv: 2608.04008

Проблема всех тестов нейросетей в том, что они проверяют память, а не мозги. Когда мы просим модель решить задачу, есть огромный шанс, что она уже видела ответ в своих обучающих данных и просто его воспроизводит. Исследователи решили эту проблему радикально: они заставили топовые LLM предсказывать исходы матчей Чемпионата мира по футболу прямо в процессе турнира. Это чистый эксперимент, где правильного ответа физически не существовало в интернете на момент вопроса, а значит, списать у «Википедии» было невозможно.

Это как если бы ты принимал на работу бухгалтера и вместо стандартных тестов из учебника попросил его рассчитать налоги по закону, который приняли только сегодня утром. Никаких заготовок, никаких шпаргалок — либо ты умеешь думать и анализировать свежие новости, либо ты просто дорогой попугай. Модели оказались в ситуации, где их хваленая эрудиция бесполезна без навыка связывать факты здесь и сейчас.

В «арену» выставили тяжеловесов вроде GPT-4o, Claude 3.5 Sonnet и Gemini 1.5 Pro, выдав им в руки живой веб-поиск и режим Chain-of-Thought (длинные размышления). Они анализировали составы, травмы и форму команд перед каждым из 104 матчей. Выяснилось, что когда дело доходит до реальности, а не синтетических тестов, лидеры меняются: некоторые модели отлично «галлюцинируют» победы фаворитов, игнорируя контекст, в то время как другие реально сопоставляют данные из поиска с логикой игры.

Этот метод оценки — WorldCup Arena — закрывает лазейку для разработчиков, которые подгоняют свои нейронки под известные бенчмарки. Принцип универсален: если хочешь понять, насколько умен твой AI-ассистент, не спрашивай его о прошлом. Дай ему задачу на основе событий сегодняшнего утра, где нужно вытащить данные из сети и сделать вывод. Только так можно отсеять интеллектуальную имитацию от реальной способности рассуждать.

Короче, эпоха «стерильных» тестов заканчивается, потому что модели научились их взламывать за счет огромной памяти. Будущее оценки — это динамические турниры в реальном времени, где нейронка должна доказывать свою адекватность в условиях неопределенности. Если модель не может предсказать очевидный тренд или лажает в анализе свежих новостей, грош цена её баллам в старых тестах. Утечка данных невозможна, когда данных еще нет.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с