TL;DR
Шесть топовых LLM (Claude, GPT, Gemini, Kimi, GLM, Seed) с включённым «расширенным размышлением» и живым веб-поиском предсказывали каждый матч чемпионата мира по футболу до его начала — 104 матча, 39 дней, семь показателей на каждый матч. Ответа не существовало в момент вопроса, поэтому исключена любая утечка данных из интернета — модели реально угадывали будущее, а не вспоминали прошлое.
Главная находка: модели не думают самостоятельно, а копируют фаворита букмекера — соглашаются с ним в 85–90% матчей, и их средняя точность (63.9%) почти не отличается от точности механического «ставь на фаворита» (64.4%). Они почти никогда не предсказывают ничьи (реально было 27, модели предсказали 8–14) и боятся редких исходов — 28% всех прогнозов счёта это один и тот же результат 2:1. Ещё страннее: точность падает именно в самых интересных, информационно насыщенных матчах (полуфиналы — 8.3% точности) и растёт на понятных вопросах уровня «кто выйдет из группы» (модели там на 20–44 балла лучше, чем в отдельных матчах).
Статья не даёт готовую технику-исправление — это диагностика. Но из находок вытекает конкретная контрмера: если просишь LLM спрогнозировать что-то неопределённое, не верь ей на близких по силам ситуациях, не собирай мнения нескольких LLM как «независимые голоса» (они сговариваются одинаково), и явно проси перечислить редкие исходы и вероятности, а не соглашайся на один «очевидный» ответ.
Схема исследования
ШАГ 1 (перед каждым матчем, отдельный запрос):
LLM получает досье команд + фиксированную линию букмекера + контекст
(погода, судья, стадион) → выдаёт JSON с 7 прогнозами (исход, счёт, тотал и т.д.)
ШАГ 2 (после матча):
Результат фиксируется, следующий прогноз строится только на прошлых данных
ШАГ 3 (в конце турнира):
4494 прогноза сверяются с реальностью → считается точность по рынкам,
согласие между моделями, точность по раундам турнира
Пример применения (адаптация принципа, не из статьи)
Задача: Аналитик в брокерской компании просит ChatGPT спрогнозировать, превысит ли выручка «Магнита» в квартальном отчёте консенсус-прогноз аналитиков.
Промпт (наивный, воспроизводит проблему из статьи):
Спрогнозируй, превысит ли выручка Магнита за 3 квартал консенсус-прогноз аналитиков.
Дай один ответ: да или нет.
Результат наивного промпта: модель скорее всего просто повторит консенсус — скажет то, что уже написано в аналитических отчётах, без реальной добавленной ценности. Это ровно то, что показала статья: LLM в 85-90% случаев просто озвучивает «линию рынка».
Промпт с контрмерой (по мотивам находок статьи):
Спрогнозируй, превысит ли выручка Магнита за 3 квартал консенсус-прогноз аналитиков.
Сделай это в два шага:
1. Отдельно опиши, что говорит рыночный консенсус (текущие прогнозы, ожидания) —
без своего мнения.
2. Отдельно — твой независимый анализ: какие есть данные ЗА пределами консенсуса
(последние новости, разовые факторы), которые могут сдвинуть результат в любую сторону.
3. Перечисли 2-3 сценария, включая маловероятные (например, "выручка сильно не совпадёт
с прогнозом из-за X"), и дай вероятность каждому.
4. Явно укажи: насколько ситуация "близкая" (когда легко ошибиться) или "явная"
(когда прогноз очевиден) — и насколько ты доверяешь своему ответу именно в этой ситуации.
Результат: модель разделит «что все и так знают» от собственного анализа, назовёт не только очевидный сценарий, но и хвостовые риски с вероятностями — вместо одного самоуверенного ответа, слепо повторяющего консенсус.
Почему это происходит (механика находки)
LLM учится предсказывать самый типичный, ожидаемый по паттернам ответ — по сути, пересказывает то, что уже есть в найденных источниках (те же коэффициенты букмекеров), а не открывает скрытую информацию. У модели нет «инсайда» — только то, что уже написано в интернете и что она нашла поиском.
При этом LLM хорошо работает с обобщёнными, агрегированными вопросами — «кто выйдет в плейофф» это агрегат многих факторов, где ошибки взаимно гасятся. А узкий вопрос «какой будет точный счёт этого конкретного матча» требует реальной оценки неопределённости — и здесь модель просто съезжает на «безопасный», самый частый ответ.
Отсюда рычаг: если явно разделить в промпте «рыночный консенсус» и «собственный независимый анализ», а также принудительно попросить перечислить редкие/маловероятные исходы с вероятностями — модель перестаёт слепо повторять очевидное и начинает честнее взвешивать неопределённость.
Ограничения
⚠️ Одно событие: все выводы держатся на одном турнире (104 матча). Разница между лучшей и худшей моделью статистически не очень значима — рейтинг мог бы выглядеть иначе на другом турнире.
⚠️ Домен с явным рынком-консенсусом: футбол — особый случай, там есть букмекерская линия как «эталон для сравнения». В задачах без такого явного рыночного консенсуса выводы про «копирование фаворита» могут работать иначе.
⚠️ Это диагностика, не готовая техника: сама статья не предлагает промпт-решение. Предложенный выше шаблон (разделение консенсуса и своего анализа) — экстраполяция автора саммари на основе находок, не протестированная в исследовании напрямую.
⚠️ Не работает как призыв «просто добавь текст»: проблема системная — модель по своей природе тянется к модальному ответу. Промпт с просьбой «учесть редкие исходы» смягчает эффект, но не устраняет его полностью.
Как исследовали
Исследователи взяли реальный чемпионат мира по футболу 2026 года — событие, которое буквально не могло присутствовать в обучающих данных моделей, потому что ещё не случилось. Каждый день на протяжении 39 дней шесть флагманских моделей (все с максимальным «размышлением» и собственным веб-поиском провайдера) получали досье команд и должны были до начала каждого матча зафиксировать прогноз по семи показателям — исход, точный счёт, тоталы и так далее. Всего собрали 4494 прогноза, и результаты сверяли с реальными исходами после матчей.
Три «замка» защищали чистоту эксперимента: снимок данных фиксировался на момент прогноза (без будущих результатов), прогноз всегда отправлялся до начала матча (несмотря на то, что модели умеют искать в реальном времени), а шаблон и веса баллов были заморожены заранее. Любопытная деталь: полные досье команд занимали 420 тысяч токенов — больше контекста самой маленькой модели, поэтому для предтурнирных вопросов сделали сжатую версию на 118 тысяч токенов, одинаковую для всех.
Результат удивил исследователей: модели почти не отличались друг от друга (разброс между первым и последним — всего 84 балла из ~1700 возможных), а порядок в середине рейтинга менялся при смене метода подсчёта баллов — только лидер и последнее место держались стабильно. Это привело к выводу, что нынешнее поколение флагманских LLM решает задачу прогнозирования одним общим способом — а не так, что одна модель принципиально умнее другой в этом деле.
