TL;DR
Если показать ИИ-агенту вопрос без контекста — например, "вырастет ли эта акция через 10 дней?" — он в 9 случаях из 10 честно отвечает "не знаю, это непредсказуемо". Но стоит добавить профессионально оформленную панель с индикаторами (RSI, MACD, скользящие средние) — и модель начинает уверенно называть цифры почти в 6 раз чаще. Самое неожиданное: эффект остаётся точно таким же, если все цифры на панели подделаны — взяты с других дат, придуманы с нуля. Модель реагирует не на данные, а на их оформление.
Проблема не в том, что модель не понимает неопределённости. Если её прямо спросить "можно ли это предсказать?" — она в 90% случаев верно отвечает "нет". Но стоит показать красивую таблицу с цифрами — и тот же самый внутренний "стоп-сигнал" отключается, хотя знание о непредсказуемости никуда не пропало. Это как консультант, который знает, что рынок непредсказуем, но всё равно даёт уверенный прогноз клиенту, если перед ним лежит красиво оформленный отчёт с графиками — форма подавляет содержание.
Исследователи нашли, что "тормоз действия" (решение отвечать/не отвечать) — это отдельный механизм от "знания" о непредсказуемости, и он ломается именно от авторитетного вида данных. Рабочий способ обойти это в диалоге — разделить два момента: сначала спросить модель, познаваем ли вопрос в принципе, и только потом (если да) показывать данные. А ещё критично важно не загонять модель в жёсткий формат ответа без места на рассуждение — именно жёсткий формат "без объяснений" убирает у модели пространство поймать саму себя на ошибке.
Схема метода (извлекаемая техника — "спроси о познаваемости раньше данных")
ШАГ 1: Спросить модель "познаваем ли вопрос в принципе?" ДО показа любых данных → ответ ПОЗНАВАЕМО / НЕПОЗНАВАЕМО + объяснение
ШАГ 2 (если ПОЗНАВАЕМО): Показать данные, попросить развёрнутый ответ с рассуждением, не только цифру → текстовый ответ с обоснованием
ШАГ 2 (если НЕПОЗНАВАЕМО): Не подавать "доказательства" как повод для прогноза, попросить честно признать неопределённость → отказ от числовой оценки
Оба шага можно сделать в одном промпте (структура ниже) или двумя отдельными сообщениями в чате — второй вариант надёжнее, потому что не даёт модели увидеть данные раньше своего суждения.
Пример применения
Задача: Вы просите ChatGPT спрогнозировать, вырастет ли биткоин на следующей неделе, и прикладываете скриншот графика с RSI, MACD и объёмами торгов.
Наивный промпт (плохой вариант):
Судя по этому графику (RSI 58, MACD растёт, объём выше среднего),
вырастет ли биткоин на следующей неделе? Дай вероятность.
Модель, скорее всего, выдаст уверенную цифру типа "65% вероятность роста" — просто потому что перед ней профессионально оформленные данные, а не потому что эти данные реально что-то предсказывают на этом горизонте.
Промпт с техникой:
Шаг 1. Прежде чем смотреть на любые данные — ответь честно:
можно ли в принципе предсказать движение цены биткоина за 7 дней
точнее, чем случайное угадывание? Учти природу краткосрочных
колебаний цены. Ответь ПОЗНАВАЕМО или НЕПОЗНАВАЕМО и объясни почему.
[после ответа модели]
Шаг 2. Вот данные графика: RSI 58, MACD растёт, объём выше среднего.
Если ты сказал(а) НЕПОЗНАВАЕМО — не давай числовую вероятность,
а объясни, почему эти данные не меняют вывод. Если ПОЗНАВАЕМО —
дай развёрнутый ответ с объяснением, на что именно в данных ты опираешься.
Результат: На шаге 1 модель почти всегда честно признаёт непредсказуемость краткосрочного движения криптовалюты. На шаге 2, если напомнить ей про этот вывод, она с высокой вероятностью откажется от уверенного прогноза вместо того, чтобы "поверить" красивому графику — потому что суждение зафиксировано раньше, чем сработала "seduction" от оформления.
Почему это работает
Слабость модели — она реагирует на форму данных, а не только на их содержание. Профессионально оформленная таблица с индикаторами включает что-то вроде режима "уверенный эксперт", даже когда цифры не несут реальной информации для конкретного вопроса.
Сильная сторона модели — при прямом вопросе "познаваемо ли это?" она почти всегда (в 9 случаях из 10) правильно определяет, что вопрос непредсказуем. Внутреннее знание есть, просто оно теряется, когда решение принимается на фоне красивого "доказательства".
Техника разделяет эти два момента: сначала ловим правильное суждение модели, пока её ничего не сбивает, потом только показываем данные. Дополнительный рычаг — формат ответа. Если заставить модель отвечать только меткой или числом без объяснения, "место для рассуждения" исчезает, и защита от переуверенности рушится. Поэтому в промптах на прогноз/оценку риска всегда просите развёрнутое рассуждение, а не голую цифру.
Шаблон промпта
Вопрос для оценки: {ваш вопрос о будущем событии}
Шаг 1 — Оценка познаваемости:
Прежде чем смотреть на любые данные, ответь честно: можно ли вопрос
"{ваш вопрос}" предсказать точнее, чем случайное угадывание?
Учти природу события — краткосрочные движения цены, спортивные матчи,
погода на много дней вперёд обычно непредсказуемы наперёд, даже если
выглядят анализируемыми. Ответь строго: ПОЗНАВАЕМО или НЕПОЗНАВАЕМО,
и в двух предложениях объясни почему.
Шаг 2 — Работа с данными (только если ПОЗНАВАЕМО):
Вот данные: {данные, график, контекст}
Дай развёрнутый ответ с рассуждением — объясни, на что конкретно
в данных ты опираешься, а не только итоговую цифру.
Если на шаге 1 ты ответил(а) НЕПОЗНАВАЕМО — не меняй вывод под
влиянием данных из шага 2. Честно скажи, что уверенный прогноз
здесь невозможен, даже если данные выглядят убедительно.
Подставьте в {ваш вопрос} конкретное событие (курс валюты, исход матча, погоду), в {данные} — то, что у вас есть (график, таблицу, новость).
🚀 Быстрый старт — вставь в чат:
Вот шаблон для честной оценки прогнозируемости. Адаптируй под мою
задачу: {опишите свою задачу с прогнозом}. Задавай вопросы, чтобы
заполнить поля.
[вставить шаблон выше]
LLM спросит, какое именно событие вы хотите оценить и какие данные у вас есть — потому что порядок этих двух шагов и есть суть техники: суждение о познаваемости должно появиться раньше, чем модель увидит "доказательства".
Ограничения
⚠️ Эффект неустойчив между моделями: в исследовании только 3 из 12 моделей были явно "падкими" на красивое оформление (в основном линейка Claude), несколько моделей никогда не брались прогнозировать вообще, другие прогнозировали всегда независимо от данных. Ваша модель может вести себя иначе — проверяйте на своих задачах.
⚠️ Жёсткий формат ответа ломает технику: если заставить модель отвечать только меткой, числом или строгим JSON без пояснений, "место для рассуждения" пропадает, и модель может уверенно ошибаться даже там, где без жёсткого формата она бы отказалась гадать.
⚠️ Работает только в рамках одного диалога: если в новом чате сразу показать данные без предварительного шага про познаваемость, эффект переуверенности может вернуться — модель не "запоминает" вывод предыдущей сессии.
⚠️ Не заменяет реальный fine-tuning: в исследовании надёжное устранение проблемы (0% ложных прогнозов) достигалось через дообучение модели на синтетических данных — это доступно только через код и API, не в обычном чате. Техника "спроси сначала" смягчает эффект, но не гарантирует полного устранения.
Как исследовали
Исследователь взял 12 топовых моделей (GPT, Claude, Gemini, DeepSeek, Qwen, Grok, Llama) и проверил их на вопросах, которые заведомо непредсказуемы — например, куда пойдёт цена акции через 10 торговых дней (статистически это монетка орёл-решка). Без контекста модели правильно отказывались гадать в 93.5% случаев. Стоило добавить панель технических индикаторов — доля уверенных ответов подскочила до 54%.
Самое удивительное открытие: когда все цифры на панели подделали (взяли с других дат, сделали внутренне непротиворечивыми, но фактически неверными), эффект остался практически тем же — около 37%, статистически неотличимо от реальных данных. Значит, дело не в информации, а в том, как она выглядит.
Отдельно проверили, действительно ли модели "внутри" понимают неопределённость: если спросить напрямую, 90% моделей верно называют вопрос непознаваемым — но потом всё равно в некоторых случаях берутся отвечать, если увидят "доказательства". Значит, знание есть, а "тормоз действия" — отдельный механизм, который ломается от авторитетного оформления, а не от отсутствия понимания.
Финальный эксперимент показал, что этот тормоз можно натренировать через дообучение маленькой модели на синтетических примерах (кости, монеты) — это довело ложные прогнозы до нуля и перенеслось на другие домены. Но тренировка ломалась ровно тогда, когда формат ответа не оставлял модели места на рассуждение — тогда модель уверенно ошибалась на 100% проверенных случаев. Это и главный практический вывод: жёсткие форматы вывода опасны именно там, где важна честная неуверенность.
Ресурсы
"Calibrated Enough to Know, Not Calibrated to Act: Fabricated Evidence Makes LLM Agents Commit to the Unknowable", Pranav Aggarwal (Independent Researcher), preprint, август 2026. Код, данные и все результаты — github.com/Pranav-1100/confidence-calibration-evaluation
