TL;DR
Спроси модель: «Какова вероятность, что стартап взлетит?» — получишь, скажем, 70%. Спроси отдельно: «Какова вероятность, что он провалится?» — получишь 15%. В сумме это 85%, а не 100%. Пропавшие 15 пунктов — это не ошибка округления, это систематическое искажение, которое обычные метрики точности не видят, потому что они складывают ошибки без учёта знака.
Большинство моделей — оптимисты: они завышают вероятность хорошего исхода и одновременно занижают вероятность плохого, будто хотят подбодрить пользователя. Из 16 протестированных моделей 14 оптимистичны, и только топовые модели Anthropic (Claude Opus и Sonnet) — наоборот, пессимисты, недооценивающие шансы на успех. Причина не в размере модели и не в провайдере как таком — искажение задаёт именно обучение модели быть "полезной и приятной" (то, что называют alignment или RLHF): чем сильнее модель училась угождать пользователю, тем сильнее у неё смещение, но в какую сторону — зависит от конкретного семейства моделей.
Метод простой: задать модели два зеркальных вопроса — про вероятность успеха и про вероятность неудачи одного и того же события — и посмотреть, дают ли ответы в сумме 100. Если нет — направление отклонения показывает, врёт модель в оптимистичную или в пессимистичную сторону. Отдельно выяснили: если вставить в промпт конкретную статистику («в среднем такие проекты успешны в 25% случаев»), искажение почти исчезает — модель начинает воспроизводить число, а не придумывать его.
Схема метода
ШАГ 1: Спросить у модели вероятность ПОЗИТИВНОГО исхода события → число 0-100
ШАГ 2: Спросить у модели (отдельным запросом) вероятность НЕГАТИВНОГО исхода того же события → число 0-100
ШАГ 3: Сложить два числа.
Сумма ≈ 100 → модель непротиворечива
Сумма > 100 → модель раздувает обе оценки (переоценивает всё)
Сумма < 100 → модель занижает обе оценки
Разница по знаку → классический оптимизм или пессимизм
Оба шага можно выполнить в одном чате как два отдельных сообщения — важно не подряд в одном промпте, чтобы модель не подгоняла второй ответ под первый.
Пример применения
Задача: Основатель сервиса доставки готовой еды в Краснодаре хочет понять реальные шансы перед тем, как брать кредит на масштабирование. Он открывает ChatGPT и спрашивает про вероятность успеха — получает бодрые 75%.
Промпт (шаг 1):
Оцени вероятность (от 0 до 100), что сервис доставки готовой еды
в городе с населением 1 млн человек выйдет на самоокупаемость
в течение первого года работы. Ответь только числом.
Промпт (шаг 2, отдельным сообщением):
Оцени вероятность (от 0 до 100), что сервис доставки готовой еды
в городе с населением 1 млн человек НЕ выйдет на самоокупаемость
в течение первого года работы. Ответь только числом.
Результат: Читатель получит два числа. Если сложить их и получить, например, 115 — модель одновременно перехвалила шансы на успех и недооценила риск провала. Это сигнал: не бери первую цифру за чистую монету, лучше просить модель обосновать оценку через конкретные цифры рынка, а не общие ощущения.
Почему это работает
Модель не вычисляет вероятность — она генерирует правдоподобное число, опираясь на то, какой ответ статистически ожидается в подобном тексте. Из-за того, что модели обучали быть полезными и обнадёживающими (angle RLHF — обучение на реакциях людей), в неё "впаялась" склонность звучать оптимистично, когда точного ответа нет.
Модель, тем не менее, хорошо читает явные цифры из текста — если вероятность дана прямо в промпте, она её честно воспроизводит без искажений. Это подтверждено экспериментом: когда в сценарии была указана точная статистика, искажение падало до нуля.
Метод использует эту разницу: зеркальный вопрос ловит момент, когда модель не читает вероятность, а придумывает её. Раз сумма двух ответов должна быть 100 по законам вероятности, а на деле не сходится — значит перед нами не расчёт, а угадывание с уклоном.
Рычаги управления: - Дать модели конкретную статистику в промпте → искажение резко падает, оценка становится точнее. - Явно попросить модель "не поддаваться оптимизму" → помогает, но только частично (искажение снижается примерно на треть, не исчезает). - Смена модели → меняет направление смещения: если нужен скептичный взгляд на риск, стоит спросить у Claude (Opus/Sonnet), если устраивает более оптимистичный тон — у GPT или большинства других моделей.
Шаблон промпта
Оцени вероятность (от 0 до 100), что: {позитивный исход}.
Ответь только числом, без пояснений.
Затем — новым сообщением:
Оцени вероятность (от 0 до 100), что: {негативный исход того же события}.
Ответь только числом, без пояснений.
Сложи оба числа. Если получилось не 100 — знай, что модель искажает оценку, и не принимай первое число как объективный факт.
Для более точной оценки — добавь конкретику:
Учти следующую статистику: {реальные цифры, если они у тебя есть}.
Оцени вероятность {события} с учётом этих данных.
🚀 Быстрый старт — вставь в чат:
Хочу проверить, насколько ChatGPT/Claude искажает оценку вероятности
по моей задаче: {опиши событие, шансы на успех/провал которого
тебе важно оценить}.
Задай мне два зеркальных вопроса — про вероятность успеха и про
вероятность неудачи отдельно, — и после того как я отвечу на оба,
сложи числа и скажи, есть ли искажение и в какую сторону.
LLM задаст вопросы по очереди, а не сразу — потому что если спросить оба сразу, модель подгонит второй ответ под первый и искажение не проявится.
Ограничения
⚠️ Нет универсального направления: одни модели завышают шансы на успех, другие (топовые модели Claude) — занижают. Нельзя заранее предположить, в какую сторону врёт конкретная модель — нужно проверять.
⚠️ Предупреждение модели не спасает полностью: если прямо попросить модель "не поддаваться оптимизму", искажение снижается только примерно на треть. Нельзя просто добавить инструкцию "будь объективен" и рассчитывать на честный ответ.
⚠️ Работает только там, где нет готовых данных: если в вопросе уже есть точная статистика, модель её просто повторяет без искажений. Метод ловит искажение именно в ситуациях неопределённости — прогнозах, оценках риска, "на глаз".
Как исследовали
Исследователи протестировали 16 моделей от 8 провайдеров — OpenAI, Anthropic, Google, Alibaba, DeepSeek, Mistral, Meta, Zhipu — на 60 сценариях из разных сфер: бизнес, здоровье, учёба, политика. Каждой модели задавали зеркальные вопросы про успех и неудачу одного события и смотрели, сходится ли сумма в 100.
Дальше — самое интересное. Чтобы понять, откуда берётся искажение — из архитектуры модели или из её "воспитания" — сравнили 11 пар "модель до обучения на угождение / после" в четырёх семействах моделей (Qwen, Llama, Gemma, Mistral). Оказалось, что именно этап обучения на приятные ответы задаёт направление искажения, причём по-разному: у Qwen после такого обучения искажение слегка выравнивалось, а у Llama — усиливалось в сторону оптимизма.
Самый неожиданный вывод: смещение почти не зависит от языка запроса. Проверили 17 моделей на 6 языках — разброс между моделями оказался в 4,7 раза больше, чем разброс между языками. То есть важно не то, на каком языке ты спрашиваешь, а какую модель выбрал — она несёт своё "настроение" вне зависимости от языка.
