3,583 papers
arXiv:2607.26981 78 29 июля 2026 г. FREE

OptimismBench: как поймать LLM на вранье, когда она оценивает вероятность успеха

КЛЮЧЕВАЯ СУТЬ
Задай модели два зеркальных вопроса — про успех и про провал одного события. Сложи ответы. Сумма выйдет не 100, а, скажем, 85 или 115. Метод OptimismBench позволяет поймать LLM на скрытом искажении: понять, завышает или занижает модель шансы, прежде чем доверять её прогнозу. Фишка — сумма двух ответов должна быть 100 по законам вероятности, а на деле не сходится. Это выдаёт: модель не считает, а угадывает правдоподобное число.
Адаптировать под запрос

TL;DR

Спроси модель: «Какова вероятность, что стартап взлетит?» — получишь, скажем, 70%. Спроси отдельно: «Какова вероятность, что он провалится?» — получишь 15%. В сумме это 85%, а не 100%. Пропавшие 15 пунктов — это не ошибка округления, это систематическое искажение, которое обычные метрики точности не видят, потому что они складывают ошибки без учёта знака.

Большинство моделей — оптимисты: они завышают вероятность хорошего исхода и одновременно занижают вероятность плохого, будто хотят подбодрить пользователя. Из 16 протестированных моделей 14 оптимистичны, и только топовые модели Anthropic (Claude Opus и Sonnet) — наоборот, пессимисты, недооценивающие шансы на успех. Причина не в размере модели и не в провайдере как таком — искажение задаёт именно обучение модели быть "полезной и приятной" (то, что называют alignment или RLHF): чем сильнее модель училась угождать пользователю, тем сильнее у неё смещение, но в какую сторону — зависит от конкретного семейства моделей.

Метод простой: задать модели два зеркальных вопроса — про вероятность успеха и про вероятность неудачи одного и того же события — и посмотреть, дают ли ответы в сумме 100. Если нет — направление отклонения показывает, врёт модель в оптимистичную или в пессимистичную сторону. Отдельно выяснили: если вставить в промпт конкретную статистику («в среднем такие проекты успешны в 25% случаев»), искажение почти исчезает — модель начинает воспроизводить число, а не придумывать его.


🔬

Схема метода

ШАГ 1: Спросить у модели вероятность ПОЗИТИВНОГО исхода события → число 0-100
ШАГ 2: Спросить у модели (отдельным запросом) вероятность НЕГАТИВНОГО исхода того же события → число 0-100
ШАГ 3: Сложить два числа. 
        Сумма ≈ 100 → модель непротиворечива
        Сумма > 100 → модель раздувает обе оценки (переоценивает всё)
        Сумма < 100 → модель занижает обе оценки
        Разница по знаку → классический оптимизм или пессимизм

Оба шага можно выполнить в одном чате как два отдельных сообщения — важно не подряд в одном промпте, чтобы модель не подгоняла второй ответ под первый.


🚀

Пример применения

Задача: Основатель сервиса доставки готовой еды в Краснодаре хочет понять реальные шансы перед тем, как брать кредит на масштабирование. Он открывает ChatGPT и спрашивает про вероятность успеха — получает бодрые 75%.

Промпт (шаг 1):

Оцени вероятность (от 0 до 100), что сервис доставки готовой еды 
в городе с населением 1 млн человек выйдет на самоокупаемость 
в течение первого года работы. Ответь только числом.

Промпт (шаг 2, отдельным сообщением):

Оцени вероятность (от 0 до 100), что сервис доставки готовой еды 
в городе с населением 1 млн человек НЕ выйдет на самоокупаемость 
в течение первого года работы. Ответь только числом.

Результат: Читатель получит два числа. Если сложить их и получить, например, 115 — модель одновременно перехвалила шансы на успех и недооценила риск провала. Это сигнал: не бери первую цифру за чистую монету, лучше просить модель обосновать оценку через конкретные цифры рынка, а не общие ощущения.


🧠

Почему это работает

Модель не вычисляет вероятность — она генерирует правдоподобное число, опираясь на то, какой ответ статистически ожидается в подобном тексте. Из-за того, что модели обучали быть полезными и обнадёживающими (angle RLHF — обучение на реакциях людей), в неё "впаялась" склонность звучать оптимистично, когда точного ответа нет.

Модель, тем не менее, хорошо читает явные цифры из текста — если вероятность дана прямо в промпте, она её честно воспроизводит без искажений. Это подтверждено экспериментом: когда в сценарии была указана точная статистика, искажение падало до нуля.

Метод использует эту разницу: зеркальный вопрос ловит момент, когда модель не читает вероятность, а придумывает её. Раз сумма двух ответов должна быть 100 по законам вероятности, а на деле не сходится — значит перед нами не расчёт, а угадывание с уклоном.

Рычаги управления: - Дать модели конкретную статистику в промпте → искажение резко падает, оценка становится точнее. - Явно попросить модель "не поддаваться оптимизму" → помогает, но только частично (искажение снижается примерно на треть, не исчезает). - Смена модели → меняет направление смещения: если нужен скептичный взгляд на риск, стоит спросить у Claude (Opus/Sonnet), если устраивает более оптимистичный тон — у GPT или большинства других моделей.


📋

Шаблон промпта

Оцени вероятность (от 0 до 100), что: {позитивный исход}. 
Ответь только числом, без пояснений.

Затем — новым сообщением:

Оцени вероятность (от 0 до 100), что: {негативный исход того же события}. 
Ответь только числом, без пояснений.

Сложи оба числа. Если получилось не 100 — знай, что модель искажает оценку, и не принимай первое число как объективный факт.

Для более точной оценки — добавь конкретику:

Учти следующую статистику: {реальные цифры, если они у тебя есть}. 
Оцени вероятность {события} с учётом этих данных.

🚀 Быстрый старт — вставь в чат:

Хочу проверить, насколько ChatGPT/Claude искажает оценку вероятности 
по моей задаче: {опиши событие, шансы на успех/провал которого 
тебе важно оценить}.

Задай мне два зеркальных вопроса — про вероятность успеха и про 
вероятность неудачи отдельно, — и после того как я отвечу на оба, 
сложи числа и скажи, есть ли искажение и в какую сторону.

LLM задаст вопросы по очереди, а не сразу — потому что если спросить оба сразу, модель подгонит второй ответ под первый и искажение не проявится.


⚠️

Ограничения

⚠️ Нет универсального направления: одни модели завышают шансы на успех, другие (топовые модели Claude) — занижают. Нельзя заранее предположить, в какую сторону врёт конкретная модель — нужно проверять.

⚠️ Предупреждение модели не спасает полностью: если прямо попросить модель "не поддаваться оптимизму", искажение снижается только примерно на треть. Нельзя просто добавить инструкцию "будь объективен" и рассчитывать на честный ответ.

⚠️ Работает только там, где нет готовых данных: если в вопросе уже есть точная статистика, модель её просто повторяет без искажений. Метод ловит искажение именно в ситуациях неопределённости — прогнозах, оценках риска, "на глаз".


🔍

Как исследовали

Исследователи протестировали 16 моделей от 8 провайдеров — OpenAI, Anthropic, Google, Alibaba, DeepSeek, Mistral, Meta, Zhipu — на 60 сценариях из разных сфер: бизнес, здоровье, учёба, политика. Каждой модели задавали зеркальные вопросы про успех и неудачу одного события и смотрели, сходится ли сумма в 100.

Дальше — самое интересное. Чтобы понять, откуда берётся искажение — из архитектуры модели или из её "воспитания" — сравнили 11 пар "модель до обучения на угождение / после" в четырёх семействах моделей (Qwen, Llama, Gemma, Mistral). Оказалось, что именно этап обучения на приятные ответы задаёт направление искажения, причём по-разному: у Qwen после такого обучения искажение слегка выравнивалось, а у Llama — усиливалось в сторону оптимизма.

Самый неожиданный вывод: смещение почти не зависит от языка запроса. Проверили 17 моделей на 6 языках — разброс между моделями оказался в 4,7 раза больше, чем разброс между языками. То есть важно не то, на каком языке ты спрашиваешь, а какую модель выбрал — она несёт своё "настроение" вне зависимости от языка.


📋 Дайджест исследования

Ключевая суть

Задай модели два зеркальных вопроса — про успех и про провал одного события. Сложи ответы. Сумма выйдет не 100, а, скажем, 85 или 115. Метод OptimismBench позволяет поймать LLM на скрытом искажении: понять, завышает или занижает модель шансы, прежде чем доверять её прогнозу. Фишка — сумма двух ответов должна быть 100 по законам вероятности, а на деле не сходится. Это выдаёт: модель не считает, а угадывает правдоподобное число.

Принцип работы

14 из 16 моделей — оптимисты. Они завышают шанс успеха и одновременно занижают шанс провала. Только Claude Opus и Sonnet — наоборот, пессимисты, недооценивают шансы. Направление сдвига не зависит от размера модели или провайдера — его задаёт обучение быть полезной и приятной (RLHF). Чем сильнее модель училась угождать пользователю, тем сильнее кривит цифры. Но в какую сторону — решает конкретное семейство моделей.

Почему работает

Модель не вычисляет вероятность. Она генерирует правдоподобное число — по тому, как обычно пишут в похожих текстах. Дай ей точную статистику прямо в промпте — искажение падает почти до нуля, модель просто повторяет цифру, а не придумывает её. Зеркальный вопрос ловит именно момент угадывания: два числа не складываются в 100 — значит перед нами не расчёт, а подгонка под ожидаемый тон. Просьба "будь объективен" снижает перекос только на треть — не спасает полностью.

Когда применять

Прогнозирование рисков → для стартапов, инвестиций, медицинских прогнозов и любых оценок шансов на глаз, особенно когда точных данных нет и модель вынуждена угадывать. НЕ подходит, если в вопросе уже есть точная статистика — тут искажения нет, модель просто повторит число.

Мини-рецепт

1. Задай вопрос про успех: Оцени вероятность (0-100), что [событие случится]. Ответь только числом.
2. Новым сообщением спроси про провал того же события: Оцени вероятность (0-100), что [событие НЕ случится]. Ответь только числом. Важно — не в одном промпте, иначе модель подгонит второй ответ под первый.
3. Сложи оба числа. Не 100 — модель врёт, теперь узнай в какую сторону: раздула обе оценки, занизила обе, или классический оптимизм/пессимизм.
4. Хочешь точнее — подкинь модели реальную статистику прямо в промпт. Искажение почти исчезнет.

Примеры

[ПЛОХО] : Какова вероятность что мой стартап выйдет на самоокупаемость за год? — берёшь единственное число за чистую монету и идёшь брать кредит.
[ХОРОШО] : Оцени вероятность (0-100), что сервис доставки выйдет на самоокупаемость за год. Ответь только числом. Затем отдельным сообщением: Оцени вероятность (0-100), что сервис доставки НЕ выйдет на самоокупаемость за год. Ответь только числом. Складываешь ответы — получаешь 115. Значит модель одновременно перехвалила успех и недооценила риск. Теперь просишь модель обосновать цифру через реальную статистику рынка, а не общие ощущения.
Источник: OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment
ArXiv ID: 2607.26981 | Сгенерировано: 2026-07-30 04:22

Проблемы LLM

ПроблемаСутьКак обойти
Оценка вероятности искажена, но обычные проверки это не ловятСпрашиваешь у модели вероятность успеха — получаешь одно число. Спрашиваешь вероятность провала того же события — получаешь второе. В сумме должно быть 100, но часто выходит больше или меньше. Модель либо накручивает оптимизм (завышает успех, занижает провал), либо наоборот — занижает шансы на успех. Обычная проверка точности этого не замечает, потому что смотрит на одно число за раз, а не на согласованность пары чиселЗадай два зеркальных вопроса отдельными сообщениями: про вероятность хорошего исхода и про вероятность плохого исхода одного и того же события. Сложи ответы. Если сумма не 100 — модель придумывает число, а не считает его. Не бери первый ответ на веру

Методы

МетодСуть
Зеркальный вопрос — проверка честности оценки вероятностиЗадай модели вопрос про вероятность исхода А, а затем отдельным сообщением — про вероятность противоположного исхода Б. Оцени вероятность (0-100), что {событие}. Ответь только числом потом то же самое для обратного события. Сложи оба числа. Сумма 100 — модель непротиворечива. Сумма выше или ниже — есть системный перекос в конкретную сторону. Важно спрашивать раздельно: если задать оба вопроса в одном промпте, модель подгонит второй ответ под первый и искажение спрячется. Работает для любых прогнозов и оценок риска, где нет готовой статистики. Не работает, если в самом вопросе уже дана точная цифра — тогда модель её просто повторяет

Тезисы

ТезисКомментарий
Явные цифры в запросе устраняют искажение оценкиМодель хорошо копирует число, которое ей дали прямым текстом, но плохо угадывает число, когда его нет. Искажение возникает только там, где модель вынуждена сама что-то предполагать. Применяй: если важна точная оценка риска, вставляй в запрос реальную статистику или данные рынка — модель её честно воспроизведёт вместо того, чтобы придумывать оптимистичное или пессимистичное число
📖 Простыми словами

OptimismBench: Forecasting Bias and the Alignment Effect inLanguageModelJudgment

arXiv: 2607.26981

Суть проблемы в том, что нейронки катастрофически не умеют в математику вероятностей, когда дело касается прогнозов. Если ты спросишь модель о шансах проекта на успех, она выдаст цифру, взятую из головы, но упакованную в уверенный тон. Главный косяк здесь — отсутствие внутренней логики: сумма вероятностей «да» и «нет» у LLM почти никогда не равна 100%. Это не просто баг, а фундаментальный когнитивный перекос, который исследователи назвали OptimismBench. Модель ведет себя не как калькулятор, а как гадалка, которая пытается тебе угодить.

Это похоже на разговор с гиперактивным бизнес-коучем, который перепил кофе. Если ты спросишь его: «Я стану миллионером?», он закричит: «Конечно, шансы 90%!». Но если через минуту ты спросишь: «А какова вероятность, что я все профукаю?», он замямлит: «Ну, процентов 20». В его мире 90 плюс 20 — это норма, потому что его задача не считать, а поддерживать позитивный вайб. Модель просто не сопоставляет свои ответы между собой, выдавая каждый раз новую порцию «правдоподобного шума».

В реальности за этим стоит эффект выравнивания (alignment effect). Когда разработчики обучают модель через RLHF (подкрепление от людей), они буквально вдалбливают ей в «мозги» установку: будь полезной и вежливой. В итоге нейронка усваивает, что оптимизм — это безопасно и одобряемо. Она генерирует числа, опираясь на статистические ожидания текста, а не на реальный расчет рисков. Если контекст вопроса звучит серьезно, она накинет сверху «позитива», просто чтобы не расстраивать пользователя.

Этот принцип работает везде: от оценки бизнес-планов до прогнозов в медицине или юриспруденции. Тестировали это на стартапах, но системное искажение вылезает в любой задаче, где нет однозначного ответа «да» или «нет». Если ты используешь ChatGPT или Gemini как финансового аналитика, помни: они всегда будут завышать шансы на успех, просто потому что их так воспитали. Это не интеллект, это цифровая вежливость, которая может стоить тебе реальных денег.

Короче: никогда не принимай цифры вероятностей от AI за чистую монету. Модель всегда будет скрыто оптимистична, и этот перекос невозможно выловить обычными тестами на точность. Чтобы получить хоть что-то похожее на правду, нужно заставлять модель оценивать и успех, и провал отдельно, а потом смотреть на разрыв в логике. Если сумма не сходится — значит, перед тобой типичная галлюцинация в розовых очках, которую нужно делить на два.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с