TL;DR
Когда ИИ говорит "скорее всего не сработает" или "маловероятно" — это не то же самое число, что вы представляете в голове. Модели переводят словесные оценки вероятности ("невозможно", "возможно", "почти наверняка") в числа примерно как люди: сохраняют порядок слов и правильно ставят крайние точки (0% для "невозможно", 100% для "точно", 50% для "шансы равны").
Но есть системная ошибка: слова с отрицательным оттенком — "unlikely" (маловероятно), "improbable" (невероятно) — модели переводят в более высокие числа, чем люди. То есть там, где человек думает "процентов 10", модель внутри держит "процентов 20-25". А слово "possible" (возможно) — это вообще лотерея: одна и та же модель в разных попытках может понимать его то как "10%", то как "50%". У людей, кстати, то же самое — это слово исторически известно как самое нестабильное.
Есть простой способ снизить разброс: если попросить модель объяснить свой ответ перед тем как дать число — она станет более стабильной сама с собой (одна и та же модель перестанет метаться между "20" и "60"). Но платите вы за это тем, что разные модели начинают расходиться друг с другом сильнее.
Схема метода
СИТУАЦИЯ: ИИ даёт словесную оценку вероятности ("маловероятно", "возможно")
ПРОБЛЕМА: слово ≠ число в голове модели, и ≠ число в голове человека
ЧТО ДЕЛАТЬ:
ШАГ 1: Просить число, а не слово → "оцени вероятность от 0 до 100"
ШАГ 2: Просить объяснение перед числом → снижает разброс ответов ОДНОЙ модели
ШАГ 3: Не доверять слову "возможно" вообще → просить конкретику
Пример применения
Задача: Вы спрашиваете ИИ-помощника (например, при анализе бизнес-идеи для инвестора) — "Как ты оцениваешь шансы, что этот стартап с доставкой продуктов взлетит на рынке Москвы?"
Промпт (плохой вариант, без числа):
Оцени вероятность успеха этого стартапа: {описание стартапа}
Модель ответит: "Это маловероятно, учитывая конкуренцию с Яндекс.Лавкой и Самокатом."
Промпт (хороший вариант, с числом и объяснением):
Оцени вероятность успеха этого стартапа: {описание стартапа}
Сначала кратко объясни свои рассуждения по шагам,
затем дай финальную оценку — одно число от 0 до 100,
где 0 = точно провалится, 100 = точно взлетит.
Результат: В первом случае вы услышите "маловероятно" — и понятия не имеете, значит ли это 5% или 25% в голове модели (исследование показывает, что для таких слов у моделей систематический сдвиг вверх). Во втором случае вы получите конкретное число и рассуждение, которое можно сравнить с другими оценками (от других моделей, от коллег), и оно будет более стабильным при повторных запросах к этой же модели.
Почему это работает
Слова про вероятность — это не универсальный код, а языковой паттерн, который модель выучила из текстов. В текстах люди используют "unlikely" в самых разных контекстах — от "вряд ли пойдёт дождь" до "вряд ли конец света" — и модель усредняет это в свою внутреннюю оценку. Отсюда систематический сдвиг: у модели "внутренний счётчик" для негативных слов настроен чуть выше человеческого.
Сильная сторона модели — она хорошо держит крайние точки шкалы ("невозможно" = 0, "точно" = 100) и порядок слов (unlikely < possible < likely) почти идеально, как человек. Слабое место — середина шкалы и особенно многозначные слова типа "possible", где нет чёткого якоря.
Просьба объяснить решение работает как принудительная фиксация: модель, вынужденная проговорить рассуждение, выбирает одну логическую цепочку и держится её — вместо того чтобы каждый раз генерировать число "с нуля" из общего облака ассоциаций.
Рычаг управления: если вам нужна консистентность одной модели — просите объяснение перед числом. Если нужно сравнить несколько моделей между собой — знайте, что объяснение может увеличить их разногласия, а не уменьшить.
Шаблон промпта
Оцени вероятность следующего события: {событие}
Сначала распиши рассуждение по шагам:
какие факторы за, какие против, на что ты опираешься.
Затем дай финальную оценку в виде ОДНОГО числа от 0 до 100:
0 = событие точно не произойдёт
100 = событие точно произойдёт
50 = шансы равны
Не используй словесные формулировки типа "вероятно" или "маловероятно"
в финальном ответе — только число.
🚀 Быстрый старт — вставь в чат:
Вот шаблон для получения числовой оценки вероятности от ИИ.
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какое именно событие оценивать и в каком контексте (бизнес-риск, медицинский прогноз, вероятность успеха проекта) — потому что формулировка события влияет на то, какие факторы модель будет взвешивать в рассуждении.
Ограничения
⚠️ Слово "возможно" ненадёжно всегда: даже с числовым форматом ответа модель может колебаться между "10" и "50" для этого слова — это фундаментальное свойство слова, не баг конкретной модели.
⚠️ Слабые модели дают случайные числа: у небольших открытых моделей (типа Llama3-8B, Mistral-7B) внутренняя логика "слово → число → слово" настолько несогласованна, что результат статистически не отличим от случайного угадывания. Для важных решений — используйте топовые модели (GPT-5, Claude Opus/Sonnet).
⚠️ Просьба объяснить — не серебряная пуля: для части моделей объяснение путает модель ещё больше — она может начать оценивать вероятность не события, а вероятность того, что сам текст промпта "выглядит естественно" (реальный кейс из исследования).
Как исследовали
Исследователи взяли 11 слов вероятности ("невозможно", "маловероятно", "возможно", "вероятно", "почти наверняка" и другие) и показали их 19 моделям — от Claude Opus и GPT-5 до маленьких открытых моделей типа Llama3-8B. Каждой модели задавали вопрос в трёх форматах: просто дай число, дай число с объяснением, и хитрый "круговой" тест — модели давали случайное число, просили назвать подходящее слово, а потом в отдельном запросе — перевести это же слово обратно в число.
Сравнивали с человеческим эталоном — метаанализом Мостеллера и Ютца, который собрал данные из 20 исследований о том, как люди понимают эти слова. Оказалось, что модели на удивление точно повторяют человеческую структуру — включая её слабости (нестабильность слова "possible"). Но авторов удивило, что просьба объяснить рассуждение делает каждую отдельную модель более стабильной, но разные модели начинают расходиться сильнее друг с другом — то есть модели как бы "укрепляются" в своей индивидуальной, но разной интерпретации.
Самый неожиданный результат — круговой тест показал резкую пропасть между топовыми и слабыми моделями: у GPT-5 и Claude ошибка в этом тесте была в разы меньше, чем у Llama3-8B и Mistral-7B, у которых результат близок к случайному угадыванию.
