3,583 papers
arXiv:2608.26327 76 26 авг. 2026 г. FREE

Слово "unlikely" от ИИ может значить совсем не то, что вы думаете

КЛЮЧЕВАЯ СУТЬ
Обнаружено: когда ИИ говорит 'маловероятно', внутри у него другое число, чем в вашей голове — систематически выше. Метод числовой шкалы 0-100 позволяет вытащить конкретную цифру вместо расплывчатого слова и сравнивать оценки разных моделей и людей напрямую. Фишка — слова с негативным оттенком типа 'unlikely' модель сдвигает вверх: там где человек думает 10%, модель держит 20-25%. А слово possible — вообще без якоря, скачет от 10 до 50 в разных попытках одной и той же модели.
Адаптировать под запрос

TL;DR

Когда ИИ говорит "скорее всего не сработает" или "маловероятно" — это не то же самое число, что вы представляете в голове. Модели переводят словесные оценки вероятности ("невозможно", "возможно", "почти наверняка") в числа примерно как люди: сохраняют порядок слов и правильно ставят крайние точки (0% для "невозможно", 100% для "точно", 50% для "шансы равны").

Но есть системная ошибка: слова с отрицательным оттенком — "unlikely" (маловероятно), "improbable" (невероятно) — модели переводят в более высокие числа, чем люди. То есть там, где человек думает "процентов 10", модель внутри держит "процентов 20-25". А слово "possible" (возможно) — это вообще лотерея: одна и та же модель в разных попытках может понимать его то как "10%", то как "50%". У людей, кстати, то же самое — это слово исторически известно как самое нестабильное.

Есть простой способ снизить разброс: если попросить модель объяснить свой ответ перед тем как дать число — она станет более стабильной сама с собой (одна и та же модель перестанет метаться между "20" и "60"). Но платите вы за это тем, что разные модели начинают расходиться друг с другом сильнее.

🔬

Схема метода

СИТУАЦИЯ: ИИ даёт словесную оценку вероятности ("маловероятно", "возможно")
ПРОБЛЕМА: слово ≠ число в голове модели, и ≠ число в голове человека

ЧТО ДЕЛАТЬ:
ШАГ 1: Просить число, а не слово → "оцени вероятность от 0 до 100"
ШАГ 2: Просить объяснение перед числом → снижает разброс ответов ОДНОЙ модели
ШАГ 3: Не доверять слову "возможно" вообще → просить конкретику

🚀

Пример применения

Задача: Вы спрашиваете ИИ-помощника (например, при анализе бизнес-идеи для инвестора) — "Как ты оцениваешь шансы, что этот стартап с доставкой продуктов взлетит на рынке Москвы?"

Промпт (плохой вариант, без числа):

Оцени вероятность успеха этого стартапа: {описание стартапа}

Модель ответит: "Это маловероятно, учитывая конкуренцию с Яндекс.Лавкой и Самокатом."

Промпт (хороший вариант, с числом и объяснением):

Оцени вероятность успеха этого стартапа: {описание стартапа}

Сначала кратко объясни свои рассуждения по шагам, 
затем дай финальную оценку — одно число от 0 до 100, 
где 0 = точно провалится, 100 = точно взлетит.

Результат: В первом случае вы услышите "маловероятно" — и понятия не имеете, значит ли это 5% или 25% в голове модели (исследование показывает, что для таких слов у моделей систематический сдвиг вверх). Во втором случае вы получите конкретное число и рассуждение, которое можно сравнить с другими оценками (от других моделей, от коллег), и оно будет более стабильным при повторных запросах к этой же модели.


🧠

Почему это работает

Слова про вероятность — это не универсальный код, а языковой паттерн, который модель выучила из текстов. В текстах люди используют "unlikely" в самых разных контекстах — от "вряд ли пойдёт дождь" до "вряд ли конец света" — и модель усредняет это в свою внутреннюю оценку. Отсюда систематический сдвиг: у модели "внутренний счётчик" для негативных слов настроен чуть выше человеческого.

Сильная сторона модели — она хорошо держит крайние точки шкалы ("невозможно" = 0, "точно" = 100) и порядок слов (unlikely < possible < likely) почти идеально, как человек. Слабое место — середина шкалы и особенно многозначные слова типа "possible", где нет чёткого якоря.

Просьба объяснить решение работает как принудительная фиксация: модель, вынужденная проговорить рассуждение, выбирает одну логическую цепочку и держится её — вместо того чтобы каждый раз генерировать число "с нуля" из общего облака ассоциаций.

Рычаг управления: если вам нужна консистентность одной модели — просите объяснение перед числом. Если нужно сравнить несколько моделей между собой — знайте, что объяснение может увеличить их разногласия, а не уменьшить.


📋

Шаблон промпта

Оцени вероятность следующего события: {событие}

Сначала распиши рассуждение по шагам: 
какие факторы за, какие против, на что ты опираешься.

Затем дай финальную оценку в виде ОДНОГО числа от 0 до 100:
0 = событие точно не произойдёт
100 = событие точно произойдёт
50 = шансы равны

Не используй словесные формулировки типа "вероятно" или "маловероятно" 
в финальном ответе — только число.

🚀 Быстрый старт — вставь в чат:

Вот шаблон для получения числовой оценки вероятности от ИИ. 
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какое именно событие оценивать и в каком контексте (бизнес-риск, медицинский прогноз, вероятность успеха проекта) — потому что формулировка события влияет на то, какие факторы модель будет взвешивать в рассуждении.


⚠️

Ограничения

⚠️ Слово "возможно" ненадёжно всегда: даже с числовым форматом ответа модель может колебаться между "10" и "50" для этого слова — это фундаментальное свойство слова, не баг конкретной модели.

⚠️ Слабые модели дают случайные числа: у небольших открытых моделей (типа Llama3-8B, Mistral-7B) внутренняя логика "слово → число → слово" настолько несогласованна, что результат статистически не отличим от случайного угадывания. Для важных решений — используйте топовые модели (GPT-5, Claude Opus/Sonnet).

⚠️ Просьба объяснить — не серебряная пуля: для части моделей объяснение путает модель ещё больше — она может начать оценивать вероятность не события, а вероятность того, что сам текст промпта "выглядит естественно" (реальный кейс из исследования).


🔍

Как исследовали

Исследователи взяли 11 слов вероятности ("невозможно", "маловероятно", "возможно", "вероятно", "почти наверняка" и другие) и показали их 19 моделям — от Claude Opus и GPT-5 до маленьких открытых моделей типа Llama3-8B. Каждой модели задавали вопрос в трёх форматах: просто дай число, дай число с объяснением, и хитрый "круговой" тест — модели давали случайное число, просили назвать подходящее слово, а потом в отдельном запросе — перевести это же слово обратно в число.

Сравнивали с человеческим эталоном — метаанализом Мостеллера и Ютца, который собрал данные из 20 исследований о том, как люди понимают эти слова. Оказалось, что модели на удивление точно повторяют человеческую структуру — включая её слабости (нестабильность слова "possible"). Но авторов удивило, что просьба объяснить рассуждение делает каждую отдельную модель более стабильной, но разные модели начинают расходиться сильнее друг с другом — то есть модели как бы "укрепляются" в своей индивидуальной, но разной интерпретации.

Самый неожиданный результат — круговой тест показал резкую пропасть между топовыми и слабыми моделями: у GPT-5 и Claude ошибка в этом тесте была в разы меньше, чем у Llama3-8B и Mistral-7B, у которых результат близок к случайному угадыванию.


📋 Дайджест исследования

Ключевая суть

Обнаружено: когда ИИ говорит 'маловероятно', внутри у него другое число, чем в вашей голове — систематически выше. Метод числовой шкалы 0-100 позволяет вытащить конкретную цифру вместо расплывчатого слова и сравнивать оценки разных моделей и людей напрямую. Фишка — слова с негативным оттенком типа 'unlikely' модель сдвигает вверх: там где человек думает 10%, модель держит 20-25%. А слово possible — вообще без якоря, скачет от 10 до 50 в разных попытках одной и той же модели.

Принцип работы

Модель жёстко держит только крайние точки шкалы: невозможно = 0, точно = 100, шансы равны = 50. Это как линейка с чёткими концами — а вот середина плывёт. Негативные слова модель систематически задирает выше человеческого уровня, а многозначные вроде possible не привязаны ни к чему вообще. Порядок слов (unlikely < possible < likely) модель держит почти идеально — а вот конкретное число под каждым словом гуляет.

Почему работает

Модель выучила слова вероятности из текстов, где 'unlikely' использовали и для дождя, и для конца света. Она усредняет все эти контексты в одну цифру — отсюда сдвиг вверх для негативных слов. Просьба объяснить рассуждение до числа работает как принудительный якорь — модель выбирает одну логическую цепочку и держится её вместо генерации числа с нуля каждый раз. При этом слабые модели типа Llama3-8B и Mistral-7B выдают числа, которые статистически не отличить от случайного угадывания.

Когда применять

Оценка рисков через ИИ → конкретно для бизнес-анализа, медицинских прогнозов, оценки проектов, где нужно сравнить цифры от разных моделей или сопоставить с оценкой человека. Не подходит для быстрых бытовых вопросов, где важна скорость ответа, а не точный процент — там простое слово от ИИ сработает быстрее и не требует лишних шагов.

Мини-рецепт

1. Проси число, не слово: вместо 'оцени вероятность' пиши 'дай оценку от 0 до 100'.
2. Проси рассуждение перед числом: пусть модель распишет плюсы и минусы, а цифру выдаст последней строкой — это зафиксирует одну логику вместо разброса.
3. Не доверяй слову 'возможно': если модель ответила им без числа — переспроси. Это самое нестабильное слово, разброс 10-50%.
4. Для важных решений бери топовую модель: GPT-5 или Claude Opus/Sonnet. Мелкие открытые модели дают числа на уровне случайного угадывания.

Примеры

[ПЛОХО] : Оцени вероятность успеха этого стартапа с доставкой продуктов в Москве
[ХОРОШО] : Оцени вероятность успеха стартапа: {описание}. Сначала распиши рассуждение по шагам — какие факторы за, какие против. Затем дай финальную оценку одним числом от 0 до 100, где 0 = точно провалится, 100 = точно взлетит. Без слов типа "вероятно" в финальном ответе — только число.
Источник: How Unlikely Is 'Unlikely'? Assessing Verbal Probability Perception Across Large Language Models
ArXiv ID: 2608.26327 | Сгенерировано: 2026-08-28 04:27

Проблемы LLM

ПроблемаСутьКак обойти
Словесная оценка вероятности не равна конкретному числуМодель говорит "маловероятно" или "возможно". Внутри у неё может быть любое число — от 10% до 50%. Ты не знаешь какое. Слово нельзя сравнить между разными ответами модели, разными моделями или с твоим собственным ожиданиемПроси число, а не слово: "оцени вероятность от 0 до 100". Явно запрети словесные формулировки типа "вероятно" в финальном ответе
Слово "возможно" не имеет стабильного значения даже для одной моделиЗадаёшь один и тот же вопрос модели несколько раз. Она использует слово "possible" ("возможно") в описании. При переводе в число получаешь то 15%, то 55%. Это не баг конкретной модели — слово многозначное само по себе, у людей то же самоеНе используй многозначные слова вероятности в запросе и не принимай их в ответе. Требуй число сразу. Если слово всё же появилось — переспроси "а конкретно, в процентах?"

Методы

МетодСуть
Рассуждение перед числом — фиксация оценки вероятностиПроси модель сначала объяснить логику (что за событие, какие факторы за и против), и только потом дать число от 0 до 100. Сначала объясни рассуждение, затем одно число. Почему работает: без объяснения модель каждый раз генерирует число "с нуля" из размытого облака ассоциаций. С объяснением она фиксирует одну логическую цепочку и держится её — разброс у одной и той же модели при повторных запросах падает. Обратная сторона: разные модели после объяснения могут расходиться сильнее друг с другом, а не сближаться. Когда применять: нужна стабильность повторных ответов одной модели. Когда не применять: сравниваешь оценки нескольких разных моделей между собой — там объяснение может увеличить разброс

Тезисы

ТезисКомментарий
Модель точно оценивает крайние точки вероятности, но путается в середине шкалыСлова типа "невозможно" (0%) и "точно" (100%) модель переводит в числа почти идеально, как человек. Также сохраняет правильный порядок слов по возрастанию вероятности. Но чем ближе к середине шкалы (30–70%), тем больше разброс и ошибок — там нет чётких словесных якорей. Применяй: доверяй оценке модели на крайних значениях шкалы, но для среднего диапазона всегда требуй явное число, а не слово
📖 Простыми словами

How Unlikely Is "Unlikely"? Assessing Verbal Probability Perception AcrossLargeLanguageModels

arXiv: 2608.26327

Когда нейросеть пишет тебе «это маловероятно», в её цифровых мозгах крутится совсем не та цифра, о которой ты думаешь. Модели не высчитывают математическую вероятность по формулам — они тупо воспроизводят языковые паттерны из терабайтов текста. Если для тебя «вряд ли» — это жалкие 5%, то для LLM это могут быть вполне рабочие 20% или даже 30%.

Это как договариваться с другом, который пишет «буду через пять минут», а сам только заходит в душ. Формально он обозначил статус, но в реальности шкала времени у вас абсолютно разная. С искусственным интеллектом та же петрушка: словесные вероятности слишком размыты, поэтому модель смешивает контексты от прогноза погоды до падения метеорита в одну кучу.

Что происходит под капотом: крайние точки вроде «невозможно» (0%), «шансы равны» (50%) и «точно» (100%) сетка держит четко. Но весь промежуточный диапазон безбожно плывёт. У моделей зашит систематический сдвиг в оценках: когда нейросеть слышит «сомнительно», её внутренний калькулятор завышает шанс успеха гораздо сильнее, чем это делает живой человек.

Тестировали восприятие слов, но проблема бьёт по любой аналитике: от оценки рисков стартапа до юридического аудита и безопасности кода. Если ты просишь ChatGPT прикинуть, «взлетит ли проект», и получаешь ответ «скорее всего нет», ты рискуешь принять неверное решение из-за банальной иллюзии взаимопонимания. В бизнесе такой размытый вокабуляр стоит денег.

Короче: хватит просить у ИИ качественные формулировки вроде «опиши шансы словами». Всегда требуй прямой числовой диапазон от 0 до 100% с жесткой калибровкой уверенности. Иначе ты будешь строить планы на базе литературных ощущений, пока модель считает, что «маловероятный факап» — это ерунда, на которую можно забить.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с