3,583 papers
arXiv:2608.23660 74 24 авг. 2026 г. FREE

Не верь LLM, когда она говорит "я уверен на 90%" — особенно если речь о причине и следствии

КЛЮЧЕВАЯ СУТЬ
80% ошибочных ответов LLM про причину и следствие сопровождаются заявленной уверенностью 80% и выше — цифра уверенности вообще не связана с правдой. Метод позволяет проверять причинные выводы LLM без API и кода, прямо в обычном чате. Фишка: вместо того чтобы спрашивать модель 'насколько ты уверена', задаёшь один вопрос 5 разными словами и смотришь, совпадают ли ответы — совпадение оказалось надёжнее самооценки уверенности.
Адаптировать под запрос

TL;DR

Когда вы спрашиваете у LLM "X вызывает Y?" — модель почти всегда отвечает "да", даже если связь непрямая или направление перепутано. Хуже того: в 80% таких ошибочных ответов модель называет уверенность 80% и выше. Заявленная уверенность модели не имеет отношения к тому, права она или нет.

Причина в том, что модель путает "связано" и "является прямой причиной". Классический пример: вирус → инфекция → положительный тест. Модель легко скажет, что вирус напрямую вызывает положительный тест — хотя это происходит через промежуточное звено. Модель распознаёт причинную связанность, но не умеет чётко определять направление и прямоту этой связи. И чем больше переменных в системе, тем хуже — модели буквально штампуют связи "на всякий случай", создавая избыточно плотную картину причин.

Надёжнее не спрашивать модель "насколько ты уверена", а проверять её ответ через повторение — задать один и тот же причинный вопрос разными формулировками (или разным моделям) и смотреть, совпадают ли ответы. Совпадение ответов (agreement) оказалось заметно надёжнее, чем самооценка уверенности моделью.


🔬

Схема метода

ШАГ 1: Задать причинный вопрос явно, разделяя связанность и прямую причину
        → "X напрямую вызывает Y, или через промежуточный фактор?"

ШАГ 2: Переформулировать тот же вопрос 3-5 раз разными словами
        (или задать в разных чатах/моделях)
        → собрать набор ответов

ШАГ 3: Смотреть на согласие ответов, а не на цифру уверенности
        → если ответы расходятся — не доверять выводу
        → если совпадают — можно использовать как гипотезу для проверки

Все шаги можно выполнить руками в обычном чате — без API и кода.


🚀

Пример применения

Задача: Маркетолог анализирует, почему упали продажи в интернет-магазине, и хочет понять цепочку причин перед тем, как менять стратегию.

Промпт (шаг 1):

Я вижу два факта: 
1) Конкурент снизил цены на 15%
2) Наши продажи упали на 20% за тот же месяц

Ответь строго на два вопроса:
1. Снижение цен конкурентом НАПРЯМУЮ вызвало падение наших продаж, 
   или это происходит через промежуточный фактор (например, отток клиентов 
   к конкуренту, изменение восприятия бренда)?
2. Есть ли шанс, что причинность обратная — то есть падение наших продаж 
   как-то повлияло на решение конкурента снизить цены?

Не давай общую уверенность в процентах — просто объясни логику связи.

Промпт (шаг 2, повтор в новом чате):

У меня падение продаж на 20% и конкурент снизил цены на 15% в тот же месяц.
Это прямая причина, косвенная, или могут быть скрытые общие факторы 
(например, сезонность, которая одновременно двинула и цены конкурента, и мой спрос)?

Результат: Вы получите объяснение логики связи в двух формулировках. Если оба ответа сходятся на "вероятно есть промежуточный фактор" — это надёжный сигнал копать глубже (проверить сезонность, отток клиентов). Если ответы расходятся или один из них уверенно называет прямую причину без оговорок — не берите этот вывод как основание для решений, ищите данные.


🧠

Почему это работает

LLM обучена на текстах, где причина и следствие часто упоминаются рядом — она хорошо чувствует, что "вирус" и "тест" связаны, но у неё нет внутреннего "счётчика шагов" между ними. Она не отслеживает, сколько звеньев в цепочке — просто видит семантическую близость и превращает её в "да, это причина".

Сильная сторона модели — она стабильно реагирует на форму вопроса. Если спросить пять раз по-разному, честный сигнал (реальная причинная связь) будет всплывать снова и снова, а случайная догадка — рассыпется на разные ответы.

Метод использует эту стабильность как замену недостающему "счётчику причинности": вместо того чтобы просить модель оценить свою уверенность (она не умеет), мы создаём внешний индикатор — согласие между независимыми попытками.

Рычаг управления: количество переформулировок. Для важного решения — 5 разных формулировок вопроса или запрос в 2-3 разные модели (например, ChatGPT + Claude + Gemini). Для менее критичной задачи достаточно 2-3 переформулировок в одном чате.


📋

Шаблон промпта

Я хочу проверить причинно-следственную связь между "{событие А}" и "{событие Б}".

Ответь на три вопроса, не давая общую оценку уверенности в процентах:

1. "{событие А}" напрямую вызывает "{событие Б}", 
   или это происходит через промежуточный фактор? Если да — назови этот фактор.

2. Возможно ли обратное направление — что "{событие Б}" повлияло 
   на "{событие А}"?

3. Есть ли скрытая общая причина, которая одновременно объясняет 
   и "{событие А}", и "{событие Б}", без прямой связи между ними?

Объясни логику своего ответа, а не только вывод.

Подставьте в {событие А} и {событие Б} две вещи, между которыми хотите проверить причинность. Задайте этот промпт в 2-3 разных формулировках (или в разных чатах) и сравните ответы.

🚀 Быстрый старт — вставь в чат:

Вот шаблон для проверки причинно-следственной связи. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какие два события или явления вы сравниваете и в каком контексте (бизнес, здоровье, отношения) — это нужно, чтобы верно сформулировать промежуточные факторы, характерные именно для вашей темы.


⚠️

Ограничения

⚠️ Не работает как точный инструмент, только как фильтр: даже согласие между разными формулировками — это сигнал стабильности, а не доказательство правды. Метод помогает отсеять случайные догадки, но не заменяет проверку на реальных данных.

⚠️ На сложных системах с множеством факторов точность резко падает: чем больше переменных в цепочке причин, тем чаще модель ошибается независимо от того, как задан вопрос.

⚠️ Модель может "помнить" известные примеры, а не рассуждать: если вы спрашиваете про хорошо известный кейс (например, классический учебный пример про курение и рак), модель может выдавать выученный ответ, а не логический вывод — тест на переформулировки в этом случае не поможет.


🔍

Как исследовали

Исследователи взяли 12 open-source моделей (Qwen, Gemma, Llama, Mistral, Phi) и прогнали их через шесть эталонных причинных графов — от медицины до промышленности — задавая вопросы вида "А напрямую вызывает Б?" пятью разными стилями формулировки промпта. Каждый ответ сравнивали с опубликованным "правильным" графом причин.

Логика простая: если модель хорошо понимает причинность, она должна редко путать прямую связь с непрямой и не быть слишком уверенной в ошибках. На деле оказалось наоборот — модели почти всегда переоценивают количество связей (recall выше precision в 94% случаев), и увеличение размера модели помогает только на "понятных по названиям" графах, а на сложных технических датасетах (с кодовыми именами переменных вроде MUNIN1) толку почти нет.

Самое неожиданное — сравнение четырёх видов "уверенности". Заявленная моделью уверенность в процентах и внутренняя вероятность токена (logit) почти никак не связаны с правильностью ответа — logit-уверенность вообще часто "залипает" около 100%, независимо от того, права модель или нет. А вот совпадение ответов между разными формулировками вопроса или между разными моделями оказалось заметно точнее, хотя статистически разница не всегда значима после строгой коррекции.


📋 Дайджест исследования

Ключевая суть

80% ошибочных ответов LLM про причину и следствие сопровождаются заявленной уверенностью 80% и выше — цифра уверенности вообще не связана с правдой. Метод позволяет проверять причинные выводы LLM без API и кода, прямо в обычном чате. Фишка: вместо того чтобы спрашивать модель 'насколько ты уверена', задаёшь один вопрос 5 разными словами и смотришь, совпадают ли ответы — совпадение оказалось надёжнее самооценки уверенности.

Принцип работы

LLM путает связанность и прямую причину. Классика: вирус вызывает инфекцию, инфекция даёт положительный тест — а модель скажет, что вирус напрямую вызывает тест, пропустив промежуточное звено. Модель чувствует семантическую близость слов в тексте, но не считает шаги в цепочке. Правило простое: не спрашивай про уверенность — переформулируй вопрос 5 раз и сравни ответы.

Почему работает

LLM обучена на текстах, где причина и следствие стоят рядом в одном предложении — она нюхом чувствует связь, но не умеет считать звенья между ними. Зато она на удивление стабильна к форме вопроса: реальная причинная связь всплывает при любой формулировке, а случайная догадка при переформулировке рассыпается на разные ответы. Совпадение ответов заменяет модели несуществующий внутренний счётчик причинности. И да — чем больше переменных в системе, тем чаще модель штампует лишние связи «на всякий случай», создавая избыточно плотную картину причин.

Когда применять

Анализ причин → для разбора почему упали продажи, сломалось оборудование, испортились отношения или показатели здоровья — везде, где нужно отличить прямую причину от простой связи в сложной цепочке с промежуточными факторами. НЕ подходит для проверки хрестоматийных примеров типа «курение вызывает рак» — модель просто вспоминает выученный ответ из учебника, а не рассуждает, и переформулировки тут не спасут.

Мини-рецепт

1. Раздели вопрос: спроси не «X вызывает Y?», а «X напрямую вызывает Y, или через промежуточный фактор?»
2. Запусти три вопроса сразу: прямая причина, обратная причина, скрытая общая причина для обоих событий
3. Переформулируй 3-5 раз: тот же смысл, разные слова, желательно в новых чатах или разных моделях
4. Сверь ответы: совпали — можно копать глубже как гипотезу, разошлись — не берите вывод как основание для решений
5. Для важных решений подключи 2-3 разные модели (ChatGPT, Claude, Gemini) — согласие между моделями надёжнее согласия внутри одной

Примеры

[ПЛОХО] : Скажи, конкурент снизил цены на 15% - это вызвало падение моих продаж на 20%? На сколько ты уверен в процентах?
[ХОРОШО] : Я вижу два факта: конкурент снизил цены на 15%, наши продажи упали на 20% в тот же месяц. Ответь: 1) это напрямую вызвало падение продаж, или через промежуточный фактор (отток клиентов, восприятие бренда)? 2) возможна ли обратная причинность? Не давай оценку уверенности в процентах - объясни логику. — затем задать тот же вопрос другими словами в новом чате и сравнить, сходятся ли объяснения.
Источник: From Causal Plausibility to Causal Reliability: Evaluating LLMs as Calibrated Direct Causal-Edge Classifiers
ArXiv ID: 2608.23660 | Сгенерировано: 2026-08-26 05:28

Проблемы LLM

ПроблемаСутьКак обойти
Модель путает "связано" с "является прямой причиной"Спрашиваешь "X вызывает Y?" — модель почти всегда говорит "да", даже если связь идёт через промежуточное звено или направление перепутано. Модель видит семантическую близость слов в тексте и превращает её в причинность. Она не считает "шаги" между причиной и следствиемРазбей вопрос на части: спроси отдельно про прямую связь, про промежуточный фактор и про обратное направление причинности. Не проси общую оценку уверенности — проси объяснить логику
Заявленная уверенность модели не связана с правильностью причинного выводаМодель ошибается в направлении или прямоте причины, но при этом называет уверенность 80% и выше в большинстве ошибочных ответов. Число уверенности здесь бесполезно как индикатор правдыНе спрашивай "насколько ты уверена". Задай тот же причинный вопрос 3-5 раз разными словами и сравни ответы — совпадение важнее заявленного процента

Методы

МетодСуть
Разделение вопроса на прямую причину, промежуточный фактор и обратное направлениеЗадавай причинный вопрос из трёх частей: (1) прямая связь или через промежуточный фактор, (2) возможно обратное направление, (3) есть ли скрытая общая причина. "X напрямую вызывает Y, или через промежуточный фактор? Возможно ли обратное направление?". Работает потому что заставляет модель явно разложить связь по звеньям, а не просто подтвердить семантическую близость. Применяй для любого анализа причин (бизнес, здоровье, метрики). Не работает на очень сложных системах с множеством переменных — там точность падает независимо от формулировки
Проверка согласия через переформулировки вместо самооценки уверенностиЗадай один причинный вопрос 3-5 раз разными словами (или в разных моделях). Смотри, совпадают ли ответы, а не на число уверенности. Совпадение — сигнал доверять выводу, разброс — сигнал не доверять. Работает потому что модель стабильно реагирует на суть вопроса, если ответ основан на реальной закономерности, а не на догадке — случайная догадка рассыпается при переформулировке. Не работает если вопрос про широко известный учебный пример (курение-рак) — модель выдаёт заученный ответ при любой формулировке
📖 Простыми словами

From Causal Plausibility to Causal Reliability: EvaluatingLLMsas Calibrated Direct Causal-Edge Classifiers

arXiv: 2608.23660

Спроси у нейросети, «вызывает ли X явление Y», — и она почти гарантированно выдаст радостное «да». Модели не понимают причинно-следственные связи, они тупо считывают семантическую близость слов в обучающей выборке. Если два понятия часто встречаются в одном контексте, LLM считает, что одно напрямую порождает другое, начисто игнорируя направление процесса и промежуточные звенья.

Это как недалёкий наблюдатель, который видит пожарных на каждом пожаре и уверенно заявляет, что пожарные поджигают дома. Связь вроде бы есть, но причинность вывернута наизнанку. Хуже всего то, что модель несёт эту чушь с каменным лицом: в 80% ошибочных ответов она заявляет уверенность в 80% и выше.

Корень проблемы в том, что LLM путают правдоподобие связи с её фактической надёжностью. Работая как прямой каузальный классификатор, модель не имеет внутреннего счётчика шагов. Ей плевать, сколько звеньев разделяет условный «вирус» и «результат теста»: если слова крутятся в одной теме, она слепит из них прямую связь, полностью провалив калибровку уверенности.

Исследование вскрывает гигантский косяк для тех, кто пытается поручить AI поиск первопричин в бизнесе, маркетинге или медицине. Захочешь выяснить, почему рухнула конверсия интернет-магазина, — модель охотно подтвердит любую твою галлюцинацию и подгонит под неё красивую базу. Слепое доверие AI-аналитике в таких задачах гарантированно приведёт к сливу бюджетов.

Короче: заявленная уверенность нейросети — это чистый блеф. Не используй LLM для поиска причинно-следственных связей без жёстких внешних алгоритмов проверки. Пока у моделей нет честного причинного вывода, их категоричное «да, это причина» остаётся обычной семантической рулеткой.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с