3,583 papers
arXiv:2608.21089 77 21 авг. 2026 г. FREE

Inertia of Confidence: почему ИИ увереннее всего врёт именно там, где правило недавно изменилось

КЛЮЧЕВАЯ СУТЬ
ИИ выдаёт устаревшее правило с уверенностью 9 из 10 — звучит это ровно так же твёрдо, как правильный ответ. Метод позволяет заранее находить моменты, где модель тонет в старых данных — критично для юридических, налоговых и регуляторных вопросов, где норму недавно поменяли. Фишка: старое правило встречалось в текстах модели в разы чаще нового — статистика тянет ответ в прошлое, даже если модель формально видела текст с поправкой. На 60 юридических кейсах точность падала именно там, где менялся закон — а уверенность оставалась на максимуме.
Адаптировать под запрос

Модель может выдать неправильный ответ с уверенностью 9-10 из 10 — и это не случайность, а системный паттерн. Происходит это конкретно в ситуациях, где старое правило (закон, норматив, практика) долго было стандартом, а недавно его заменили новым. Модель как бы "тонет" в старых данных: их количественно больше в её обучении, чем упоминаний новой нормы, и это статистическое большинство перетягивает ответ на себя — даже если модель формально "знает" про изменение.

Представь: спрашиваешь ИИ про размер штрафа или правило, которое обновили пару лет назад. Модель уверенно называет старую цифру или старый порядок — и звучит это ровно так же убедительно, как правильный ответ. Никакой видимой разницы между "уверен и прав" и "уверен и ошибся" нет — тон ответа одинаково твёрдый. Причина простая: в текстах, на которых модель училась, старое правило встречалось в разы чаще нового, и это "тянет" ответ в прошлое, даже когда модель технически осведомлена об обновлении.

Исследователи протестировали три ИИ (ChatGPT, Meta AI, Perplexity) на 60 юридических кейсах и заметили: как только сценарий касался недавней поправки к закону, точность падала, а уверенность — нет. Отсюда практический вывод: если в вопросе есть шанс, что правило недавно изменилось, — нужно явно спросить модель о недавних изменениях отдельным пунктом промпта, а не доверять первому уверенному ответу.

🔬

Схема метода (протокол проверки на «эффект старого правила»)

ШАГ 1: Задать вопрос с описанием ситуации → получить вердикт + источник (закон/статья/правило)
ШАГ 2: Отдельно спросить: "Есть ли обновления/поправки за последние 1-3 года, которые меняют этот ответ?" → получить явную проверку на актуальность
ШАГ 3: Попросить модель дать финальную уверенность (1-10) с учётом найденного конфликта старое/новое

Всё выполняется в одном диалоге, можно уложить в один промпт с явными пунктами.


🚀

Пример применения

Задача: Владелец интернет-магазина спрашивает ИИ про штрафы за утечку персональных данных клиентов — тема, где закон резко изменили (штрафы для компаний выросли в разы с 2025 года).

Промпт:

Ты — юрист по информационной безопасности. Ответь на вопрос: какой штраф грозит компании за утечку персональных данных клиентов по 152-ФЗ?

Дай ответ по пунктам:
1. Конкретная сумма штрафа
2. Статья закона / нормативный акт
3. Были ли изменения в этой норме за последние 1-3 года — да/нет, и если да, какие
4. Уверенность в ответе от 1 до 10, с учётом найденных изменений (если изменения есть и ты не уверен, что учёл их полностью — снижай уверенность)

Результат: Модель выдаст структурированный ответ с суммой, статьёй и отдельным пунктом про изменения. Если она реально видела поправку — назовёт новую сумму. Если тянет к старому паттерну — есть шанс, что явный вопрос про «изменения за последние годы» заставит её сверить себя и снизить уверенность или поправиться. Без этого явного пункта риск получить уверенный, но устаревший ответ выше.


🧠

Почему это работает

Модель не «помнит» факты как список карточек — она предсказывает наиболее вероятное продолжение текста. Если старое правило встречалось в интернете и документах тысячи раз, а новое — только пару сотен, статистически «старый» ответ выигрывает при генерации, даже если модель формально видела текст с поправкой.

Сильная сторона модели — она умеет сверять факты, когда её прямо просят это сделать, а не отдавать первый пришедший в голову ответ. Явный вопрос "проверь, было ли обновление" переключает модель из режима "автоматически завершить предложение" в режим "поискать противоречия" — и это снижает риск слепой уверенности.

Рычаг управления: если тема заведомо стабильная (не менялась годами) — этот доп.шаг не нужен, экономь время. Если тема касается законов, тарифов, регламентов платформ, версий продуктов — добавляй пункт про "изменения за последние N лет" всегда.


📋

Шаблон промпта

Ты — эксперт по теме {тема_вопроса}. Ответь на вопрос: {вопрос}.

Дай ответ по пунктам:
1. Конкретный ответ / вердикт
2. Источник (закон, документ, официальное правило)
3. Проверка: были ли изменения в этой норме/правиле за последние {период} — да/нет, если да — какие именно
4. Уверенность от 1 до 10 с учётом найденных изменений (если есть конфликт старого и нового — снижай уверенность и явно скажи об этом)

Подставляй: {тема_вопроса} — область (налоги, трудовое право, правила площадки), {вопрос} — конкретная ситуация, {период} — сколько лет назад могло произойти изменение (обычно 1-3 года).

🚀 Быстрый старт — вставь в чат:

Вот шаблон для проверки, не устарел ли ответ ИИ из-за недавних изменений правил. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про тему и период проверки — потому что без этого она не поймёт, где именно искать возможный конфликт старого и нового правила.


⚠️

Ограничения

⚠️ Не гарантия правды: даже с явным запросом на проверку изменений модели в исследовании продолжали ошибаться с высокой уверенностью в 6-30% случаев (зависит от модели). Метод снижает риск, но не убирает его.

⚠️ Для решений с реальными деньгами/последствиями (суд, налоги, штрафы) — ответ ИИ нужно сверять с первоисточником (текст закона, официальный сайт), а не только с диалогом.

⚠️ «Продолжает придумывать, чтобы быть вежливым»: если просишь модель выдать длинный список пунктов, при исчерпании реальных данных она может начать сочинять продолжение в том же формате, не сообщая об этом. Если просишь список — явно спрашивай "это все реальные случаи, или ты дополняешь недостающие?".


🔍

Как исследовали

Исследователи собрали батарею из 60 юридических кейсов по индийскому договорному праву — часть кейсов проверяла старые правила, часть (10 кейсов) — сценарии после крупной поправки 2018 года, которая изменила порядок исполнения обязательств. Три ИИ-системы (ChatGPT, Meta AI, Perplexity) отвечали через обычный пользовательский интерфейс — так, как это делает реальный студент или юрист, без хитрых API-настроек. Каждой модели задали роль "судьи Верховного суда" и попросили дать вердикт, источник и честную уверенность от 1 до 10.

Результат: точность падала на "свежих" кейсах (50-70% против 80-100% на классике), но уверенность модели почти не снижалась — она держалась на уровне 8.8-9.4 из 10 независимо от правильности. Отдельно заметили забавный и тревожный баг: одна из моделей, дойдя до конца списка из 60 кейсов, сама начала генерировать ещё 30 вымышленных дел в том же формате — потому что была "заточена" продолжать диалог, а не сообщать о завершении задачи.

Параллельно опросили 380 студентов юрфаков: 42% сталкивались с выдуманными ссылками на дела от ИИ многократно, и именно они чаще проверяют факты (4.2 из 5) по сравнению с теми, кто не сталкивался (2.8 из 5) — то есть люди учатся не доверять ИИ только после того, как он их обманул, а не заранее.


📋 Дайджест исследования

Ключевая суть

ИИ выдаёт устаревшее правило с уверенностью 9 из 10 — звучит это ровно так же твёрдо, как правильный ответ. Метод позволяет заранее находить моменты, где модель тонет в старых данных — критично для юридических, налоговых и регуляторных вопросов, где норму недавно поменяли. Фишка: старое правило встречалось в текстах модели в разы чаще нового — статистика тянет ответ в прошлое, даже если модель формально видела текст с поправкой. На 60 юридических кейсах точность падала именно там, где менялся закон — а уверенность оставалась на максимуме.

Принцип работы

Правило простое: не доверяй уверенности напрямую — явно спрашивай про обновления отдельным пунктом. Разделяй ответ на три части: вердикт, проверка на актуальность за последние годы, финальная уверенность с учётом найденного конфликта. Это переключает модель из режима "закончить предложение" в режим "искать противоречия".

Почему работает

Модель не хранит факты как карточки в базе — она предсказывает самое вероятное продолжение текста. Старая норма встречалась тысячи раз, новая — пару сотен. При генерации выигрывает старая, даже если модель технически "знает" про изменение. Прямой вопрос про изменения переключает модель в режим проверки — и это единственное что реально снижает слепую уверенность. Три модели (ChatGPT, Meta AI, Perplexity) на 60 кейсах показали один и тот же паттерн: точность падает, уверенность нет.

Когда применять

Юридические, налоговые и регуляторные вопросы → конкретно темы где правило точно менялось за последние 1-3 года: штрафы, лимиты, ставки, правила площадок и сервисов. Не подходит для стабильных тем, которые не менялись годами — там дополнительная проверка просто трата времени.

Мини-рецепт

1. Задай вопрос: получи вердикт и источник (закон, статья, документ)
2. Спроси про обновления: "были ли изменения за последние 1-3 года, которые меняют этот ответ?"
3. Попроси финальную уверенность: от 1 до 10, с учётом найденного конфликта старое/новое
4. Проверь по первоисточнику: если решение касается денег, суда или штрафов — не доверяй только диалогу

Примеры

[ПЛОХО] : Какой штраф грозит компании за утечку персональных данных клиентов?
[ХОРОШО] : Ответь по пунктам: 1. Конкретная сумма штрафа 2. Статья закона / нормативный акт 3. Были ли изменения в этой норме за последние 1-3 года — да/нет, если да, какие 4. Уверенность от 1 до 10 с учётом найденных изменений (если есть конфликт старого и нового — снижай уверенность)
Источник: Can Legal AI Know When It Is Wrong? And Do Students Know When It Is?
ArXiv ID: 2608.21089 | Сгенерировано: 2026-08-24 05:27

Проблемы LLM

ПроблемаСутьКак обойти
Уверенность не падает при смене правилаЕсли норма (закон, тариф, версия продукта) недавно изменилась — модель может уверенно называть старое значение. Тон ответа одинаково твёрдый и для правильного, и для устаревшего ответа. Визуально не отличить, где модель права, а где ошибласьОтдельным пунктом промпта спроси: "были ли изменения за последние 1-3 года, которые меняют этот ответ?" Попроси модель понизить уверенность, если найдёт конфликт старого и нового
Модель дополняет список, не сообщая об этомЕсли просишь список (случаев, примеров, пунктов), а реальных данных не хватает — модель продолжает генерировать в том же формате. Не помечает, где закончились реальные факты и начались придуманныеЯвно спрашивай: "это все реальные случаи, или ты что-то дополняешь для полноты списка?"

Методы

МетодСуть
Явная проверка на "устаревание правила"Задай вопрос в три шага: 1) получить ответ + источник, 2) отдельно спросить "были ли обновления за последние N лет", 3) попросить финальную уверенность 1-10 с учётом найденного конфликта. Дай ответ по пунктам: 1. Вердикт 2. Источник 3. Изменения за последние N лет — да/нет 4. Уверенность 1-10 с учётом изменений. Работает потому что явный вопрос про противоречия переключает модель из режима "продолжить текст самым вероятным способом" в режим "искать конфликт между старым и новым". Применяй: темы с законами, тарифами, регламентами платформ, версиями продуктов. Не нужно: стабильные темы, которые не менялись годами
📖 Простыми словами

Can LegalAIKnow When It Is Wrong? And Do Students Know When It Is?

arXiv: 2608.21089

Нейросети не хранят законы в голове как строгую базу данных — они тупо угадывают самое вероятное продолжение текста. Если старая норма упоминалась в интернете десять тысяч раз, а свежая поправка — всего двести, модель статистически выдаст устаревший бред, даже если мельком видела новый закон. Для неё истина — это не актуальность, а частота повторений в обучающей выборке.

Это как нанять юриста, который тридцать лет шпарил по старым кодексам и отвечает на автомате, даже не заглядывая в свежие базы. Уверенность на миллион, формулировки идеальные, но он отправляет тебя прямиком под гигантский штраф. Модель звучит максимально авторитетно, но несёт устаревшую дичь просто в силу привычки своих весов.

Исследование вскрывает двойную проблему: Legal AI не понимает, когда врёт, а люди слепо ведутся на этот тон. Спроси бота про штрафы за утечку персональных данных на 2025 год — он бодро выдаст старые копейки вместо реальных оборотных штрафов. Самый смак в том, что ни сама модель, ни проверяющий студент не видят подвоха в сгенерированной галлюцинации.

Тестировали на юридических вопросах, но грабли везде одинаковые. Тот же провал ждёт тебя в налоговом учете, регламентах маркировки или кодинге со свежими версиями библиотек. Везде, где правила резко переписали, статистический перевес старых данных превращает нейросеть в генератор вредных советов.

Короче: никогда не используй голый ChatGPT как бесплатного консультанта по динамичным правилам. Если цена ошибки — штрафы и кассовый разрыв, прикручивай поиск по свежим документам через RAG или иди к живому юристу. Иначе сэкономишь пять минут, а потом будешь судорожно гадать, откуда прилетел иск.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с