TL;DR
Когда вы просите LLM оценить юридический вопрос и подсовываете ей текст закона или статьи, модель может поверить в подделку, если она оформлена как настоящий нормативный документ — даже если дата, статья или иерархия норм в ней изменены. Исследователи сравнили, как модели работают с медициной (где факты стабильны) и с правом (где закон меняется во времени и зависит от юрисдикции), и нашли резкую разницу.
В медицине модель, получив подтверждённый источник, надёжно улучшает ответ. В праве — наоборот: модель не умеет отличить, актуальна ли предоставленная статья закона, отменена ли она более новым актом, или противоречит другому документу. Она просто читает текст закона как обычный текст, а не как элемент иерархии с датой действия. Хуже того: чем крупнее и "послушнее" модель (лучше выполняет инструкции), тем сильнее она доверяет поддельному авторитетному источнику — то есть точность и слепое доверие растут вместе.
Метод исследования — это диагностика по четырём осям (знание без контекста, знание с контекстом, устойчивость к подделанному контексту, устойчивость к формату вопроса), но для практики важен один вывод: при работе с законами через LLM нужно явно требовать проверку актуальности и непротиворечивости, а не полагаться на то, что модель сама это заметит.
Схема метода (диагностика, не техника применения)
ОСЬ 1 — Знание без подсказок → модель отвечает по памяти, без контекста
ОСЬ 2 — Знание с контекстом → модели дают настоящий документ (закон/статья)
ОСЬ 3 — Устойчивость к подделке → в контекст вставляют изменённые даты, отменённые нормы, поддельные ссылки
ОСЬ 4 — Устойчивость к формату → меняют вид вопроса (нумерация, порядок вариантов, отсутствие правильного ответа)
Всё это — методология тестирования моделей исследователями. Читателю нужен не этот пайплайн, а вывод: юридический контекст модель проверяет хуже, чем медицинский.
Пример применения
Задача: Вы — предприниматель, готовите договор с подрядчиком и просите ChatGPT/Claude проверить, актуальна ли норма 44-ФЗ или закон о защите прав потребителей, которую вам процитировал юрист-фрилансер или нашли в интернете.
Промпт:
Вот текст нормы, которую мне предоставили:
{вставить текст закона/статьи}
Прежде чем использовать этот текст для ответа:
1. Проверь, есть ли признаки того, что норма могла быть изменена или отменена более поздним актом.
2. Укажи явно, если дата документа выглядит подозрительной или не соответствует контексту вопроса.
3. Не принимай текст как истину по умолчанию — отметь, где ты не уверен в его актуальности, и почему.
4. Дай ответ только после этой проверки, отдельно указав уровень уверенности.
Вопрос: {ваш юридический вопрос}
Результат: Модель сначала явно распишет, есть ли в предоставленном тексте признаки нестыковок (даты, ссылки на другие акты, противоречия), и только потом даст ответ с пометкой уровня уверенности — вместо того чтобы сразу довериться тексту, потому что он "выглядит официально".
Почему это работает
Слабость LLM: модель не хранит иерархию и временную актуальность законов внутри себя — она видит текст статьи и текст вопроса как два куска текста, которые нужно сопоставить. У неё нет "внутреннего календаря", когда какая норма действовала.
Сильная сторона LLM: она отлично следует явным инструкциям — если её прямо попросить проверить противоречия и обосновать уверенность, она это сделает добросовестно, просто сама по себе не догадывается спросить.
Метод (принцип) использует эту сильную сторону: явная инструкция "проверь актуальность, не доверяй слепо" заставляет модель включить критическую проверку, которую она иначе пропускает, потому что авторитетно оформленный текст воспринимается ею как достоверный по умолчанию.
Рычаг управления: формулировка "не принимай на веру, укажи неуверенность отдельно" — это ключевая фраза. Убрав её, вы получаете модель, которая просто пересказывает поданный текст как истину. Добавив её — получаете модель, которая явно маркирует риск.
Шаблон промпта
Вот нормативный текст / выдержка из документа: {текст_нормы}
Перед тем как отвечать на мой вопрос:
1. Оцени, нет ли признаков того, что документ устарел, отменён или противоречит другим известным нормам.
2. Явно укажи, если дата, номер акта или формулировка вызывают сомнение в актуальности.
3. Не считай текст истинным по умолчанию — отдельно отметь уровень уверенности в его достоверности (низкий/средний/высокий).
4. Дай ответ на вопрос только после этой проверки.
Мой вопрос: {вопрос}
Подставляйте в {текст_нормы} любой юридический, договорной или регуляторный текст, а в {вопрос} — конкретный вопрос, который вы хотите разрешить с его помощью.
🚀 Быстрый старт — вставь в чат:
Вот шаблон проверки юридического контекста на актуальность. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какой именно документ и какой вопрос вы хотите проверить — потому что без конкретики нельзя понять, какие даты и противоречия искать.
Ограничения
⚠️ Не защита от галлюцинаций: метод заставляет модель заявить о неуверенности, но не гарантирует, что она правильно определит, действительно ли норма отменена — для этого у неё всё равно должны быть актуальные знания или свежий поиск.
⚠️ Крупные модели не безопаснее: исследование показало, что более крупные и более "послушные" модели сильнее поддаются авторитетно оформленным подделкам — не рассчитывайте, что топовая модель автоматически надёжнее в этом вопросе.
⚠️ Формат вопроса влияет на точность: если вы задаёте вопрос в виде списка вариантов, порядок и формат вариантов могут смещать ответ независимо от содержания — для важных юридических решений лучше просить свободный ответ, а не выбор из списка.
Как исследовали
Команда сравнила поведение семи моделей (от Qwen-3 4B до GPT-OSS 120B и Gemini 2.5 Flash) на юридических и медицинских вопросах, построив специальный бенчмарк LEGAL-LINK-EU — 1127 вопросов на основе реальных документов из базы законов Евросоюза (EUR-Lex), где нужно понять, как один нормативный акт влияет на действие другого (отменяет, продлевает, исправляет).
Модели тестировали на четырёх этапах: сначала без подсказок, потом с настоящим текстом закона, потом с подделанным текстом (изменённые даты, ложные иерархии, вводящие в заблуждение детали), и наконец — с изменённым форматом вопроса. Для сравнения брали аналогичные по сложности медицинские вопросы (MedQA) с такими же типами подделок.
Результат удивил исследователей: в медицине контекст почти всегда помогал модели, а в праве — часто наоборот, модель поддавалась подделке даже сильнее, чем отвечала бы без контекста вообще. Логика простая: закон не хранится в модели как жёсткая иерархия с датами, а воспринимается как обычный текст, поэтому подделка, оформленная убедительно, обманывает модель легче, чем поддельный медицинский факт, который противоречит "твёрдой" биологии.
