Что можно применить сразу: структура минималистичного промпта с XML-тегами (<персона>, <задача>, <инструкции>) — и понимание, для каких типов задач AI надёжен, а для каких нет.
TL;DR
Топовые LLM (Claude 4 Opus, GPT-5, DeepSeek R1, Gemini 2.5 Pro) написали реальные экзаменационные работы для итальянских адвокатов, судей и нотариусов. Работы перемешали с текстом человека — победителя настоящего экзамена — и отдали независимым экспертам оценивать вслепую, не зная кто автор.
Оказалось: там, где нужно спорить, убеждать, разбирать спорный юридический вопрос — некоторые модели пишут на уровне лучших людей-кандидатов или даже лучше. Но там, где нужно составить один цельный документ, который одновременно удовлетворяет десяткам формальных и смысловых условий — например нотариальный акт с учётом прав наследников, сервитутов, отсутствия разрешения на строительство — абсолютно все модели проваливаются. Они путают детали дела, забывают часть условий, и разные куски документа начинают противоречить друг другу.
Дело не в нехватке юридических знаний у моделей. Дело в типе задачи: рассуждение вслух (аргументация, дискуссия, разбор проблемы) LLM делают отлично. Целенаправленное конструирование (документ, где каждая часть должна согласовываться со всеми остальными и решать конкретную практическую цель) — плохо.
Схема находки
ТИП ЗАДАЧИ → РЕЗУЛЬТАТ LLM
Аргументация / дебаты (адвокат) → на уровне лучших людей, иногда выше
Доктринальный разбор спорного вопроса → на уровне лучших людей
(судья)
Составление цельного документа под → провал у ВСЕХ моделей
многие формальные+смысловые условия
одновременно (нотариус)
Пример применения
Задача: Вы просите AI составить сложный договор купли-продажи квартиры, где есть несколько собственников, несовершеннолетний ребёнок среди наследников, обременение (ипотека), и рассрочка платежа.
Промпт (структура из исследования, адаптированная):
<персона>
Ты — практикующий юрист по недвижимости, готовящий документ для сделки.
персона>
<задача>
Составь договор купли-продажи квартиры по следующей ситуации.
задача>
<запрос>
{Опишите полную ситуацию: сколько собственников, есть ли несовершеннолетние,
какие обременения, условия оплаты, особые обстоятельства}
запрос>
<инструкции>
Текст должен содержать явные ссылки на статьи ГК РФ.
Избегай повторов.
Не используй многоуровневые маркированные списки.
Документ должен:
1) юридически корректно защищать права всех сторон, включая несовершеннолетних;
2) явно снимать обременение или описывать порядок его снятия;
3) быть внутренне не противоречивым — каждый пункт должен согласовываться с остальными.
инструкции>
Результат: Модель выдаст грамотно написанный, убедительно звучащий документ. Но именно из-за того, что задача похожа на "нотариальную" (много условий сразу), высок риск, что она упустит одно из условий (например, забудет прописать механизм согласия несовершеннолетнего или создаст противоречие между пунктом о рассрочке и пунктом об обременении). Внешне текст будет выглядеть профессионально — ошибка не бросится в глаза без отдельной проверки.
Почему это происходит
LLM не держит в "рабочей памяти" весь список условий одновременно, пока пишет длинный документ. Она генерирует текст локально связно — каждое предложение хорошо стыкуется с соседними, — но не сверяет постоянно весь документ целиком со всеми исходными ограничениями. Отсюда — противоречия между разными частями текста, которые не видны при беглом чтении.
При этом LLM отлично справляется с открытой аргументацией и дискуссией, потому что таких текстов (споры, разборы позиций, доктринальные дебаты) в её обучении было огромное количество — здесь модель просто продолжает знакомый паттерн рассуждения.
Практический вывод: если просите AI создать текст-рассуждение (разбор позиции, аргументация, анализ спора) — можно доверять первому результату. Если просите создать документ-конструкцию с множеством взаимосвязанных условий (договор, план, инструкция с зависимостями между пунктами) — обязательно проверяйте документ по чек-листу условий отдельно, не полагаясь на "гладкость" текста.
🔧 Адаптация: чек-лист верификации ограничений
Это не техника из исследования, а вывод, который логично из него следует — исследователи описали, какие именно ошибки допускают модели в сложных документах (искажение фактов дела, внутренние противоречия, пропуск важных институтов, несоответствие интересам сторон). Из этого списка ошибок можно собрать проверочный промпт:
Вот документ, который я получил от AI: {вставить документ}
Исходные условия, которые он должен удовлетворять:
{список условий по пунктам}
Проверь документ по каждому условию отдельно и укажи:
1. Какие условия не учтены или учтены неполно
2. Есть ли противоречия между разными частями документа
3. Правильно ли понята исходная ситуация
4. Решает ли документ реальную практическую цель сторон
Так вы заставляете модель провести именно ту проверку, которую пропустила при первой генерации — по одному условию за раз, а не "текст целиком на глаз".
Ограничения
⚠️ Constraint stacking (нагромождение условий): когда задача требует одновременного соблюдения множества формальных и содержательных условий в одном цельном документе — модели путают детали, создают внутренние противоречия, забывают часть условий. Даже с включённым режимом рассуждений и доступом к интернету модели полностью проваливают такие задачи.
⚠️ Ошибка на входе разрушает весь документ: если модель неверно поняла исходную ситуацию (кто кому кем приходится, какие права у кого есть), весь последующий документ строится на ошибочном фундаменте — и это не видно без сверки с оригинальным описанием ситуации.
⚠️ Результаты — качественная, не статистическая оценка: тестировали по одной работе на экзамен, оценивали три эксперта. Это глубокий разбор конкретных случаев, а не массовая статистика на тысячах примеров.
Как исследовали
Команда взяла реальные экзаменационные задания для итальянских адвокатов, судей и нотариусов — экзамены одни из самых сложных и избирательных в стране. Для каждого экзамена нашли работу кандидата, набравшего максимальный балл в реальном рейтинге, отсканировали и превратили в чистый текст.
Тем же самым заданием "накормили" четыре топовые модели через минималистичный промпт: роль + задача + текст вопроса + краткие инструкции (без ссылок на судебную практику, чтобы тексты нельзя было отличить от человеческих). Все пять документов — один человеческий и четыре от моделей — привели к единому формату и отдали трём экспертам, которые раньше сами входили в национальные экзаменационные комиссии. Эксперты не знали, кто автор какого текста, и оценивали по официальным критериям Минюста Италии.
Любопытная деталь: у Gemini 2.5 Pro встроенные защитные механизмы вообще блокировали генерацию юридических текстов — обошли это, отправляя запросы напрямую через API. Итоговый паттерн получился неожиданно чётким: модели проваливались именно там, где нужно удержать в голове множество взаимосвязанных условий сразу — а не там, где не хватало юридических знаний как таковых.
Ресурсы
Bertoli, Caggiano, Lagioia, Rovatti, Sartor, Troisi — "What out-of-the-box LLMs can(t) do in law? A Turing test in Italian exams for lawyers, judges and notaries". Университет Болоньи (CIRSFID-Alma AI), Университет Неаполя Суор Орсола Бенинказа, Европейский университетский институт. Репозиторий с промптами и материалами: github.com/SSIGPRO/LLMs-in-legal-professions
