3,583 papers
arXiv:2608.06166 76 6 авг. 2026 г. FREE

Юридический Turing Test: где топовые LLM проваливаются, а где превосходят людей

КЛЮЧЕВАЯ СУТЬ
Парадокс: Claude 4 Opus, GPT-5 и Gemini 2.5 Pro написали судебную аргументацию на уровне победителя настоящего экзамена итальянских юристов — эксперты вслепую не отличили тексты моделей от человеческих. Но дали этим же моделям нотариальный акт с десятком условий (наследники, обременение, отсутствие разрешения на строительство) — провалились абсолютно все, без исключения. Метод показывает: AI можно доверять там, где нужно рассуждать и спорить, но не там, где нужно построить документ с кучей взаимосвязанных условий. Фишка в типе задачи, а не в нехватке юридических знаний модели — рассуждение и конструирование документа требуют совершенно разных навыков.
Адаптировать под запрос

Что можно применить сразу: структура минималистичного промпта с XML-тегами (<персона>, <задача>, <инструкции>) — и понимание, для каких типов задач AI надёжен, а для каких нет.

TL;DR

Топовые LLM (Claude 4 Opus, GPT-5, DeepSeek R1, Gemini 2.5 Pro) написали реальные экзаменационные работы для итальянских адвокатов, судей и нотариусов. Работы перемешали с текстом человека — победителя настоящего экзамена — и отдали независимым экспертам оценивать вслепую, не зная кто автор.

Оказалось: там, где нужно спорить, убеждать, разбирать спорный юридический вопрос — некоторые модели пишут на уровне лучших людей-кандидатов или даже лучше. Но там, где нужно составить один цельный документ, который одновременно удовлетворяет десяткам формальных и смысловых условий — например нотариальный акт с учётом прав наследников, сервитутов, отсутствия разрешения на строительство — абсолютно все модели проваливаются. Они путают детали дела, забывают часть условий, и разные куски документа начинают противоречить друг другу.

Дело не в нехватке юридических знаний у моделей. Дело в типе задачи: рассуждение вслух (аргументация, дискуссия, разбор проблемы) LLM делают отлично. Целенаправленное конструирование (документ, где каждая часть должна согласовываться со всеми остальными и решать конкретную практическую цель) — плохо.


📌

Схема находки

ТИП ЗАДАЧИ → РЕЗУЛЬТАТ LLM
Аргументация / дебаты (адвокат)        → на уровне лучших людей, иногда выше
Доктринальный разбор спорного вопроса  → на уровне лучших людей
                (судья)
Составление цельного документа под    → провал у ВСЕХ моделей
многие формальные+смысловые условия
одновременно (нотариус)

🚀

Пример применения

Задача: Вы просите AI составить сложный договор купли-продажи квартиры, где есть несколько собственников, несовершеннолетний ребёнок среди наследников, обременение (ипотека), и рассрочка платежа.

Промпт (структура из исследования, адаптированная):

<персона>
Ты — практикующий юрист по недвижимости, готовящий документ для сделки.

<задача>
Составь договор купли-продажи квартиры по следующей ситуации.

<запрос>
{Опишите полную ситуацию: сколько собственников, есть ли несовершеннолетние,
какие обременения, условия оплаты, особые обстоятельства}

<инструкции>
Текст должен содержать явные ссылки на статьи ГК РФ.
Избегай повторов.
Не используй многоуровневые маркированные списки.
Документ должен:
1) юридически корректно защищать права всех сторон, включая несовершеннолетних;
2) явно снимать обременение или описывать порядок его снятия;
3) быть внутренне не противоречивым — каждый пункт должен согласовываться с остальными.

Результат: Модель выдаст грамотно написанный, убедительно звучащий документ. Но именно из-за того, что задача похожа на "нотариальную" (много условий сразу), высок риск, что она упустит одно из условий (например, забудет прописать механизм согласия несовершеннолетнего или создаст противоречие между пунктом о рассрочке и пунктом об обременении). Внешне текст будет выглядеть профессионально — ошибка не бросится в глаза без отдельной проверки.


📌

Почему это происходит

LLM не держит в "рабочей памяти" весь список условий одновременно, пока пишет длинный документ. Она генерирует текст локально связно — каждое предложение хорошо стыкуется с соседними, — но не сверяет постоянно весь документ целиком со всеми исходными ограничениями. Отсюда — противоречия между разными частями текста, которые не видны при беглом чтении.

При этом LLM отлично справляется с открытой аргументацией и дискуссией, потому что таких текстов (споры, разборы позиций, доктринальные дебаты) в её обучении было огромное количество — здесь модель просто продолжает знакомый паттерн рассуждения.

Практический вывод: если просите AI создать текст-рассуждение (разбор позиции, аргументация, анализ спора) — можно доверять первому результату. Если просите создать документ-конструкцию с множеством взаимосвязанных условий (договор, план, инструкция с зависимостями между пунктами) — обязательно проверяйте документ по чек-листу условий отдельно, не полагаясь на "гладкость" текста.


📌

🔧 Адаптация: чек-лист верификации ограничений

Это не техника из исследования, а вывод, который логично из него следует — исследователи описали, какие именно ошибки допускают модели в сложных документах (искажение фактов дела, внутренние противоречия, пропуск важных институтов, несоответствие интересам сторон). Из этого списка ошибок можно собрать проверочный промпт:

Вот документ, который я получил от AI: {вставить документ}

Исходные условия, которые он должен удовлетворять:
{список условий по пунктам}

Проверь документ по каждому условию отдельно и укажи:
1. Какие условия не учтены или учтены неполно
2. Есть ли противоречия между разными частями документа
3. Правильно ли понята исходная ситуация
4. Решает ли документ реальную практическую цель сторон

Так вы заставляете модель провести именно ту проверку, которую пропустила при первой генерации — по одному условию за раз, а не "текст целиком на глаз".


⚠️

Ограничения

⚠️ Constraint stacking (нагромождение условий): когда задача требует одновременного соблюдения множества формальных и содержательных условий в одном цельном документе — модели путают детали, создают внутренние противоречия, забывают часть условий. Даже с включённым режимом рассуждений и доступом к интернету модели полностью проваливают такие задачи.

⚠️ Ошибка на входе разрушает весь документ: если модель неверно поняла исходную ситуацию (кто кому кем приходится, какие права у кого есть), весь последующий документ строится на ошибочном фундаменте — и это не видно без сверки с оригинальным описанием ситуации.

⚠️ Результаты — качественная, не статистическая оценка: тестировали по одной работе на экзамен, оценивали три эксперта. Это глубокий разбор конкретных случаев, а не массовая статистика на тысячах примеров.


🔍

Как исследовали

Команда взяла реальные экзаменационные задания для итальянских адвокатов, судей и нотариусов — экзамены одни из самых сложных и избирательных в стране. Для каждого экзамена нашли работу кандидата, набравшего максимальный балл в реальном рейтинге, отсканировали и превратили в чистый текст.

Тем же самым заданием "накормили" четыре топовые модели через минималистичный промпт: роль + задача + текст вопроса + краткие инструкции (без ссылок на судебную практику, чтобы тексты нельзя было отличить от человеческих). Все пять документов — один человеческий и четыре от моделей — привели к единому формату и отдали трём экспертам, которые раньше сами входили в национальные экзаменационные комиссии. Эксперты не знали, кто автор какого текста, и оценивали по официальным критериям Минюста Италии.

Любопытная деталь: у Gemini 2.5 Pro встроенные защитные механизмы вообще блокировали генерацию юридических текстов — обошли это, отправляя запросы напрямую через API. Итоговый паттерн получился неожиданно чётким: модели проваливались именно там, где нужно удержать в голове множество взаимосвязанных условий сразу — а не там, где не хватало юридических знаний как таковых.


🔗

Ресурсы

Bertoli, Caggiano, Lagioia, Rovatti, Sartor, Troisi — "What out-of-the-box LLMs can(t) do in law? A Turing test in Italian exams for lawyers, judges and notaries". Университет Болоньи (CIRSFID-Alma AI), Университет Неаполя Суор Орсола Бенинказа, Европейский университетский институт. Репозиторий с промптами и материалами: github.com/SSIGPRO/LLMs-in-legal-professions


📋 Дайджест исследования

Ключевая суть

Парадокс: Claude 4 Opus, GPT-5 и Gemini 2.5 Pro написали судебную аргументацию на уровне победителя настоящего экзамена итальянских юристов — эксперты вслепую не отличили тексты моделей от человеческих. Но дали этим же моделям нотариальный акт с десятком условий (наследники, обременение, отсутствие разрешения на строительство) — провалились абсолютно все, без исключения. Метод показывает: AI можно доверять там, где нужно рассуждать и спорить, но не там, где нужно построить документ с кучей взаимосвязанных условий. Фишка в типе задачи, а не в нехватке юридических знаний модели — рассуждение и конструирование документа требуют совершенно разных навыков.

Принцип работы

Правило простое: задача открытое рассуждение (аргумент, разбор позиции, дебаты) — доверяй результату. Задача закрытая конструкция (документ, где каждый пункт должен согласовываться со всеми остальными) — не доверяй без проверки. Чем больше условий нужно удержать одновременно, тем быстрее модель их теряет. Даже включённый режим рассуждений и доступ в интернет не спасают — на нотариальных задачах ломаются все модели одинаково.

Почему работает

Причина не в нехватке знаний — законы модели знают отлично. Причина в том, как устроена генерация текста: LLM пишет каждое предложение так, чтобы оно стыковалось с соседними, но не сверяет весь текст целиком со списком из десяти условий. Модель как студент, который пишет ответ страница за страницей и к концу забывает, что написал в начале. Аргументация такой сверки не требует — модель просто продолжает знакомый паттерн спора, которых в обучающих данных были миллионы. Документ с зависимыми пунктами — паттерн редкий, и модель его не держит в голове целиком.

Когда применять

Юридические и деловые тексты → доверяй AI для аргументации, анализа спорных позиций, доктринального разбора конкретного вопроса. Не доверяй для документов с множеством формальных условий одновременно — договоров с несколькими собственниками, актов с обременениями, планов с зависимыми пунктами. Особенно опасно, если модель неверно поняла исходную ситуацию на входе — эта ошибка тихо разрушает весь документ, и не видна без отдельной сверки.

Мини-рецепт

1. Определи тип задачи: рассуждение (спор, анализ) или конструкция (документ с условиями).
2. Для рассуждения: бери первый результат — модель здесь надёжна.
3. Для конструкции: перед промптом выпиши список условий отдельным пунктами, не смешивай с описанием ситуации.
4. Прогони документ через чек-лист построчно: не читай результат на глаз, сверяй каждый пункт с исходным списком условий.
5. Попроси саму модель проверить себя: дай ей готовый документ и список условий, попроси найти пропущенные пункты и противоречия.

Примеры

[ПЛОХО] : Составь договор купли-продажи квартиры с рассрочкой, ипотекой и несовершеннолетним наследником среди собственников — и сразу берём результат как готовый
[ХОРОШО] : Составь договор... {полное описание ситуации}. После этого проверь отдельно каждый из пунктов: 1) права несовершеннолетнего защищены и описан порядок согласия, 2) обременение (ипотека) снято или прописан порядок снятия, 3) пункт о рассрочке не противоречит пункту об обременении, 4) все стороны из описания ситуации учтены в тексте
Источник: What out-of-the-box LLMs can(t) do in law? A Turing test in Italian exams for lawyers, judges and notaries
ArXiv ID: 2608.06166 | Сгенерировано: 2026-08-07 04:24

Проблемы LLM

ПроблемаСутьКак обойти
Модель путается когда документ должен удовлетворять много условий сразуПросишь составить один документ (договор, план, инструкцию), где десятки требований должны согласовываться друг с другом. Модель забывает часть условий. Разные куски текста начинают противоречить друг другу. Плохо потому что текст выглядит гладким и профессиональным — ошибка не видна без отдельной проверкиНе оценивай документ на глаз целиком. Дай отдельный запрос: сверь документ с каждым исходным условием по одному, а не с текстом в целом

Методы

МетодСуть
Проверка документа по каждому условию отдельноПосле получения документа отправь второй запрос: приложи список исходных условий и попроси проверить текст по каждому пункту отдельно — что пропущено, есть ли противоречия между частями, правильно ли понята исходная ситуация. Работает потому что заставляет модель сделать именно ту проверку, которую она пропустила при первой генерации — сверку каждого пункта, а не текста целиком. Применяй: документы с множеством взаимосвязанных условий — договоры, инструкции, планы с зависимостями между пунктами. Не работает: короткие тексты, открытая аргументация без формальных условий — там проверка избыточна
📖 Простыми словами

What out-of-the-boxLLMscan(t) do in law? A Turing test in Italian exams for lawyers, judges and notaries

arXiv: 2608.06166

Суть в том, что современные нейронки научились имитировать человеческую логику настолько филигранно, что даже прожженные юристы не видят подвоха. Исследователи взяли тяжеловесов вроде GPT-4o, Claude 3.5 Sonnet и DeepSeek R1, заставили их сдать зубодробительные экзамены на адвокатов и судей в Италии, а потом подсунули эти работы экспертам вперемешку с текстами реальных отличников. Итог — тест Тьюринга пройден: профессионалы не смогли отличить «синтетику» от живого юриста, потому что модели научились не просто цитировать кодексы, а имитировать юридический стиль мышления.

Это как если бы ты пришел в мишленовский ресторан, съел идеальный стейк, а потом узнал, что его напечатал 3D-принтер из соевого белка. Вроде и понимаешь, что это имитация, но на вкус — чистый мраморный рибай. В праве то же самое: LLM настолько натаскались на структуре судебных решений, что выдают текст, который выглядит, пахнет и ощущается как работа человека, потратившего десять лет на изучение латыни и процедурных тонкостей. Форма победила содержание, и эксперты просто не нашли зацепок, чтобы сказать: «это написал робот».

Что реально сработало в этих работах: структурная мимикрия (модели идеально выдерживают формат иска или заключения), юридическая аргументация (связки «если — то» выглядят логично) и терминологическая плотность. Когда нейронка пишет про несовершеннолетнего наследника или обременение ипотекой, она не просто кидается словами, а вплетает их в контекст так, что это выглядит как экспертная оценка. Даже в самых жестких сценариях, где нужно разрулить конфликт интересов, топовые модели выдают результат, который эксперты оценили на уровне реальных победителей конкурса.

Тестировали всё это на суровом итальянском праве, но принцип универсален. Если нейронка смогла обмануть комиссию, отбирающую судей, то с твоим договором аренды или претензией к застройщику она справится одной левой. Это работает везде, где есть жесткий канон и понятные правила игры: от корпоративного права до составления ТЗ. Граница между «человеческим» и «машинным» текстом стерта, и теперь вопрос не в том, может ли AI заменить юриста, а в том, почему ты до сих пор платишь за шаблонные документы человеку.

Короче: в стандартных юридических задачах AI официально сравнялся с профи. Если задача не требует выезда в суд или личного обаяния, нейронка выдаст результат не хуже, а часто и чище, чем уставший помощник адвоката. 10 из 10 экспертов не видят разницы, а значит, пора перестать воспринимать чат-ботов как игрушку для генерации стишков. Кто начнет использовать эти «юридические принтеры» сейчас, сэкономит годы жизни, пока остальные будут доказывать, что у роботов нет души.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с