TL;DR
Модель может дать структурно идеальный юридический анализ — со всеми нужными разделами и заголовками — но при этом реально не разобраться в деле. GPT-5.4 на кейсах Европейского суда по правам человека почти всегда воспроизводит правильную форму юридического анализа (4 шага стандартного теста), даже если её об этом не просят явно — просто потому что эта структура заучена из тысяч похожих текстов. Но содержание остаётся поверхностным: оценка получает твёрдую троечку-четвёрку, а не пятёрку, по сравнению с реальным решением суда.
Главная боль: если дать модели явную пошаговую методологию эксперта («сначала оцени вот это, потом вот это»), рассуждение становится заметно полнее и глубже — но итоговый вердикт («нарушение» или «нет») от этого не становится точнее. Точность вообще осталась на уровне тупого правила «всегда говори „нарушение“» (так решает суд в 77% случаев). То есть модель может угадать правильный ответ, вообще не проведя нормального анализа — и наоборот, дать глубокое рассуждение и ошибиться в выводе.
Исследователи протестировали три варианта промпта: без всякой структуры, с чётким чек-листом от юриста-эксперта, и с официальным гайдом суда (модель сама выводила из него методологию). Дальше ответы оценивали и люди-эксперты, и другие LLM-судьи — по трём критериям: выполнен ли шаг, насколько он подробный, насколько текст лаконичен без лишнего.
Схема метода
ШАГ 1: Дать модели явную пошаговую методологию эксперта → чек-лист из 3-5 пунктов
ШАГ 2: Попросить модель разобрать кейс по каждому пункту отдельно → структурированный ответ с разделами
ШАГ 3: Проверить не финальный вывод, а качество каждого шага отдельно → оценка глубины, не только "правильно/неправильно"
Все шаги выполняются в одном промпте (методология + просьба разобрать по ней кейс).
Пример применения
Задача: Предприниматель хочет понять, может ли арендодатель законно расторгнуть договор аренды офиса из-за формальной претензии (задержка платежа на 3 дня из-за банковского сбоя).
Промпт:
Ты — юрист-консультант по коммерческой аренде. Проанализируй ситуацию по методологии:
1. ФАКТЫ: перечисли ключевые факты дела и их правовую значимость
2. ОСНОВАНИЕ: есть ли формальное основание для расторжения по договору/закону
3. СОРАЗМЕРНОСТЬ: соразмерна ли санкция (расторжение) тяжести нарушения
4. ЗАЩИТА: какие аргументы может использовать арендатор для защиты своих интересов
Не давай финальный вывод, пока не разберёшь каждый пункт отдельно и подробно.
Ситуация: {описание ситуации с деталями договора и просрочки}
Результат: Модель выдаст четыре чётких блока анализа — по одному на каждый пункт методологии. Читатель увидит не просто «да, можно расторгнуть» или «нет, нельзя», а полный разбор аргументов каждой стороны. Это позволяет оценить, насколько глубоко модель проработала вопрос, а не просто выдала вердикт наугад.
Почему это работает
Модель заучила форму правильного ответа из тысяч похожих текстов — юридических, аналитических, экспертных. Она знает, что «правильный» юридический разбор состоит из таких-то разделов, и воспроизводит эту структуру автоматически, даже без просьбы. Но заполнение этой структуры реальным анализом фактов — это другая задача, и здесь модель часто скатывается в поверхностность.
Сильная сторона модели — она отлично следует явному чек-листу, если ей его дать. Если прямо расписать «сначала оцени вот это, потом вот это», пропущенных шагов становится в разы меньше, и глубина каждого шага растёт.
Метод использует эту силу напрямую: явная методология не учит модель с нуля (она её уже знает), а заставляет применять надёжно, убирая случайные пропуски сложных шагов.
Рычаги управления: - Число шагов методологии → для простых задач хватит 2-3 пунктов, для сложных — 4-5, как в юридическом тесте - Просьба оценить каждый шаг отдельно, а не дать общий вывод → показывает где рассуждение слабое - Запрет давать финальный вердикт до разбора всех пунктов → мешает модели "срезать путь" к готовому ответу
Ограничения
⚠️ Точность обманчива: модель может угадать правильный итоговый ответ, просто ориентируясь на то, какой исход чаще встречается в целом, без реального анализа конкретного случая. Не проверяй качество рассуждения по правильности финального вывода — это разные вещи.
⚠️ LLM-судья не заменяет эксперта: несколько разных LLM согласны друг с другом при оценке текста, но слабо совпадают с оценками людей-экспертов. Если тебе важна точная оценка качества сложного экспертного текста (юридического, медицинского, финансового) — не доверяй только оценке от другой модели.
⚠️ Явная методология не гарантирует правильный вывод, только более полное изложение. Хорошо расписанный анализ может привести к неправильному итоговому решению — и наоборот.
⚠️ Модель "перестраховывается": она склонна ссылаться на больше деталей/фактов, чем нужно, что выглядит как основательность, но иногда это просто избыточность без роста качества.
Как исследовали
Исследователи взяли 30 свежих дел Европейского суда по правам человека (после апреля 2025 года — специально, чтобы модель не могла их «помнить» из обучения) по статье о свободе выражения мнения. GPT-5.4 получал факты дела в трёх вариантах промпта: без всякой структуры, с чётким чек-листом от юриста-эксперта, и с официальным гайдом суда, из которого модель сама выводила методологию.
Дальше три студента-юриста и три разные LLM-модели (в роли судей) оценивали ответы по трём критериям: выполнен ли каждый из 4 обязательных юридических шагов, насколько глубоко, и насколько текст лаконичен.
Результат удивил: явная экспертная методология дала самое полное рассуждение — но точность финального вердикта осталась на уровне тупого правила «всегда говори нарушение» (так решает суд в 77% случаев). Более того, глубина рассуждения и правильность вывода вообще никак не связаны между собой (корреляция почти нулевая). Ещё интереснее: даже без единой подсказки о структуре модель в 90-100% случаев сама воспроизводила правильную 4-шаговую юридическую доктрину — потому что она уже «знает» стандартную форму юридического анализа из обучения. Явная методология просто убирала оставшиеся случайные пропуски сложных шагов.
Ресурсы
Can LLMs Reason in a Legally Meaningful Manner? A Small-scale Study on European Court of Human Rights Cases — Amogh Raina, Ilias Chalkidis, Daniel Hershcovich, Henrik Palmer Olsen (University of Copenhagen, Faculty of Law & Computer Science). ICML 2025 Workshop paper.
