3,583 papers
arXiv:2608.17168 76 17 авг. 2026 г. FREE

Explicit Reasoning Guide: почему правильный ответ не значит качественное рассуждение

КЛЮЧЕВАЯ СУТЬ
Парадокс: модель угадывает вердикт Европейского суда по правам человека в 77% случаев — ровно как тупое правило «всегда говори нарушение», без единого реального разбора дела. Метод проверки объясняет как отличить пустую форму от настоящего юридического анализа — оценивать не итоговый вердикт, а глубину каждого шага рассуждения отдельно. Модель заучила форму правильного разбора из тысяч текстов и воспроизводит её даже без просьбы — четыре шага юридического теста появляются сами собой. Но содержание каждого шага остаётся поверхностным — оценка 3-4 из 5, а не пятёрка, по сравнению с настоящим решением суда.
Адаптировать под запрос

TL;DR

Модель может дать структурно идеальный юридический анализ — со всеми нужными разделами и заголовками — но при этом реально не разобраться в деле. GPT-5.4 на кейсах Европейского суда по правам человека почти всегда воспроизводит правильную форму юридического анализа (4 шага стандартного теста), даже если её об этом не просят явно — просто потому что эта структура заучена из тысяч похожих текстов. Но содержание остаётся поверхностным: оценка получает твёрдую троечку-четвёрку, а не пятёрку, по сравнению с реальным решением суда.

Главная боль: если дать модели явную пошаговую методологию эксперта («сначала оцени вот это, потом вот это»), рассуждение становится заметно полнее и глубже — но итоговый вердикт («нарушение» или «нет») от этого не становится точнее. Точность вообще осталась на уровне тупого правила «всегда говори „нарушение“» (так решает суд в 77% случаев). То есть модель может угадать правильный ответ, вообще не проведя нормального анализа — и наоборот, дать глубокое рассуждение и ошибиться в выводе.

Исследователи протестировали три варианта промпта: без всякой структуры, с чётким чек-листом от юриста-эксперта, и с официальным гайдом суда (модель сама выводила из него методологию). Дальше ответы оценивали и люди-эксперты, и другие LLM-судьи — по трём критериям: выполнен ли шаг, насколько он подробный, насколько текст лаконичен без лишнего.


🔬

Схема метода

ШАГ 1: Дать модели явную пошаговую методологию эксперта → чек-лист из 3-5 пунктов
ШАГ 2: Попросить модель разобрать кейс по каждому пункту отдельно → структурированный ответ с разделами
ШАГ 3: Проверить не финальный вывод, а качество каждого шага отдельно → оценка глубины, не только "правильно/неправильно"

Все шаги выполняются в одном промпте (методология + просьба разобрать по ней кейс).


🚀

Пример применения

Задача: Предприниматель хочет понять, может ли арендодатель законно расторгнуть договор аренды офиса из-за формальной претензии (задержка платежа на 3 дня из-за банковского сбоя).

Промпт:

Ты — юрист-консультант по коммерческой аренде. Проанализируй ситуацию по методологии:

1. ФАКТЫ: перечисли ключевые факты дела и их правовую значимость
2. ОСНОВАНИЕ: есть ли формальное основание для расторжения по договору/закону
3. СОРАЗМЕРНОСТЬ: соразмерна ли санкция (расторжение) тяжести нарушения
4. ЗАЩИТА: какие аргументы может использовать арендатор для защиты своих интересов

Не давай финальный вывод, пока не разберёшь каждый пункт отдельно и подробно.

Ситуация: {описание ситуации с деталями договора и просрочки}

Результат: Модель выдаст четыре чётких блока анализа — по одному на каждый пункт методологии. Читатель увидит не просто «да, можно расторгнуть» или «нет, нельзя», а полный разбор аргументов каждой стороны. Это позволяет оценить, насколько глубоко модель проработала вопрос, а не просто выдала вердикт наугад.


🧠

Почему это работает

Модель заучила форму правильного ответа из тысяч похожих текстов — юридических, аналитических, экспертных. Она знает, что «правильный» юридический разбор состоит из таких-то разделов, и воспроизводит эту структуру автоматически, даже без просьбы. Но заполнение этой структуры реальным анализом фактов — это другая задача, и здесь модель часто скатывается в поверхностность.

Сильная сторона модели — она отлично следует явному чек-листу, если ей его дать. Если прямо расписать «сначала оцени вот это, потом вот это», пропущенных шагов становится в разы меньше, и глубина каждого шага растёт.

Метод использует эту силу напрямую: явная методология не учит модель с нуля (она её уже знает), а заставляет применять надёжно, убирая случайные пропуски сложных шагов.

Рычаги управления: - Число шагов методологии → для простых задач хватит 2-3 пунктов, для сложных — 4-5, как в юридическом тесте - Просьба оценить каждый шаг отдельно, а не дать общий вывод → показывает где рассуждение слабое - Запрет давать финальный вердикт до разбора всех пунктов → мешает модели "срезать путь" к готовому ответу


⚠️

Ограничения

⚠️ Точность обманчива: модель может угадать правильный итоговый ответ, просто ориентируясь на то, какой исход чаще встречается в целом, без реального анализа конкретного случая. Не проверяй качество рассуждения по правильности финального вывода — это разные вещи.

⚠️ LLM-судья не заменяет эксперта: несколько разных LLM согласны друг с другом при оценке текста, но слабо совпадают с оценками людей-экспертов. Если тебе важна точная оценка качества сложного экспертного текста (юридического, медицинского, финансового) — не доверяй только оценке от другой модели.

⚠️ Явная методология не гарантирует правильный вывод, только более полное изложение. Хорошо расписанный анализ может привести к неправильному итоговому решению — и наоборот.

⚠️ Модель "перестраховывается": она склонна ссылаться на больше деталей/фактов, чем нужно, что выглядит как основательность, но иногда это просто избыточность без роста качества.


🔍

Как исследовали

Исследователи взяли 30 свежих дел Европейского суда по правам человека (после апреля 2025 года — специально, чтобы модель не могла их «помнить» из обучения) по статье о свободе выражения мнения. GPT-5.4 получал факты дела в трёх вариантах промпта: без всякой структуры, с чётким чек-листом от юриста-эксперта, и с официальным гайдом суда, из которого модель сама выводила методологию.

Дальше три студента-юриста и три разные LLM-модели (в роли судей) оценивали ответы по трём критериям: выполнен ли каждый из 4 обязательных юридических шагов, насколько глубоко, и насколько текст лаконичен.

Результат удивил: явная экспертная методология дала самое полное рассуждение — но точность финального вердикта осталась на уровне тупого правила «всегда говори нарушение» (так решает суд в 77% случаев). Более того, глубина рассуждения и правильность вывода вообще никак не связаны между собой (корреляция почти нулевая). Ещё интереснее: даже без единой подсказки о структуре модель в 90-100% случаев сама воспроизводила правильную 4-шаговую юридическую доктрину — потому что она уже «знает» стандартную форму юридического анализа из обучения. Явная методология просто убирала оставшиеся случайные пропуски сложных шагов.


🔗

Ресурсы

Can LLMs Reason in a Legally Meaningful Manner? A Small-scale Study on European Court of Human Rights Cases — Amogh Raina, Ilias Chalkidis, Daniel Hershcovich, Henrik Palmer Olsen (University of Copenhagen, Faculty of Law & Computer Science). ICML 2025 Workshop paper.


📋 Дайджест исследования

Ключевая суть

Парадокс: модель угадывает вердикт Европейского суда по правам человека в 77% случаев — ровно как тупое правило «всегда говори нарушение», без единого реального разбора дела. Метод проверки объясняет как отличить пустую форму от настоящего юридического анализа — оценивать не итоговый вердикт, а глубину каждого шага рассуждения отдельно. Модель заучила форму правильного разбора из тысяч текстов и воспроизводит её даже без просьбы — четыре шага юридического теста появляются сами собой. Но содержание каждого шага остаётся поверхностным — оценка 3-4 из 5, а не пятёрка, по сравнению с настоящим решением суда.

Принцип работы

Модель — как студент, который наизусть выучил формат экзаменационного эссе, но не осилил материал. Явный чек-лист с шагами работает как шпаргалка, которая не даёт срезать путь к готовому ответу. Запрет давать вердикт до разбора всех пунктов заставляет модель хотя бы попытаться подумать над каждым шагом, а не сразу прыгнуть к выводу.

Почему работает

Модель отлично следует явному чек-листу, если дать его прямо — пропущенных шагов становится в разы меньше, глубина каждого шага растёт. Но точность финального вердикта осталась на уровне тупого базового правила «всегда нарушение» — так суд решает в 77% случаев. Хороший вердикт и хорошее рассуждение — это две разные вещи, и одно не гарантирует другое. Модель может угадать ответ вообще без анализа — и наоборот, разобрать дело глубоко и ошибиться в выводе.

Когда применять

Юридический анализ (а также медицина, финансы, любая экспертная область) → для проверки не угадала ли модель ответ случайно, а реально ли разобралась в деле. Особенно важно когда итоговый ответ бинарный (да/нет, нарушение/нет) и легко угадывается по базовой статистике исходов. НЕ подходит если единственная проверка качества — оценка от другой LLM без сверки с человеком-экспертом: LLM-судьи согласны друг с другом, но плохо совпадают с оценками людей.

Мини-рецепт

1. Дай модели чек-лист эксперта: 3-5 конкретных пунктов методологии вместо абстрактного «разбери дело»
2. Запрети сразу выдавать вердикт: попроси разобрать каждый пункт отдельно и подробно перед выводом
3. Оценивай не ответ, а каждый шаг: пропущен ли пункт, насколько глубоко разобран, нет ли лишней воды без реальной пользы

Примеры

[ПЛОХО] : Было ли нарушение статьи 8 конвенции в этом деле?
[ХОРОШО] : Проанализируй дело по методологии: 1) ФАКТЫ — ключевые факты и их правовая значимость, 2) ОСНОВАНИЕ — было ли формальное основание для вмешательства, 3) СОРАЗМЕРНОСТЬ — соразмерна ли мера тяжести нарушения, 4) ЗАЩИТА — какие аргументы против. Не давай вывод пока не разберёшь каждый пункт отдельно.
Источник: Can LLMs Reason in a Legally Meaningful Manner? A Small-scale Study on European Court of Human Rights Cases
ArXiv ID: 2608.17168 | Сгенерировано: 2026-08-19 05:23

Проблемы LLM

ПроблемаСутьКак обойти
Правильный вывод не значит качественный анализМодель может угадать правильный ответ, просто ориентируясь на то, какой исход встречается чаще в похожих делах. Реального разбора конкретного случая может не быть. И наоборот — модель даёт глубокий подробный разбор, но ошибается в итоговом выводе. Оценка по совпадению финального ответа с эталоном не показывает, насколько качественным было само рассуждениеПроверяй не финальный ответ, а каждый шаг рассуждения отдельно. Попроси модель явно раскрыть каждый пункт анализа. Сравнивай глубину и полноту каждого пункта, а не только итоговый вердикт

Методы

МетодСуть
Явный чек-лист методологии + запрет раннего выводаПропиши в запросе конкретные пункты анализа (3-5 шагов, например для юридического кейса: факты основание соразмерность защита). Попроси разобрать каждый пункт отдельно. Не давай финальный вывод, пока не разберёшь каждый пункт отдельно. Работает потому что модель уже знает нужную структуру анализа из обучения, но без явного списка случайно пропускает сложные шаги. Явный чек-лист заставляет применять это знание надёжно — пропуски исчезают, каждый шаг разбирается глубже. Годится для сложных многошаговых задач: юридический анализ, диагностика, аудит, экспертная оценка. Не повышает точность итогового вывода — только полноту и глубину самого рассуждения

Тезисы

ТезисКомментарий
Модель воспроизводит заученную форму правильного ответа даже без явной просьбыИз тысяч похожих экспертных текстов модель запоминает не только факты, но и структуру "правильного" разбора — разделы, порядок аргументов, заголовки. Эту структуру она выдаёт автоматически, даже если её не просили. Но заполнение структуры реальным анализом — другая задача, и тут модель часто скатывается в поверхностность. Применяй: не считай правильную форму ответа (разделы, заголовки, порядок) признаком качества — всегда проверяй содержание каждого раздела
📖 Простыми словами

CanLLMsReason in a Legally Meaningful Manner? A Small-scale Study on European Court of Human Rights Cases

arXiv: 2608.17168

Нейросети не понимают право — они просто гениальные имитаторы формы. На реальных кейсах Европейского суда по правам человека модель моментально выкатывает стандартный четырёхшаговый юридический тест, потому что этот шаблон намертво зашит в неё миллионами прочитанных документов. Она на автомате воспроизводит идеальную структуру документа, но внутри этой обёртки скрывается банальная пустота — модель просто заполняет заученные разделы похожими по смыслу словами.

Это как двоечник, который пришёл на экзамен по праву в идеальном дорогом костюме и с порога сыплет латынью. Внешний вид безупречен, но стоит спросить его по деталям конкретного дела — и начинается уверенная пустая болтовня. Экзаменатор видит фасад вместо реальных знаний, хотя со стороны всё выглядит максимально солидно и убедительно.

Тестирование на базе дел ЕСПЧ показало реальную картину: по форме и структурированию модель работает отлично, а вот само юридическое содержание тянет максимум на слабую тройку из пяти. Модель включает правильные разделы даже без отдельного запроса, но на этапе оценки фактических обстоятельств скатывается в поверхностные обобщения и упускает ключевые юридические нюансы.

Эксперимент ставили на международном праве, но принцип универсален для любой сложной аналитики. Если ты попросишь разобрать спор по договору аренды из-за трёхдневной задержки оплаты, сетка сгенерирует убедительный юридический меморандум, который в реальном споре окажется абсолютно бесполезной бумажкой без глубокого понимания контекста.

Главный вывод: не путай аккуратное форматирование с юридической логикой. Используй модель как генератор структуры и черновиков, но никогда не доверяй ей саму суть аргументации. Тот, кто слепо полагается на юридические выводы AI, гарантированно влетит на проблемы, имея на руках самый красивый и бесполезный документ в мире.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с