3,583 papers
arXiv:2609.02158 78 2 сент. 2026 г. FREE

OBJECTION: адвокат-агент против обвинительного перекоса LLM

КЛЮЧЕВАЯ СУТЬ
Обнаружено: LLM, обученная на текстах судебных дел, ставит клеймо виновности заранее — ведь если дело дошло до суда, значит следствие уже 'уверено'. Модель впитывает этот перекос и штампует обвинительные вердикты, даже когда есть явные основания для оправдания. Метод OBJECTION позволяет резко снизить обвинительный уклон при анализе любых спорных ситуаций — не только в юриспруденции, но и в HR-разборах, оценке вины в конфликтах. Фишка: вместо обычного критика встраивается роль адвоката с узкой задачей 'искать разумные сомнения' на каждом шаге рассуждения, а не в конце готового вердикта.
Адаптировать под запрос

TL;DR

OBJECTION — техника, где вместо обычного "критика" в модель встраивается роль адвоката защиты, который на каждом шаге рассуждения обязан искать основания для оправдания, а не просто проверять логику на ошибки. Модель сначала выносит промежуточное решение, затем "адвокат" атакует это решение конкретными доводами защиты, и только после этого модель пересматривает вердикт — и так на трёх последовательных этапах оценки.

Юридические тексты почти всегда написаны с точки зрения обвинения — раз дело дошло до суда, значит следствие уже "уверено" в виновности. LLM, обученная на таких текстах, перенимает этот перекос и склонна штамповать обвинительные вердикты даже когда есть явные основания для оправдания. Хуже того — если просто заставить модель рассуждать "по шагам" (без роли защитника), это только усиливает обвинительный уклон, потому что структурированное рассуждение без противовеса превращается в детальное обоснование уже готового вывода.

Решение — не общий "критик", который спрашивает "логика верна?", а роль с конкретной установкой "есть ли разумные сомнения?", встроенная в каждый из трёх шагов оценки (состав деяния → обстоятельства, снимающие вину → личная ответственность), а не приклеенная в конце после готового вердикта.

🔬

Схема метода

ШАГ 1 (Offense — состав деяния): модель извлекает факты по структуре 
  Субъект / Объект / Действие / Намерение → выносит первичное суждение
ШАГ 2 (Lawyer Agent атакует шаг 1): модель в роли адвоката ищет 
  оправдывающие обстоятельства (самозащита, отсутствие умысла) → доводы защиты
ШАГ 3 (модель пересматривает): исходная модель видит доводы защиты 
  и обстоятельства → выносит финальный вердикт по этапу
→ Если на любом этапе найдено достаточное основание для оправдания — 
  процесс останавливается (Early Exit), дальше не идём
→ Иначе повторить цикл Шаг1-3 для следующего этапа (Unlawfulness → Culpability)

Все три раунда выполняются в рамках одной сессии рассуждения, но каждый раунд — отдельный обмен "первое суждение → атака защиты → пересмотр".


🚀

Пример применения

Задача: Руководитель разбирает провал проекта и должен понять, кто виноват в срыве дедлайна, перед тем как принять решение об увольнении сотрудника. Отчёт от менеджера проекта уже написан с обвинительным уклоном — он описывает факты так, чтобы обосновать вину конкретного исполнителя.

Промпт:

Я дам тебе отчёт о провале проекта, написанный менеджером. Отчёт может быть 
предвзятым — написан, чтобы обосновать вину исполнителя.

Проведи оценку в три этапа. На каждом этапе:
1. Сначала оцени как "прокурор" — есть ли основания считать сотрудника виновным?
2. Затем переключись в роль "адвоката защиты сотрудника" — активно ищи 
   любые смягчающие обстоятельства, даже если на первый взгляд их не видно: 
   были ли объективные препятствия, недостаток ресурсов, неясные инструкции, 
   форс-мажор.
3. Пересмотри вывод с учётом доводов защиты.

Этапы:
А) Были ли объективные основания считать, что срыв — следствие 
   действий сотрудника, а не системных проблем?
Б) Были ли обстоятельства, снимающие ответственность (отсутствие ресурсов, 
   изменение требований на ходу, нечёткие инструкции руководства)?
В) Можно ли лично сотруднику предъявить ответственность, или проблема — 
   в организации процесса?

Если на любом этапе находишь достаточное основание снять вину — 
останавливайся и делай вывод сразу, не продолжай искать вину дальше.

Отчёт менеджера: {текст отчёта}

Результат: Модель пройдёт три раунда — сначала обвинительная версия, затем аргументы защиты (конкретные: например "в отчёте не упомянуто, что требования менялись три раза за две недели"), затем пересмотренный вывод по каждому этапу. Если на этапе Б находится веское основание — модель остановится и даст вывод "ответственность снимается из-за смягчающих обстоятельств", не переходя к этапу В.


🧠

Почему это работает

LLM, обученная на текстах с обвинительным уклоном, по умолчанию воспринимает предвзятое описание фактов как объективную истину — она не различает "что случилось" и "как это подали, чтобы обвинить". Просьба "подумай ещё раз" или "проверь логику" не помогает, потому что модель проверяет внутреннюю согласованность уже предвзятого нарратива, а не сам нарратив.

Зато модель хорошо умеет отыгрывать роль с чёткой установкой. Если роль — просто "критик", модель ищет логические ошибки в рассуждении, но не ставит под вопрос сами исходные факты. Если роль — "адвокат, чья единственная задача — найти разумные сомнения", модель начинает искать альтернативные интерпретации фактов, а не только ошибки в цепочке рассуждений.

Ключевой рычаг здесь — не количество агентов, а специфичность роли. Исследователи проверили: если заменить "адвоката" на обычного второго критика без конкретной установки на поиск смягчающих обстоятельств, обвинительный перекос почти не снижается. Значит дело не в том, что "второе мнение спрашивают", а в том, что роль явно и узко сформулирована — "твоя единственная задача — искать основания для оправдания", а не "оцени, всё ли верно".

Второй рычаг — где вставлять роль-противовес. Если добавить проверку защитника только в конце, после готового вердикта, эффект слабее, чем если встраивать её на каждом промежуточном шаге рассуждения. Модель проще "передумывает" по шагам, чем ломает уже сформированный финальный вывод.


📋

Шаблон промпта

Я дам тебе описание ситуации/дело, которое может быть представлено 
с обвинительным уклоном (написано так, чтобы обосновать вину {субъект}).

Оцени ситуацию в {число} этапа. На каждом этапе:

1. Дай первичную оценку на основе описания — есть ли основания 
   для вывода "виновен/проблема на стороне {субъект}"?

2. Переключись в роль защитника {субъект}. Твоя единственная задача — 
   активно искать основания для оправдания, даже если на первый взгляд 
   их не видно. Не проверяй логику первичной оценки — ищи альтернативные 
   объяснения фактов, смягчающие обстоятельства, недостающий контекст.

3. Пересмотри вывод с учётом доводов защиты. Итоговое решение должно 
   явно учитывать, изменились ли выводы после атаки защитника.

Этапы оценки:
1) {критерий проверки №1 — базовое основание для вывода}
2) {критерий проверки №2 — обстоятельства, снимающие ответственность}
3) {критерий проверки №3 — личная/прямая ответственность субъекта}

Если на любом этапе находишь достаточное основание для оправдания — 
останавливайся сразу, не переходи к следующему этапу.

Описание ситуации: {текст}

🚀 Быстрый старт — вставь в чат:

Вот шаблон метода "адвокат-агент против перекоса". Адаптируй под мою задачу: 
{твоя задача}. Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит какие именно этапы проверки нужны и кто "субъект" оценки — потому что метод работает только если этапы отражают реальную логику вынесения решения в твоей области (не любые 3 шага подойдут, они должны быть последовательными и содержательными).


⚠️

Ограничения

⚠️ Перегиб в другую сторону: если базовая модель уже специально дообучена определять невиновность (как LJPIV в исследовании), добавление роли-адвоката сверху приводит к обратному эффекту — модель начинает оправдывать почти всех подряд. Не комбинируй метод с моделью/промптом, который уже сам заточен искать смягчающие обстоятельства.

⚠️ Нужен структурный якорь: без предварительного разбора фактов на составляющие (кто, что, при каких обстоятельствах) роль-адвокат начинает "фантазировать" оправдания без опоры на реальные детали — растёт число необоснованных оправданий. Перед запуском адвокатского раунда дай модели явно разложить факты по пунктам.

⚠️ Непредсказуемость на разных моделях: эффект силы метода заметно различается между разными LLM — на одних моделях перекос снижается сильно, на других слабо. Стоит проверить эффект на своей модели перед тем как полагаться на метод в важных решениях.


🔍

Как исследовали

Команда взяла реальную проблему юридического ИИ: модели, предсказывающие виновность по материалам дела, систематически "штампуют" обвинительные вердикты, потому что тексты дел изначально написаны обвинением. Они собрали новый датасет из 3400 реальных дел с оправдательными приговорами (а не искусственно сгенерированных, как делали раньше) — потому что синтетические примеры оправдания содержат "искусственные подсказки", на которые модель просто учится реагировать, а не реально анализирует ситуацию.

Проверяли на трёх открытых LLM (Qwen, Llama, Gemma) и сравнивали с четырьмя вариантами обычного промптинга плюс с fine-tuned моделью-чемпионом, обычным self-critique и раунд-стол дебатами. Главная метрика — процент невиновных, ошибочно признанных виновными.

Результат удивил тем, что "дообучение специально под невиновность" (LJPIV) хорошо работало на синтетических данных, но проваливалось на реальных оправдательных делах — модель переобучилась на искусственных подсказках вместо реального анализа. А обычный "раунд-стол дебатов" оказался нестабильным: на одной модели он почти не помогал, на другой — переусердствовал и начинал оправдывать виновных без разбора. Только роль с узкой и явной установкой "искать сомнения на каждом шаге" дала стабильный эффект на разных моделях.


📋 Дайджест исследования

Ключевая суть

Обнаружено: LLM, обученная на текстах судебных дел, ставит клеймо виновности заранее — ведь если дело дошло до суда, значит следствие уже 'уверено'. Модель впитывает этот перекос и штампует обвинительные вердикты, даже когда есть явные основания для оправдания. Метод OBJECTION позволяет резко снизить обвинительный уклон при анализе любых спорных ситуаций — не только в юриспруденции, но и в HR-разборах, оценке вины в конфликтах. Фишка: вместо обычного критика встраивается роль адвоката с узкой задачей 'искать разумные сомнения' на каждом шаге рассуждения, а не в конце готового вердикта.

Принцип работы

Не спрашивай модель 'логика верна?' — спрашивай 'есть разумные сомнения?'. Это разные вопросы. Первый проверяет согласованность уже готового обвинительного нарратива. Второй заставляет искать альтернативные интерпретации самих фактов. Роль-противовес нужно вшивать в каждый промежуточный шаг, а не приклеивать в конце — модели проще передумать по ходу дела, чем сломать уже сформированный финальный вывод.

Почему работает

Модель не различает 'что случилось' и 'как это подали, чтобы обвинить'. Она проверяет внутреннюю логику предвзятого текста, а не сам текст на предвзятость. Просьба 'подумай ещё раз' тут бесполезна — структурированное рассуждение без противовеса только детальнее обосновывает уже готовый обвинительный вывод. Ключевой рычаг — не второе мнение, а узость роли: обычный второй критик почти не снижает перекос, а адвокат с единственной задачей 'найти оправдание' — снижает сильно. Дело не в количестве голосов, а в конкретике установки.

Когда применять

Юридический анализ дел → разбор HR-конфликтов, расследование срыва проектов, оценка вины в спорных ситуациях, особенно когда исходный текст написан одной стороной с явным уклоном в обвинение. НЕ подходит, если модель или промпт уже заточены на поиск смягчающих обстоятельств — тогда роль адвоката сверху даст обратный перекос, и модель начнёт оправдывать почти всех.

Мини-рецепт

1. Разложи факты по пунктам: кто, что сделал, при каких обстоятельствах — без этого якоря адвокат начнёт фантазировать оправдания из воздуха
2. Раздели оценку на 3 этапа: базовое основание для вывода → обстоятельства, снимающие ответственность → личная ответственность
3. На каждом этапе прогони цикл: сначала обвинительная версия → потом роль защитника с единственной задачей искать сомнения → потом пересмотр вывода
4. Дай команду на раннюю остановку: если на любом этапе найдено достаточное основание для оправдания — стоп, дальше не копать
5. Проверь на своей модели: эффект метода гуляет от модели к модели, слепо доверять нельзя

Примеры

[ПЛОХО] : Проверь этот отчёт о провале проекта ещё раз, всё ли верно в логике вывода о виновности сотрудника?
[ХОРОШО] : Оцени в 3 этапа. Шаг 1: есть ли основания считать сотрудника виновным? Шаг 2: переключись в роль адвоката защиты — твоя единственная задача искать смягчающие обстоятельства (нехватка ресурсов, смена требований, нечёткие инструкции), даже если на первый взгляд их не видно. Шаг 3: пересмотри вывод с учётом доводов защиты. Если на любом этапе находишь основание снять вину — останавливайся сразу.
Источник: OBJECTION! Lawyer Agents Mitigate Guilty Bias in Legal Judgment Prediction
ArXiv ID: 2609.02158 | Сгенерировано: 2026-09-03 07:22

Проблемы LLM

ПроблемаСутьКак обойти
Модель принимает предвзятый текст за фактЮридические, деловые и служебные тексты часто написаны с обвинительным уклоном. LLM обучена на таких текстах и не отличает "что случилось" от "как это подали, чтобы обвинить". Модель штампует обвинительные выводы, даже если есть явные основания для оправдания. Проблема для любой задачи с оценкой вины или ответственности по чужому тексту: отчёты, жалобы, служебные записки, разборы инцидентовПроси модель отыграть узкую роль защитника на каждом шаге разбора, а не общего критика. Формулировка роли: "твоя единственная задача — искать основания для оправдания", а не "проверь логику"
Рассуждение по шагам без противовеса усиливает перекосПросьба "думай по шагам" сама по себе не убирает искажение, а усиливает его. Структурированное рассуждение превращается в детальное обоснование уже готового предвзятого вывода. Чем подробнее модель объясняет — тем крепче держится за первоначальную трактовкуНа каждом шаге вставляй роль с противоположной установкой — искать альтернативные объяснения фактов, а не просто продолжать цепочку рассуждений в одном направлении

Методы

МетодСуть
Роль-адвокат на каждом шаге — противовес обвинительному перекосуРазбей оценку на несколько последовательных этапов (например: состав действия смягчающие обстоятельства личная ответственность). На каждом этапе: 1) модель выносит первичное суждение; 2) переключается в роль с узкой установкой "ищи основания для оправдания, не проверяй логику"; 3) пересматривает вывод с учётом найденных доводов. Если на любом этапе найдено достаточное основание для смягчения — останавливайся, дальше не идём. Почему работает: узкая явная роль заставляет искать альтернативные трактовки фактов, а не только ошибки в цепочке рассуждений; встраивание на каждом шаге эффективнее проверки в конце — проще скорректировать промежуточный вывод, чем сломать готовый финальный. Когда применять: оценка вины/ответственности по потенциально предвзятому тексту. Когда не работает: если модель/промпт уже настроены искать смягчающие обстоятельства (даёт перекос в обратную сторону); без предварительного разбора фактов роль начинает фантазировать оправдания

Тезисы

ТезисКомментарий
Конкретность роли важнее количества критиковМодель хорошо отыгрывает роль с чёткой узкой установкой, но плохо реагирует на общие инструкции "проверь ещё раз". Просьба "будь вторым критиком" почти не снижает перекос — модель ищет логические ошибки, а не ставит под вопрос сами факты. Просьба "найди основания для оправдания" работает намного сильнее. Применяй: формулируй роль-противовес максимально узко и однозначно, не "проверь", а "ищи конкретно X"
Встраивание противовеса по шагам сильнее проверки в концеЕсли роль-противовес появляется только после готового финального вывода, эффект слабее. Если она встроена в каждый промежуточный шаг — эффект сильнее. Модели легче пересмотреть один промежуточный вывод, чем сломать уже сформированный итоговый. Применяй: разбей задачу на этапы и вставляй атаку/пересмотр после каждого промежуточного вывода, а не только в конце
Наложение противоположных коррекций даёт перекос в другую сторонуЕсли модель уже настроена компенсировать один перекос, добавление ещё одной роли с той же целью не повышает точность, а создаёт новый перекос в обратную сторону. Применяй: перед добавлением роли-противовеса проверь, не скорректирована ли модель уже в эту сторону. Не складывай две коррекции одного направления
📖 Простыми словами

OBJECTION! LawyerAgentsMitigate Guilty Bias in Legal Judgment Prediction

arXiv: 2609.02158

Большие языковые модели слепо верят тому, как подан текст. Если скормить нейронке отчет с обвинительным уклоном, она примет чужие манипуляции за абсолютную истину. Обычные промпты в духе "подумай ещё раз" или встроенные критики здесь полностью сливают: модель просто проверяет связность внутри уже предвзятого нарратива. В итоге на выходе получается жесткий guilty bias — тупой обвинительный уклон на ровном месте.

Это как если бы судья слушал исключительно прокурора, а на вопрос «всё ли честно?» проверял бы только, без ошибок ли составлен протокол. Формально процесс соблюдён, но без второй стороны это не правосудие, а линчевание на автопилоте. Чтобы модель не вешала ярлыки, ей нужен не абстрактный редактор, а въедливый адвокат защиты, обязанный искать любые зацепки для оправдания.

Именно так работает метод OBJECTION. Вместо вежливого фактчекинга в рассуждения вшивают роль процессуального оппонента: модель делает предварительный вывод, цифровой адвокат жестко атакует обвинение контраргументами, и система пересматривает решение. Этот цикл прогоняют через 3 последовательных этапа анализа, вытаскивая факты, которые обвинитель предпочёл замять.

Тестировали на судебных решениях, но принцип универсален. Разбор срыва дедлайнов, служебные проверки, расследования аварий на проде — везде, где отчет составил обиженный менеджер с целью найти крайнего. Техника OBJECTION ломает корпоративную охоту на ведьм и показывает реальные причины провала, а не удобного козла отпущения.

Короче: проверять предвзятый текст стандартной моделью — это чистый самообман. Хватит наивно просить нейросеть "быть объективной", заставляй ее играть роль агрессивного защитника. Трёхэтапная атака на выводы убережет от фатальных решений и не даст уволить невиновного из-за чужой токсичной кляузы.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с