3,583 papers
arXiv:2610.10971 80 7 окт. 2026 г. FREE

PARCEL: проверка утверждений по тексту источника и слепое пятно LLM — пропуск того, чего в документе нет

КЛЮЧЕВАЯ СУТЬ
Одна из семи проверенных моделей набрала около 80% точности, но «подтвердила» почти половину утверждений, которых в документе нет. Бенчмарк PARCEL показывает, можно ли доверять модели как проверяющему: ей дают документ и одно утверждение. Она выбирает одно из трёх: «подтверждено», «опровергнуто» или «в документе этого нет». Фишка: прямое противоречие модель ловит уверенно, а отсутствие опоры проваливает. Поэтому смотреть надо не на среднюю точность, а на долю ложных «подтверждено». Это слепое пятно, которое общий балл прячет.
Адаптировать под запрос
⚡

TL;DR

PARCEL — это бенчмарк (набор тестов) для проверки утверждений по документу. Модели дают документ целиком и одно утверждение (в юридическом стиле: «суд постановил, что…»). Она должна выбрать одну из трёх меток: подтверждено, опровергнуто или в документе этого нет. Так авторы выясняют, можно ли доверять модели в роли «проверяющего».

Главная находка: модели хорошо ловят прямое противоречие («суд отменил» вместо «суд оставил в силе»), но заметно чаще пропускают отсутствие опоры. Если утверждение звучит правдоподобно и вписано в тему документа, модель отвечает «подтверждено», хотя в тексте этого нет. Опаснее всего выдуманная, но уместная ссылка: на дело или норму, которых в документе нет. Высокая общая точность это скрывает. Одна модель набрала около 80% точности, но «подтвердила» почти половину утверждений, которых в документе нет.

Суть практического вывода: проверка «есть ли в документе опора» — отдельная, более слабая операция, чем «не противоречит ли документ». Оценивать проверяющего нужно по доле ложных «подтверждено», а не по средней точности. И обязательно давать модели честный третий вариант ответа — «в документе нет».

🔬

Схема метода

ШАГ 1: Берём полный текст документа (премиса) + ОДНО утверждение (гипотеза)
ШАГ 2: Короткая инструкция: задача + три метки
        SUPPORTED / REFUTED / NOT_FOUND
ШАГ 3: Модель выбирает одну метку (один запрос на одно утверждение)
ШАГ 4: Оценка: считаем не только точность,
        а долю ложных «подтверждено» отдельно:
        — на опровергнутых утверждениях
        — на утверждениях, которых в документе нет

Всё это один запрос на утверждение, без цепочек.

🚀

Пример применения

Задача: Юрист небольшой компании арендует площадь в торговом центре. Стажёр прислал справку из четырёх тезисов с отсылками к пунктам договора аренды. Юрист хочет быстро понять, какие тезисы не подкреплены договором, до того как пойдёт с ними на переговоры с арендодателем. Тезис вроде «п. 7.4 ограничивает индексацию арендной платы пятью процентами в год» легко звучит правдоподобно, а в договоре такого пункта может не быть.

Промпт:

<Задача>
Проверь утверждение по тексту договора. Опирайся ТОЛЬКО на текст договора ниже.
Не используй общие знания о том, как обычно пишут такие договоры.


<Документ>
[полный текст договора аренды]


<Утверждение>
Пункт 7.4 ограничивает ежегодную индексацию арендной платы пятью процентами.


<Метки>
SUPPORTED — текст договора содержит достаточно оснований, чтобы утверждение было верным.
REFUTED — текст договора прямо противоречит утверждению.
NOT_FOUND — в тексте договора недостаточно информации, чтобы подтвердить или опровергнуть утверждение.


Выбери ровно одну метку. Затем одной строкой объясни выбор.
Проверяй каждое из четырёх утверждений отдельным ответом.

Результат: Модель выдаст по каждому утверждению одну метку и короткое пояснение. Утверждения с неверным исходом или подменённым условием модель с большей вероятностью поймает как REFUTED. Утверждения, которых в договоре просто нет, — зона риска: часть может получить SUPPORTED. Поэтому всё, что получило SUPPORTED, юрист всё равно сверяет по тексту договора.

🧠

Почему это работает

Слабость модели. Она читает документ и утверждение вместе и оценивает, насколько они «сходятся по смыслу». Если утверждение написано в стиле документа, использует его лексику и похоже на то, что там могло быть, сходство высокое. Отсутствие факта оставляет «пустое место», а пустое место заметить труднее, чем явное расхождение. К тому же модели склонны соглашаться и достраивать картину. Поэтому «подтверждено» на отсутствующем утверждении встречается чаще, чем «подтверждено» на опровергнутом.

Сильная сторона. Прямые противоречия модель находит уверенно: когда в тексте написано одно, а в утверждении другое, сверка получается чёткой. Лучшие модели справляются почти идеально и с третьей меткой. Это значит, что при хорошей постановке задачи и сильной модели проверка работает.

Что даёт метод. Три явные метки с определением NOT_FOUND превращают расплывчатое «проверь» в выбор из конкретных вариантов. Отдельный подсчёт ложных «подтверждено» показывает слабое место, которое не видно в средней точности. Рычаги: - Определение NOT_FOUND: чем жёстче («достаточно оснований» против «хоть что-то похожее»), тем меньше ложных подтверждений. В статье это не проверялось. - «Опирайся только на документ»: в статье отмечено, что внутренние знания модели могут перебить строгое следование тексту, поэтому запрет на общие знания разумен. - Одно утверждение на запрос: так сделано в бенчмарке. Пачка утверждений в одном запросе в статье не тестировалась.

📋

Шаблон промпта

Точный текст промпта в доступной части статьи не приведён. Авторы описывают его как минимальный системный промпт с задачей и метками. Ниже реконструкция по этому описанию.

<Задача>
Определи, как документ соотносится с утверждением.
Опирайся только на текст документа.


<Документ>
{документ}


<Утверждение>
{утверждение}


<Метки>
SUPPORTED — документ содержит достаточно оснований для утверждения.
REFUTED — документ прямо противоречит утверждению.
NOT_FOUND — в документе недостаточно информации, чтобы подтвердить или опровергнуть.


Выбери ровно одну метку.

Подставляй: - {документ} — полный текст источника (договор, решение суда, регламент, отчёт); - {утверждение} — один проверяемый тезис.

⚠️

Ограничения

⚠️ Текст статьи неполный: в доступной версии нет таблиц с разбивкой по стратегиям подмены и разбора «трудных» утверждений. Вывод про выдуманные цитаты как самую тяжёлую категорию взят из аннотации.

⚠️ Лечение не проверено: авторы измеряют проблему, но не тестируют промпты, которые её уменьшают (цитата-доказательство, самопроверка, несколько проходов). Всё, что в разделе «Адаптации» ниже, — гипотеза.

⚠️ Юридический домен и синтетические утверждения: все подмены генерировала LLM по заданным стратегиям. Реальные ошибки живых людей и моделей могут выглядеть иначе.

⚠️ Документ целиком в контексте: проверялся короткий и средний текст, поданный полностью. Для огромных корпусов, где ещё нужно найти нужный фрагмент, вывод не доказан.

⚠️ Слабые модели: одна из семи моделей показала тяжёлый перекос в сторону «подтверждено» и пропустила почти половину отсутствующих утверждений. Для менее мощных моделей риск выше.

🔍

Как исследовали

Авторы взяли 85 свежих решений апелляционного суда штата Нью-Йорк за 2024–2025 годы. Сначала они собрали у реальных юристов около 700 пояснений в скобках к ссылкам (в юридическом тексте так кратко пересказывают суть дела) и отобрали 180 «содержательных» как образцы стиля. Затем по каждому решению сгенерировали утверждения трёх типов: подтверждённые (849), опровергнутые (1698) и «в документе этого нет» (849). Всего получилось 3396. Опровергнутые делали четырьмя способами: подмена сущности, переворот исхода, снятие условия, приписывание решения не тому судье. «Отсутствующие» тоже делали тремя способами: фантомная ссылка, «суд не рассматривал довод» и выдуманная деталь. Ключевая деталь дизайна: подмены генерировали, видя весь текст решения, поэтому они звучат в стиле судьи и тематически уместны.

Затем семь моделей решали задачу без примеров и без хитрых промптов. Лучшая модель дала около 97% точности, почти все остальные выше 90%, а Llama-3.3-70B только 81%. Но авторы ввели отдельную метрику — долю ложных «подтверждено» (FER). Разрыв оказался устойчивым: у GLM-4.7 ложные подтверждения на опровергнутых утверждениях составили 1,18%, а на отсутствующих 9,55%. У Llama доля ложных подтверждений на отсутствующих — 48,76%. По всем моделям вместе 15,4% отсутствующих утверждений были приняты за подтверждённые, а среди опровергнутых — 4,3%.

Удивило, что порядок моделей по точности и по безопасности не совпадает: Kimi чуть точнее GLM, но у GLM меньше ложных подтверждений. Вывод для практики: средняя точность проверяющего скрывает самую дорогую ошибку, поэтому нужно мерить её отдельно.

💡

Адаптации и экстраполяции

🔧 Техника: требовать цитату для SUPPORTED → труднее «подтвердить» воздухом

Добавь в конец шаблона:

Если выбираешь SUPPORTED или REFUTED — приведи дословную цитату из документа, на которой основан вывод.
Если дословной цитаты нет — выбери NOT_FOUND.

Это гипотеза, не из статьи: она не измерена, но направлена именно на найденное слабое место.

Экстраполяция: мини-тест своего проверяющего. Прежде чем доверять промпту-проверяющему на реальной работе, подготовь 15–20 утверждений по одному своему документу. Среди них должны быть и выдуманные, по приёмам авторов.

Вот документ: {документ}.
Составь 18 утверждений для проверки проверяющего:
— 6 верных (разные типы: итог, довод, факт, ссылка на другой акт);
— 6 опровергнутых (подмена стороны, переворот исхода, снятие условия «если», приписывание не тому участнику);
— 6 «в документе этого нет» (несуществующая ссылка на норму, «суд не рассматривал довод X», правдоподобная деталь, которой нет в тексте).
Все должны быть в стиле документа. Выдай список с пометкой верного ответа.

Затем прогони утверждения через свой проверяющий промпт и посчитай, сколько из «нет в документе» получили SUPPORTED. Это и есть мини-версия метрики авторов.

🔗

Ресурсы

  • Работа: When Citations Mislead? A Claim-Level Benchmark for Legal Hallucination Detection (ICAIL 2026)
  • Авторы: M. Mikail Demir, M. Abdullah Canbaz — University at Albany, SUNY
  • Датасет: https://github.com/mmikaildemir/PARCEL
  • Трекеры судебных галлюцинаций: AI Law Tracker (Polaris Lab), подборка Damien Charlotin
  • Связанные работы: Dahl et al. (галлюцинации в юридических LLM), LegalBench, LexGLUE

📋 Дайджест исследования

Ключевая суть

Одна из семи проверенных моделей набрала около 80% точности, но «подтвердила» почти половину утверждений, которых в документе нет. Бенчмарк PARCEL показывает, можно ли доверять модели как проверяющему: ей дают документ и одно утверждение. Она выбирает одно из трёх: «подтверждено», «опровергнуто» или «в документе этого нет». Фишка: прямое противоречие модель ловит уверенно, а отсутствие опоры проваливает. Поэтому смотреть надо не на среднюю точность, а на долю ложных «подтверждено». Это слепое пятно, которое общий балл прячет.

Принцип работы

Не делай так: просишь «проверь, верно ли» и оцениваешь по средней точности. Делай так: даёшь три варианта ответа и считаешь ложные «подтверждено» отдельно. Третий вариант, «в документе нет», это честный выход для модели. Проверка «есть ли в тексте опора» — отдельная и более слабая операция, чем «нет ли противоречия». Это как кляксу на странице отличить от вырванной страницы. Кляксу видно сразу. Вырванную страницу заметит только тот, кто помнит, что она была.

Почему работает

Модель читает документ и утверждение вместе и прикидывает, насколько они «сходятся по смыслу». Утверждение в стиле документа, с его словами и темой, выглядит знакомо. Сходство высокое, и модель отвечает «подтверждено». Противоречие даёт явный конфликт: в тексте одно, в утверждении другое. Отсутствие факта оставляет пустое место, а пустое место заметить труднее. Ещё модели склонны соглашаться и достраивать картину. Авторы отмечают и другое: собственные знания модели могут перебить текст документа. Самая опасная категория, по аннотации, это выдуманная, но уместная ссылка на дело или норму. Чем правдоподобнее выдумка, тем охотнее модель её подтверждает. Хорошая новость: лучшие модели справляются почти идеально и с третьей меткой. А вот помогают ли от проблемы цитата-доказательство или самопроверка, в статье не проверяли. Это пока гипотеза.

Когда применять

Юридическая и документная работа → проверка справок, где каждый тезис ссылается на пункт договора, решение суда, регламент или отчёт, особенно когда стажёр (или другая модель) написал «п. 7.4 говорит…», а читать всё подряд нет времени. НЕ подходит для огромных корпусов, где сначала нужно найти нужный фрагмент: там метод не проверяли. И не заменяет глаза юриста: всё, что получило «подтверждено», сверяй по тексту. На слабых моделях риск ложных подтверждений выше.

Мини-рецепт

1. Дай документ целиком: полный текст договора, решения или регламента, без пересказа.
2. Одно утверждение на запрос: так сделано в бенчмарке. Пачки утверждений в одном запросе в статье не пробовали.
3. Опиши три метки: ПОДТВЕРЖДЕНО, ОПРОВЕРГНУТО, НЕТ_В_ДОКУМЕНТЕ. Для последней напиши жёстко: «недостаточно информации, чтобы подтвердить или опровергнуть».
4. Закрой лазейку: «Опирайся ТОЛЬКО на текст ниже, общие знания не используй».
5. Попроси коротко: одна метка и объяснение в одну строку.
6. Считай ложные «подтверждено»: если проверяешь модель на своих данных, смотри отдельно, сколько раз она подтвердила то, чего в тексте нет.
7. Перепроверь каждое «подтверждено» глазами: это зона риска.

Примеры

[ПЛОХО] : Проверь, правильно ли стажёр описал наш договор аренды
[ХОРОШО] : Проверь утверждение по тексту договора. Опирайся ТОЛЬКО на текст ниже, не используй общие знания о том, как обычно пишут такие договоры. <Договор>[полный текст] <Утверждение>Пункт 7.4 ограничивает ежегодную индексацию арендной платы пятью процентами. Метки: ПОДТВЕРЖДЕНО — в тексте достаточно оснований, чтобы утверждение было верным. ОПРОВЕРГНУТО — текст прямо противоречит утверждению. НЕТ_В_ДОКУМЕНТЕ — в тексте недостаточно информации, чтобы подтвердить или опровергнуть. Выбери ровно одну метку и одной строкой объясни выбор. Подменённое условие («индексация до 3%» вместо 5%) модель, скорее всего, поймает как ОПРОВЕРГНУТО. А вот несуществующий «пункт 7.4», вписанный в тему договора, может получить ПОДТВЕРЖДЕНО. Поэтому именно такие ответы проверяй руками.
Источник: When Citations Mislead? A Claim-Level Benchmark for Legal Hallucination Detection
ArXiv ID: 2610.10971 | Сгенерировано: 2026-10-09 05:40

Проблемы LLM

ПроблемаСутьКак обойти
Модель «подтверждает» правдоподобное утверждение, которого в документе нетДаёшь документ и утверждение. Просишь проверить. Если утверждение звучит как документ, модель отвечает «подтверждено». Хотя в тексте этого нет. Например, выдуманная, но уместная ссылка на пункт, дело или норму. Прямое противоречие модель ловит хорошо. А отсутствие факта замечает хуже. Причина: модель оценивает, насколько утверждение «сходится по смыслу» с текстом. Общая лексика и тема дают высокое сходство. Отсутствие факта оставляет пустое место, а его труднее заметить, чем расхождение. Модели ещё склонны соглашаться и достраивать картину. Слабые модели ошибаются так заметно чаще. Опасно для любых проверок «по источнику»: юридических, справочных, отчётов, ответов по базе знанийДай три варианта ответа, а не два: SUPPORTED (достаточно оснований в тексте), REFUTED (текст прямо противоречит), NOT_FOUND (информации недостаточно). Жёстко определи третий вариант. Напиши «опирайся ТОЛЬКО на текст, не используй общие знания». Проверяй по одному утверждению на запрос. Всё, что получило SUPPORTED, на важных решениях сверяй с текстом вручную. Гипотеза, не проверена: требуй дословную цитату из документа как доказательство. Нет цитаты — ставь NOT_FOUND

Методы

МетодСуть
Тест проверяющего на двух видах ложных утверждений — показывает слабое местоПеред запуском промпта-проверяльщика собери небольшой набор утверждений по своим документам. Три группы. 1) Верные. 2) Искажённые: факт из документа изменён (другой срок, сумма, исход). 3) Правдоподобные, но отсутствующие: звучат как документ, а опоры в тексте нет. Группы 2 и 3 можно сгенерировать моделью по такому заданию. Прогони проверяльщика. Считай долю ложных SUPPORTED отдельно для групп 2 и 3. Почему работает: общая точность усредняет лёгкие и трудные случаи. Модель может давать высокую среднюю точность и при этом «подтверждать» почти половину отсутствующих утверждений. Отдельный счёт вскрывает перекос. Когда применять: выбираешь модель или правишь промпт для проверки по источнику. Цена пропуска высока. Ограничение: синтетические подмены проще и однообразнее живых ошибок. Добавь несколько реальных случаев
📖 Простыми словами

When Citations Mislead? A Claim-Level Benchmark for Legal Hallucination Detection

arXiv: 2610.10971

Большие языковые модели проверяют факты не как въедливые юристы, а по общему вайбу. Для нейросетки главное — семантическая близость: если наглая выдумка написана строгим канцелярским стилем и сыплет терминами, модель легко ведётся на эту фигню. Она оценивает общую тему документа, а не наличие конкретной строчки, поэтому «липовая правда» проскакивает проверку без малейшего сопротивления.

Это как сонный охранник на проходной, которому сунули под нос фальшивую ксиву с золотым тиснением. Формально всё солидно, поэтому он козыряет и пропускает, не заметив, что в графе имени написана чушь. Модели куда проще засечь явное расхождение, чем отсутствие факта — пустое место в тексте она мгновенно и радостно замазывает собственными галлюцинациями.

Чтобы вскрыть этот облом, исследователи создали бенчмарк PARCEL. Механика простая: скормить модели документ и проверить тезис по трём меткам — подтверждено, опровергнуто или в документе этого нет. И тут нейросети позорно валятся: когда факта в тексте тупо нет, модель всё равно лепит статус «подтверждено». Базовое свойство LLM угодить и достроить картину начисто вырубает в ней строгого цензора.

Тестировали на договорах и судах, но принцип универсален. Ровно та же лажа вылезает везде: в финансовых аудитах, технической документации, коде и медицинских регламентах. Если коллега принесёт справку со ссылкой на несуществующий пункт договора аренды, твой «умный» ассистент уверенно подтвердит фальшивку и согласится с бредом.

Короче: использовать AI как слепого фактчекера цитат — это полный провал. Нейросети генетически запрограммированы поддакивать тому, что красиво звучит, даже если это чистый вымысел. Либо заставляй модель выдавать прямую цитату слово в слово, либо вычитывай важные пункты глазами, иначе на переговорах тебя ждёт очень неприятный сюрприз.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с