3,583 papers
arXiv:2609.05802 77 5 сент. 2026 г. FREE

AtomCite: проверка и исправление цитат на страницы в многостраничных документах через два канала — текст и картинку

КЛЮЧЕВАЯ СУТЬ
Обнаружено: если проверять цитаты ИИ на страницы только по тексту OCR, теряется информация из таблиц, печатей и подписей. Проверка либо зря отвергает верную страницу, либо принимает неверную. AtomCite позволяет находить и исправлять неправильные номера страниц в ответах ИИ по документам со сканами, таблицами и подписями. Фишка — при споре текста и картинки страницы модель верит картинке, потому что именно там OCR теряет данные. Ответ разбивается на отдельные утверждения, каждое проверяется двумя каналами по указанной странице — и только если не сошлось, метод ищет правильный номер среди соседних страниц.
Адаптировать под запрос

TL;DR

AtomCite — техника, которая проверяет, действительно ли ответ AI ссылается на правильную страницу документа. Метод разбивает ответ на отдельные утверждения с привязкой к номеру страницы, потом проверяет каждое утверждение двумя каналами одновременно: по тексту страницы (через OCR) и по картинке самой страницы. Если каналы спорят — модель доверяет картинке.

Проблема в том, что модели при работе с многостраничными документами часто путают номер страницы или ссылаются на страницу, где факта нет. Причина проста: таблицы, печати, подписи, рукописный текст плохо распознаются автоматическим считыванием текста (OCR) — программа, которая превращает картинку страницы в текст, теряет часть информации. Из-за этого чисто текстовая проверка либо ошибочно принимает неправильную страницу, либо отвергает правильную — просто потому что текст с этой страницы считался с ошибками.

Метод решает это через пять шагов: разбить ответ на пары "утверждение + номер страницы", собрать саму цитируемую страницу плюс соседние (только для предложений исправления, не для вердикта!), проверить оба канала отдельно на цитируемой странице, объединить вердикты по чётким правилам (конфликт = флаг, спор = доверяй картинке), и применить типовое решение: оставить / поменять номер страницы / удалить утверждение / оставить с пометкой о конфликте.


🔬

Схема метода

ШАГ 1 (Разбор): Раздели ответ на пары "утверждение → номер страницы" → список claims
ШАГ 2 (Сбор доказательств): Возьми указанную страницу (текст+картинка) 
       + окно ±2 соседних страницы (только для исправлений, не для вердикта)
ШАГ 3 (Проверка): Проверь каждое утверждение ПО УКАЗАННОЙ СТРАНИЦЕ двумя каналами
       — текст → верно/неверно
       — картинка → верно/неверно
ШАГ 4 (Поиск): Если на указанной странице не подтвердилось — просмотри соседние страницы,
       найди где на самом деле есть подтверждение (или нигде)
ШАГ 5 (Решение): Примени правило —
       подтверждено → оставить
       найдено на другой странице → исправить номер
       не найдено нигде → удалить утверждение
       текст и картинка спорят → оставить, но пометить конфликт

Все пять шагов можно выполнить в одном промпте — если LLM видит и текст, и картинки страниц документа.


🚀

Пример применения

Задача: Финдиректор получил от ИИ-ассистента разбор квартального отчёта (25 страниц, скан с таблицами и подписями). Ассистент написал: "Выручка — 4,2 млн руб (стр. 7). Компания открыла 12 точек продаж (стр. 3). Аудит подписан главбухом 3 марта 2024 (стр. 11). Чистая прибыль — 0,8 млн руб (стр. 5)." Перед тем как нести это руководству, нужно проверить — точно ли цитаты верны.

Промпт:

Я прикладываю документ (страницы как картинки) и ответ ИИ с цитатами на страницы.
Проверь каждое утверждение по следующему алгоритму:

1. РАЗБОР: выпиши список пар "утверждение → номер страницы" из ответа.

2. ПРОВЕРКА: для каждой пары посмотри УКАЗАННУЮ страницу двумя способами —
   - по тексту (как если бы читал OCR-распознавание)
   - по картинке страницы (таблицы, подписи, печати, форматирование)
   Дай отдельный вердикт по каждому каналу: подтверждено / не подтверждено.

3. ЕСЛИ НЕ ПОДТВЕРЖДЕНО на указанной странице — посмотри страницы ±2 от неё
   (максимум 5 страниц окна) и определи, есть ли подтверждение там. 
   Это используй ТОЛЬКО для предложения исправления, не меняй логику вердикта.

4. ОБЪЕДИНИ каналы:
   - оба канала подтвердили → ВЕРНО
   - найдено на другой странице → НЕПРАВИЛЬНАЯ СТРАНИЦА (укажи правильную)
   - не найдено нигде → НЕ ПОДТВЕРЖДЕНО
   - текст и картинка противоречат друг другу → КОНФЛИКТ (не решай сам, пометь)

5. ДАЙ РЕКОМЕНДАЦИЮ по каждому утверждению:
   - ВЕРНО → оставить как есть
   - НЕПРАВИЛЬНАЯ СТРАНИЦА → исправить номер на правильный
   - НЕ ПОДТВЕРЖДЕНО → удалить утверждение из ответа
   - КОНФЛИКТ → оставить утверждение, но добавить пометку "требует проверки человеком"

Ответ дай таблицей: Утверждение | Указанная страница | Вердикт | Рекомендация | Комментарий

[Ответ ИИ для проверки: {текст ответа с цитатами}]

Результат: Модель выдаст таблицу из 4 строк — по каждому утверждению из отчёта. Для каждого будет виден вердикт по обоим каналам, итоговое решение и конкретная рекомендация (оставить/исправить номер/удалить/пометить конфликт). Если один из фактов на самом деле стоит на другой странице — модель это найдёт и предложит исправление номера, а не просто скажет "ошибка".


🧠

Почему это работает

Модели при работе с многостраничными документами путают номера страниц или галлюцинируют факты — особенно когда полагаются на распознанный текст, который плохо считывает таблицы, печати, рукописные подписи. Проверка "в лоб" по тексту через OCR не замечает этой потери информации: если текст с нужной страницы считался с ошибкой, модель либо неправильно отвергнет верную цитату, либо неправильно примет неверную.

LLM хорошо умеет сравнивать два независимых источника и явно называть противоречие, если попросить проверить раздельно текст и картинку, а не смешивать их в один вывод.

Метод обходит слабость через строгое разделение ролей: вердикт даётся только по указанной странице, а соседние страницы используются исключительно для предложения исправления — никогда для того, чтобы "натянуть" положительный вердикт. При конфликте каналов приоритет у картинки, потому что именно там теряется информация при распознавании текста.

Рычаги управления: - Размер окна поиска соседних страниц (±2) → увеличь для документов с разбросанной информацией (длинные контракты), уменьши для компактных таблиц - Строгость политики (удалить vs оставить с флагом) → смягчи, если боишься потерять важную информацию; ужесточи, если критична точность - Приоритет канала при конфликте → смени на текст, если у тебя чисто текстовый документ без сканов и таблиц


⚠️

Ограничения

⚠️ Нужна мультимодальность: метод работает только если LLM реально видит страницы как картинки, а не просто текст. Без загрузки изображений выигрыш пропадает.

⚠️ Не для простых текстовых документов: если в документе нет таблиц, печатей, подписей, сканов — выигрыш от проверки картинкой минимален. Метод раскрывается на документах с визуальной сложностью.

⚠️ Трудоёмко для больших документов: ручная загрузка десятков страниц-картинок в чат неудобна. Метод создавался как автоматическая система с параллельными проверками — в чате это придётся делать вручную или частями.


🔍

Как исследовали

Исследователи собрали два теста: искусственно внедрённые ошибки цитирования (928 штук, каждая проверена автоматическим сканированием документа) и естественные ошибки — 2468 случаев, собранных из реальных ответов разных моделей, из которых 1909 подтвердили два независимых человека-аннотатора. Сравнили AtomCite против чисто текстовой проверки (в том числе с равным вычислительным бюджетом — чтобы исключить объяснение "просто больше токенов") и против прямого промптинга без структуры.

На трёх семействах моделей (Gemini, Claude, GPT) AtomCite показал около 93% точности верификации, заметно обогнав все текстовые варианты. Удивило, что даже когда текстовому варианту дали в три раза больше вычислительного бюджета — разрыв с картиночной проверкой не закрылся. Это значит, что дело не в объёме вычислений, а в том, что распознавание текста просто теряет визуальную информацию — таблицы, печати, подписи.

Отдельный и важный вывод: автоматические метки ошибок без проверки людьми искажают результаты и могут даже поменять порядок систем местами — то есть если верить только автоматическим меткам, чисто текстовая проверка может показаться лучше картиночной, хотя на самом деле это не так.


🔗

Ресурсы

AtomCite / DocCite benchmark. Авторы: Chen Qian, Yimeng Wang, Yu Chen, Lingfei Wu, Andreas Stathopoulos. William & Mary, Anytime AI.


📋 Дайджест исследования

Ключевая суть

Обнаружено: если проверять цитаты ИИ на страницы только по тексту OCR, теряется информация из таблиц, печатей и подписей. Проверка либо зря отвергает верную страницу, либо принимает неверную. AtomCite позволяет находить и исправлять неправильные номера страниц в ответах ИИ по документам со сканами, таблицами и подписями. Фишка — при споре текста и картинки страницы модель верит картинке, потому что именно там OCR теряет данные. Ответ разбивается на отдельные утверждения, каждое проверяется двумя каналами по указанной странице — и только если не сошлось, метод ищет правильный номер среди соседних страниц.

Принцип работы

Работает как проверка свидетеля в суде: сначала слушаешь пересказ (текст), потом смотришь видеозапись (картинка страницы). Рассказы не совпали — веришь видео, а не пересказу. Вердикт даётся строго по заявленной странице — соседние страницы можно смотреть только чтобы подсказать правильный номер, а не чтобы натянуть "верно". Это разделение ролей — ядро метода. Без него легко смухлевать и найти подтверждение "где-то рядом", а не там, где заявлено.

Почему работает

Распознавание текста физически не считывает то, что нарисовано. Таблицы разваливаются на цифры без структуры, печати и подписи от руки вообще пропадают. Проверяешь только по тексту — модель либо зря отвергает правильную цитату (текст считался с ошибкой), либо принимает неправильную (текст случайно совпал). Модель отлично сравнивает два независимых источника и явно называет расхождение — если попросить проверить их раздельно, а не смешивать в один вывод. Смешивание каналов убивает точность проверки.

Когда применять

Работа с документами → конкретно для проверки цитат ИИ на сканы, финансовые отчёты, контракты с таблицами, печатями и подписями, особенно перед тем как нести результат руководству или в суд. НЕ подходит для чисто текстовых документов без таблиц и визуальных элементов — там простой текстовой проверки достаточно.

Мини-рецепт

1. Разбей ответ: выпиши пары «утверждение → номер страницы» из ответа ИИ.
2. Собери доказательства: возьми указанную страницу текстом и картинкой, плюс запасное окно ±2 страницы (только для подсказки исправления, не для вердикта!).
3. Проверь дважды: по тексту отдельно и по картинке отдельно — подтверждено или нет.
4. Объедини по правилу: оба «да» → оставить; спор каналов → верь картинке и ставь пометку «конфликт»; нигде не нашлось → удаляй утверждение.
5. Дай рекомендацию: таблицей «утверждение | указанная страница | вердикт | что делать | комментарий».

Примеры

[ПЛОХО] : Проверь цитаты в отчёте на правильность
[ХОРОШО] : Проверь каждое утверждение по указанной странице двумя способами: по тексту и по картинке страницы (таблицы, подписи, печати). Если не подтвердилось — посмотри страницы ±2 и предложи исправление номера. Дай таблицу: утверждение | страница | вердикт | рекомендация
Источник: AtomCite: Verification and Correction of Supplied Page-Level Citations in Multi-Page Documents
ArXiv ID: 2609.05802 | Сгенерировано: 2026-09-09 04:24

Проблемы LLM

ПроблемаСутьКак обойти
Текст теряет данные из таблиц, печатей, подписейАвтоматическое распознавание текста плохо читает таблицы, печати, рукописные подписи. Модель проверяет цитату только по тексту и ошибается. Либо отвергает верную страницу, либо принимает невернуюПроверяй цитату двумя способами сразу: по тексту и по картинке страницы. Если способы расходятся — доверяй картинке

Методы

МетодСуть
Двухканальная проверка текст + картинкаРазбей ответ на пары "утверждение номер страницы". Проверь каждую пару отдельно по тексту и по картинке. Получи два независимых вердикта. Объедини: оба "да" верно, спор доверяй картинке, оба "нет" удали утверждение. Работает потому что текст и картинка теряют разную информацию. Совпадение двух источников надёжнее одного. Годится для сканов, таблиц, документов с визуальной сложностью. Не нужно для чисто текстовых файлов
Раздельный охват: узкая зона для вердикта, широкая — для исправленияДай вердикт (верно/неверно) только по той странице, что указана в цитате. Соседние страницы используй только чтобы предложить исправление номера — не чтобы менять сам вердикт. Работает потому что широкий поиск иначе "натягивает" любое совпадение как подтверждение — теряется строгость проверки. Годится для любой проверки фактов с точным адресом (страница, раздел, файл). Не годится там, где нет чёткого разделения "где искать" и "что подтверждать"
📖 Простыми словами

AtomCite: Verification and Correction of Supplied Page-Level Citations in Multi-Page Documents

arXiv: 2609.05802

Нейросети обожают лажать со ссылками на первоисточники: они выдают правильный факт, но привязывают его к левой странице, либо уверенно выдумывают цифру из головы. Корень проблемы в том, что обычный OCR превращает сложную вёрстку в кашу. Таблицы плывут, печати и подписи теряются, а языковая модель начинает додумывать контекст на лету, ориентируясь на криво распознанный текст.

Это как проверять финансовый отчёт не по оригиналу с синей печатью, а по расшифровке от глуховатого стажёра. Формально буквы есть, но колонки съехали, а подпись главбуха превратилась в нечитаемый мусор. Ты пытаешься перепроверить нужную цифру на седьмой странице, а там — полная пустота.

Метод AtomCite чинит этот бардак: он режет ответ ассистента на атомарные утверждения и запускает двухканальную верификацию. Система проверяет каждый отдельный факт параллельно — по тексту и по реальному скану страницы. Если OCR спорит с изображением, модель шлёт текст лесом и верит глазам, находя данные напрямую в графическом слое.

Тестировали на квартальных отчётах, но принцип универсален для любой сложной документации. Юридические договоры, финансовый due diligence, медицинские карты и многостраничные сметы — везде, где ошибка в одной цифре стоит денег и репутации. Если ассистент помогает принимать решения, он обязан железно доказать каждую строчку.

Короче: слепо доверять ссылкам LLM на страницы в скачанных PDF — чистый облом для бизнеса. Два канала проверки, приоритет картинки над OCR, атомарный контроль. Внедряй нормальную верификацию цитат, если не хочешь краснеть перед руководством за галлюцинации в аудите.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с