3,583 papers
arXiv:2608.04240 74 4 авг. 2026 г. FREE

ACT-Eval: разбей текст на атомарные утверждения — иначе LLM-судья поверит уверенному вранью

КЛЮЧЕВАЯ СУТЬ
40% текстов с кучей фактических ошибок получили от LLM-судьи высокую оценку — просто потому что звучали уверенно. ACT-Eval позволяет проверять правдивость ответа модели по каждому факту отдельно, а не по общему впечатлению от текста. Ответ режут на маленькие проверяемые утверждения и сверяют каждое с внешним источником, а не с памятью самой модели. Ложь прячется в потоке текста, но не может спрятаться в отдельном факте — модели без доступа к внешней проверке ошибались в 22-55% утверждений, хотя текст выглядел гладко и профессионально.
Адаптировать под запрос

TL;DR

Когда просишь LLM оценить текст на правдивость целиком — она смотрит на то, звучит ли текст убедительно, а не на то, правда ли там написано. Исследователи разложили любой ответ модели на мелкие проверяемые факты ("атомы") и сверяли каждый отдельно с источником истины, вместо общей оценки "хорошо/плохо".

Главная находка: обычный LLM-судья систематически обманывается уверенным тоном. В 40% случаев, когда текст содержал массу фактических ошибок, судья всё равно ставил ему высокую оценку за "релевантность" — потому что сам судья не эксперт в узкой теме и не может отличить убедительную ложь от правды. Модели без доступа к внешнему источнику фактов ошибались в 22-55% отдельных утверждений, при этом текст выглядел гладко и профессионально.

Метод решает это через три шага: разбить ответ на отдельные проверяемые факты, сверить каждый по отдельности с надёжным источником (не с "памятью" модели), и только потом сравнить с эталонным списком того, что должен был упомянуть эксперт. Оценка складывается из трёх метрик: точность фактов, полнота покрытия ключевых идей и правильность общего вердикта.


🔬

Схема метода

ШАГ 1: Разбить сгенерированный текст на атомарные утверждения (каждое = один факт) → список атомов
ШАГ 2: Каждый атом разбить на конкретные проверяемые под-факты → список под-утверждений
ШАГ 3: Проверить каждое под-утверждение через внешний источник истины (не через "память" модели) → вердикт верно/неверно на каждый атом
ШАГ 4: Сравнить подтверждённые атомы с эталонным списком "что должен был сказать эксперт" → оценка полноты

Все шаги выполняются в рамках одного запроса к модели-судье, но с обязательным обращением к внешнему источнику на шаге 3.


🚀

Пример применения

Задача: Вы попросили ChatGPT сделать резюме договора аренды перед подписанием — какие там риски, сроки, штрафы. Хотите проверить, не наврала ли модель, прежде чем доверять этому резюме.

Промпт:

Вот текст договора:
{текст договора}

Вот резюме, которое ты сделал ранее:
{резюме}

Разбей резюме на отдельные атомарные утверждения — каждое должно содержать один конкретный факт (например: "штраф за просрочку — 0,1% в день" или "договор можно расторгнуть за 30 дней").

Для каждого утверждения:
1. Сформулируй его как отдельное предложение
2. Найди в тексте договора точный пункт, который это подтверждает или опровергает
3. Дай вердикт: подтверждено / не подтверждено / противоречит договору / в договоре не упоминается

Не давай общую оценку резюме целиком — только вердикт по каждому пункту отдельно.

Результат: Модель выдаст пронумерованный список из 8-15 утверждений. У каждого — цитата из договора и вердикт. Вы сразу увидите, какие пункты резюме модель придумала или переврала, а какие подтверждаются текстом — без общей размытой оценки "резюме хорошее".


🧠

Почему это работает

Когда модель оценивает текст целиком, она реагирует на гладкость и уверенность подачи, а не на скрытые ошибки внутри. Особенно в специализированных темах — шахматы, юриспруденция, финансы — судья сам не эксперт и подкупается профессиональным тоном.

Зато LLM отлично умеет дробить текст на конкретные утверждения — это задача на структурирование, а не на экспертное знание. Разложить фразу "Qe4 централизует ферзя и атакует слона на b4" на два отдельных факта модели легко.

Метод берёт эту сильную сторону и заставляет модель проверять не текст целиком, а один факт за раз, каждый — против внешнего источника (движок, документ, база данных). Общая ложь размывается и прячется в потоке текста; отдельный факт спрятать негде.

Рычаги управления: - Источник верификации — замени шахматный движок на документ, поиск, калькулятор — под свою задачу. - Уровень детализации атомов — крупнее атомы = быстрее, но грубее; мельче = точнее, но дольше. - Эталонный список (Stage 3) — если у вас есть образец "правильного" ответа эксперта, добавьте сравнение на полноту, а не только на точность.


📋

Шаблон промпта

Вот текст: {текст}
Вот источник для проверки: {источник_истины}

Разбей текст на отдельные атомарные утверждения — каждое должно содержать ровно один конкретный факт, который можно проверить.

Для каждого утверждения:
1. Сформулируй его отдельным предложением
2. Проверь по {источник_истины}: можно ли подтвердить или опровергнуть
3. Если да — процитируй точное место в источнике
4. Дай вердикт: подтверждено / не подтверждено / противоречит источнику / невозможно проверить

Не давай общую оценку текста — только вердикты по каждому утверждению отдельно.

Что подставлять: {текст} — то, что нужно проверить (резюме, анализ, объяснение); {источник_истины} — документ, данные или файл, с которым можно сверить факты.

🚀 Быстрый старт — вставь в чат:

Вот шаблон атомарной проверки фактов. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какой у вас источник истины (документ, данные, база) и какой текст проверять — потому что без конкретного источника атомарная проверка превращается в пустую формальность. Она возьмёт паттерн из шаблона и подгонит под вашу тему.


⚠️

Ограничения

⚠️ Нужен надёжный источник истины: метод работает только если есть на что сверять факты — документ, база данных, точные цифры. Для чисто оценочных или творческих текстов (мнения, стиль) атомизация бессмысленна — там нечего проверять.

⚠️ Точность фактов ≠ полнота идей: даже если все факты в тексте верны, модель может пропустить главную мысль, которую заметил бы эксперт. В исследовании даже лучшая модель с доступом к инструментам покрывала только 61% ключевых экспертных идей.

⚠️ Судья осторожен, но не идеален: если судья говорит "ошибка" — это почти всегда правда. Но если говорит "всё верно" — он может пропустить часть реальных ошибок, которые заметит внимательный человек.


🔍

Как исследовали

Исследователи собрали 325 шахматных позиций из учебников, турнирных партий и специально сконструированных критических моментов. Для 125 из них эксперты-гроссмейстеры составили эталонные списки ключевых идей. Шесть моделей (GPT-5.4, Claude Opus, Gemini, DeepSeek, две версии Qwen) писали комментарии к ходам — с доступом к шахматному движку Stockfish и без него.

Самое интересное — сравнение с обычным LLM-судьёй: на 264 комментариях, где новый метод нашёл массовые фактические ошибки, старый судья всё равно ставил хорошую оценку почти в 40% случаев. Это не случайность, а систематический сбой — судья без доступа к внешней проверке просто не может отличить уверенную ложь от правды.

Чтобы убедиться, что новый метод сам не врёт, его сверили с реальными шахматистами (рейтинг 1800-2200). Согласие судья-человек оказалось в тех же пределах, что и согласие человек-человек — то есть метод не хуже живого эксперта в определении ошибок, хотя и склонен их немного недооценивать.


📋 Дайджест исследования

Ключевая суть

40% текстов с кучей фактических ошибок получили от LLM-судьи высокую оценку — просто потому что звучали уверенно. ACT-Eval позволяет проверять правдивость ответа модели по каждому факту отдельно, а не по общему впечатлению от текста. Ответ режут на маленькие проверяемые утверждения и сверяют каждое с внешним источником, а не с памятью самой модели. Ложь прячется в потоке текста, но не может спрятаться в отдельном факте — модели без доступа к внешней проверке ошибались в 22-55% утверждений, хотя текст выглядел гладко и профессионально.

Принцип работы

Не спрашивай судью «текст хороший?» — спроси «каждый факт по отдельности верный?». LLM-судья отлично умеет структурировать текст, но плохо разбирается в узкой теме как эксперт. Разбей ответ на атомы — и ложи спрятаться будет негде. Крупные утверждения дробятся на под-факты, каждый идёт на отдельную проверку.

Почему работает

Судья, оценивающий текст целиком, реагирует на гладкость подачи, а не на скрытые ошибки внутри. Он не эксперт по шахматам, юриспруденции или финансам — и покупается на уверенный профессиональный тон. Проверка одного факта — это задача на сверку данных, а не на экспертное знание, и с ней модель справляется отлично. Общая ложь размывается в тексте, а отдельный факт спрятать негде. Даже лучшая модель с доступом к инструментам покрывала только 61% ключевых идей эксперта — точность фактов и полнота мысли это разные вещи.

Когда применять

Проверка фактов в узких темах → юридические резюме, финансовые отчёты, технический анализ, там где есть надёжный источник истины для сверки. Особенно ценно когда текст звучит убедительно, а тема узкая и вы сами не эксперт, чтобы поймать вранье на слух. НЕ подходит для оценочных или творческих текстов — там нет конкретных фактов, которые можно с чем-то сверить.

Мини-рецепт

1. Найди источник истины: документ, база данных, калькулятор или движок — то, с чем можно сверять факты напрямую.
2. Разбей ответ на атомы: попроси модель выделить каждый факт отдельным предложением, без склейки нескольких идей в одну.
3. Сверь каждый атом отдельно: не через память модели, а через внешний источник — вердикт подтверждено / не подтверждено / противоречит.
4. Добавь эталонный список (если есть): сравни подтверждённые факты со списком того, что должен был упомянуть эксперт — это покажет полноту, а не только точность.

Примеры

[ПЛОХО] : Оцени это резюме договора на правдивость от 1 до 10
[ХОРОШО] : Разбей резюме договора на отдельные атомарные утверждения. Для каждого найди подтверждающий или опровергающий пункт в тексте договора и дай вердикт: подтверждено / не подтверждено / противоречит / не упоминается. Не давай общую оценку резюме целиком.
Источник: Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary
ArXiv ID: 2608.04240 | Сгенерировано: 2026-08-06 04:28

Проблемы LLM

ПроблемаСутьКак обойти
Судья оценивает текст по тону, а не по фактамПросишь модель оценить правдивость ответа целиком. Модель смотрит, звучит ли текст убедительно и профессионально. Не проверяет, правда ли там написано. В итоге уверенно написанный текст с кучей ошибок получает высокую оценку. Проблема острее в узких темах — юриспруденция, медицина, шахматы — где судья сам не экспертНе проси общую оценку. Разбей текст на отдельные проверяемые факты. Сверяй каждый факт по отдельности с внешним источником (документ, база, калькулятор) — не с памятью модели

Методы

МетодСуть
Атомарная проверка фактов — точность вместо общего впечатленияРазбей ответ модели на отдельные утверждения, каждое — один конкретный факт. Для каждого факта: найди подтверждение или опровержение во внешнем источнике, дай вердикт "подтверждено / не подтверждено / противоречит / не упоминается". Не давай общую оценку — только по каждому факту. Почему работает: дробить текст на факты — задача на структурирование, с ней модель справляется легко. Экспертная оценка правдивости — задача на знание темы, тут модель слабее и легко обманывается тоном. Разделяя эти две задачи, убираешь слабое место. Ложь, размытая в потоке текста, не может спрятаться в отдельном факте, сверенном с источником. Когда работает: есть надёжный источник для сверки — документ, база данных, точные цифры. Когда не работает: оценочные или творческие тексты (мнения, стиль) — там нет факта, который можно проверить

Тезисы

ТезисКомментарий
Проверка фактов по отдельности точнее общей оценки текстаМодель хуже определяет правдивость текста целиком — реагирует на гладкость подачи. Но хорошо справляется с разбивкой текста на отдельные утверждения — это структурная задача, не экспертная. Разделяя проверку на мелкие шаги и сверяя каждый с внешним источником, убираешь пространство для скрытой лжи. Применяй: для любой проверки достоверности — вместо "оцени точность ответа" пиши "разбей на факты и сверь каждый с источником"
Верный ответ может пропускать главное — точность и полнота это разные вещиДаже если каждый отдельный факт в тексте правильный, модель может упустить ключевую мысль, которую заметил бы эксперт. Проверка фактов не показывает, что важное осталось за кадром. Применяй: добавляй в проверку не только "это верно?", но и "что из ключевого пропущено?" — сравнивай с эталонным списком того, что должен был упомянуть эксперт
📖 Простыми словами

Hallucinations on the Board:Tool-Augmented Evaluation ofLLMChess Commentary

arXiv: 2608.04240

Проблема в том, что современные нейронки — это патологические лжецы с лицом отличника. Когда ты просишь LLM проверить текст на вшивость, она не вникает в суть, а оценивает вайб и уверенность. Если текст написан гладко и профессионально, модель ставит лайк, даже если внутри полная ахинея. Это фундаментальный баг: нейронки натренированы на предсказание слов, поэтому красивая форма для них всегда важнее, чем фактическая точность.

Это как нанять на проверку финансового отчета человека, который не знает математику, но обожает читать бизнес-романы. Он посмотрит на графики, оценит умные слова и скажет, что отчет супер, просто потому что он выглядит солидно. В итоге вы оба радостно идете к банкротству, потому что проверяющий купился на уверенный тон, а не на реальные цифры.

Чтобы перестать жрать этот кактус, исследователи предложили метод атомарной проверки. Суть простая: нельзя оценивать ответ целиком, его нужно расчленить на мельчайшие факты — «атомы». Каждый такой атом — это отдельное утверждение, которое можно проверить по принципу «да или нет». Вместо того чтобы спрашивать «хорош ли этот комментарий к шахматной партии?», мы берем конкретный ход и сверяем его с движком Stockfish. Если модель сказала, что конь пошел на f3, а он там не стоял — это галлюцинация, и никакой красивый слог её не спасет.

Хотя эксперименты ставили на шахматах, этот подход — единственный способ выжить в мире, где AI пишет за нас договоры, диагнозы и код. Принцип универсален: если ты просишь нейронку проверить резюме контракта, не верь её общему вердикту. Нужно заставить систему выписать каждый риск отдельной строкой и подтвердить его ссылкой на пункт, а потом прогнать это через независимый источник истины. Только так можно вытравить из ответов профессиональный булшит.

Короче, пора признать: LLM — хреновые судьи сами для себя, потому что они слишком вежливые и поверхностные. Единственный рабочий вариант — декомпозиция на факты и жесткая сверка каждого слова с реальностью. Либо ты дробишь ответ на мелкие детали и проверяешь их по отдельности, либо продолжаешь верить галлюцинациям, которые просто хорошо упакованы. Кто не научится проверять «атомы», тот рано или поздно подпишет контракт, где мелким шрифтом написано, что он продал почку.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с