TL;DR
Когда просишь LLM оценить текст на «не завышены ли обещания» — модель хорошо замечает, если утверждение стало шире (распространяется на больше ситуаций или людей), но почти не замечает, если оно стало увереннее (убрали «может быть», добавили «точно», сняли оговорки). Это два разных механизма overclaiming, и модель-судья ловит их с разной чувствительностью — стабильно, во всех проверенных моделях.
Разрыв в чувствительности огромный и не случайный: если попросить модель «будь точнее», она честно сужает охват утверждения — но одновременно делает его звучание более уверенным, снимая хеджи. Получается парадокс: просьба к точности делает текст точнее по одному параметру и одновременно более завышенным по-другому, а модель этого не видит, потому что оценивает всё одним смешанным вердиктом.
Решение простое: не давать LLM один вопрос «завышена ли claim?», а разбить оценку на два отдельных явных вопроса — про охват и про силу утверждения — и требовать раздельный вердикт по каждому.
Схема метода
ШАГ 1: Дать оригинал и изменённую версию текста → LLM сравнивает
ШАГ 2: Оценить ОХВАТ отдельно → расширился / не расширился (на сколько ситуаций/людей claim теперь распространяется)
ШАГ 3: Оценить СИЛУ отдельно → усилилась / не усилилась (сняты хеджи, добавлены усилители)
Все шаги — в одном промпте, но с явным разделением на два независимых вердикта.
Пример применения
Задача: PR-менеджер стартапа проверяет пресс-релиз перед публикацией — не наткнётся ли компания на претензии за недобросовестную рекламу («лучший», «единственный», «100% результат» — классика придирок ФАС и просто репутационный риск).
Промпт:
Сравни два варианта утверждения — оригинал и изменённую версию.
Оригинал: «Приложение помогает снизить тревожность у части пользователей
в краткосрочных наблюдениях»
Изменённая версия: «Приложение доказанно снижает тревожность у всех пользователей»
Оцени раздельно, по двум критериям:
1. ОХВАТ — расширилось ли то, на сколько ситуаций/людей распространяется
утверждение? (например: «у части» → «у всех», «в отдельных случаях» → «всегда»)
Вердикт: расширился / не расширился. Обоснование.
2. СИЛА — стало ли утверждение звучать увереннее, без учёта охвата?
Проверь, убрали ли слова неуверенности («может», «в отдельных наблюдениях»)
или добавили усилители («доказанно», «гарантированно», «точно»).
Вердикт: усилилось / не усилилось. Обоснование.
Не смешивай два критерия в один общий вывод.
Результат: модель выдаст два отдельных вердикта вместо одной размытой оценки «текст стал более рекламным». В данном примере она должна отметить: охват расширился («часть» → «все»), и сила увеличилась («помогает снизить» → «доказанно снижает»). Разделение не даёт спрятать один сигнал за другим.
Почему это работает
LLM, оценивая текст одним смешанным вопросом, ловит расширение охвата — это похоже на подсчёт или классификацию («стало больше ситуаций»), с чем модели справляются хорошо. А снятие хеджей модель воспринимает как стилистическое изменение, а не содержательное — «текст звучит увереннее» не считывается как «утверждение стало сильнее».
Разделение вопроса на два принуждает модель проверить каждый механизм явно, вместо того чтобы усреднить впечатление. Это не устраняет слабость полностью (чувствительность к силе всё равно ниже), но снижает риск, что судья пропустит именно этот тип завышения.
Рычаг: формулировку «охват / сила» можно заменить на любую другую пару осей, если проверяешь текст на другой тип искажения — например, «факт / интерпретация» при факт-чекинге новостей.
Шаблон промпта
Сравни два варианта утверждения — оригинал и изменённую версию.
Оригинал: {текст_оригинала}
Изменённая версия: {текст_версии}
Оцени раздельно, по двум критериям:
1. ОХВАТ — расширилось ли то, на сколько ситуаций/людей/случаев
распространяется утверждение? (например: «иногда» → «всегда»,
«у части пользователей» → «у всех пользователей»)
Вердикт: расширился / не расширился. Обоснование.
2. СИЛА — стало ли утверждение звучать увереннее, без учёта охвата?
Проверь, убрали ли слова неуверенности («может», «предположительно»,
«в некоторых условиях») или добавили усилители («точно», «доказано»,
«всегда работает»).
Вердикт: усилилось / не усилилось. Обоснование.
Не смешивай два критерия в один общий вывод — если изменился
только один из них, укажи это явно.
Подставляй в {текст_оригинала} и {текст_версии} два варианта одного заявления — до и после редактуры (свой текст, чужая правка, черновик и финал).
Ограничения
⚠️ Узкая область применения: метод работает для проверки claims — научных утверждений, рекламных текстов, факт-чекинга. Для общей оценки «какой текст лучше» он не нужен.
⚠️ Не убирает слабость полностью: даже при явном разделении вопросов модель всё равно менее чувствительна к силе утверждения, чем к охвату — разделение снижает разрыв, но не закрывает его.
⚠️ Не заменяет юридическую проверку: для рекламных или медицинских текстов, где ошибка стоит денег или репутации, результат LLM — подсказка, не финальное решение.
Как исследовали
Исследователи собрали 7 разных LLM-судей и проверили их на 4 предметных областях, придумав минимальные правки текста двух типов: одни не должны менять вердикт (проверка на надёжность), другие обязаны его менять — расширяя охват или усиливая коммитмент утверждения (проверка на чувствительность к сути). Правильное направление правки задавали не модели, а живые люди-аннотаторы с порогом согласия 75% — иначе получилась бы циркулярная проверка, где модель размечает саму себя.
Чтобы никто не подгонял результат под себя, тексты генерировали, проверяли и судили модели из трёх разных семейств. Получилось, что судьи почти идеально держат инвариантность (0.945 из 1 — не сбиваются на формат и длину), но плохо реагируют на реальные смысловые изменения (0.319 из 1). Разница в чувствительности к охвату и силе была одинаковой по знаку во всех 7 судьях независимо от размера и вендора — статистически значимо.
Отдельно проверили публичные бенчмарки вроде MT-Bench и RewardBench: простое правило «смотри на длину и формат ответа» воспроизвело 55–67% меток людей — то есть многие оценочные датасеты можно «решить» без понимания смысла вопроса. Это и объясняет, почему проблема раньше не всплывала: сами инструменты проверки её не видят.
Ресурсы
Jianlin Chen, Wenhui Chen, Ziyao Lin, Chi Man Vong — South China University of Technology, University of Macau. Ссылки на смежные работы: Ribeiro et al. (invariance / directional expectation), Jiang et al. и James et al. (декомпозиция overclaiming), Peters & Chin-Yee (парадокс accuracy-prompting).
