3,583 papers
arXiv:2609.39027 81 30 сент. 2026 г. FREE

SciCore: оценка текста через предварительное извлечение фактов, чтобы формулировки не влияли на балл

КЛЮЧЕВАЯ СУТЬ
Проблема: две заявки с одинаковыми цифрами получают разный балл, если одну написали как «революционную экосистему», а другую как сухой отчёт. Просьба «оценивай суть, а не стиль» тоже подводит: на одной модели улучшились все пять метрик, на другой часть ухудшилась. Метод SciCore позволяет оценивать заявки, резюме и питчи так, чтобы красивая подача не влияла на балл. Фишка: не проси модель забыть красивые слова, а убери их до оценки. Одним запросом ты переписываешь текст в нейтральную запись фактов, вторым оцениваешь только её, а потом усредняешь с обычной оценкой полного текста.
Адаптировать под запрос
⚡

TL;DR

SciCore — двухветочная схема для LLM-судьи. Первая ветка оценивает текст целиком. Вторая сначала просит модель вытащить из текста сухую запись фактов: проблема, утверждения, метод, доказательства, результаты, ограничения. Затем в новом запросе оценивает только эту запись, оригинала в нём нет. Итоговый балл — среднее двух оценок.

Главная боль: один и тот же смысл, поданный другими словами, получает разные баллы. Хвалебный тон, громкие слова и другая структура поднимают оценку, сухая подача — опускает. Очевидное лекарство — дописать в промпт «оценивай суть, а не стиль» и повторить это несколько раз. Оно работает нестабильно: на одной модели из пяти метрик улучшились все, на другой часть ухудшилась. Есть и вторая ловушка — «ложная устойчивость». Модель, которая всем ставит почти одинаковый балл, выглядит стабильной, но отличать сильное от слабого она перестала.

Метод обходит проблему структурой, а не уговорами. Шаг 1: модель переписывает текст в нейтральную запись фактов, третье лицо, без оценок и эмоций, с сохранением цифр и с пометкой «не удалось прочитать». Шаг 2: оценщик видит только эту запись. Красивая упаковка до него не доходит. Шаг 3: усредняем с обычной оценкой полного текста.

🔬

Схема метода

ШАГ 1 (запрос 1): полный текст → структурированная запись фактов
        (третье лицо, без оценок, цифры сохранены, неясное помечено)
ШАГ 2 (запрос 2, новый чат): ТОЛЬКО запись фактов → оценка по критериям
ШАГ 3 (запрос 3, параллельно): полный текст → строгая оценка по тем же критериям
ШАГ 4: итог = (оценка шага 2 + оценка шага 3) / 2

Шаги 2 и 3 независимы друг от друга. Шаг 1 нужен только для шага 2. Это отдельные запросы, лучше в разных чатах.

🚀

Пример применения

Задача: Вы отбираете заявки в акселератор вроде ФРИИ или «Сколково». Два фаундера описали одну и ту же сервисную компанию: 40 клиентов, выручка 3 млн ₽ в месяц, отток 8%. Первый пишет «революционная экосистема, которая перевернёт рынок». Второй — сухо, как в отчёте. LLM-судья без защиты поставит первому балл выше. Это сильная зона метода: в тексте есть проверяемые факты, утверждения и цифры.

Промпт (запрос 1 — извлечение):

Ты готовишь нейтральную запись заявки для эксперта акселератора.
Из текста заявки ниже извлеки: проблему, решение, утверждения авторов,
рынок и аудиторию, метрики и цифры, доказательства (клиенты, пилоты, выручка),
ограничения и риски, которые авторы назвали сами.

Правила:
- Пиши в третьем лице, нейтрально: «авторы утверждают…», «заявлено…».
- Не оценивай, не хвали, не критикуй. Не решай, убедительно ли это.
- Убери эмоциональные и рекламные формулировки, оставь суть.
- Сохрани все цифры и названия как в оригинале.
- Если чего-то нет в тексте или оно не читается, напиши «в заявке не указано».
  Ничего не додумывай.

Текст заявки:
[вставить заявку]

Промпт (запрос 2 — оценка записи, новый чат):

Ты эксперт акселератора. Ниже — структурированная запись заявки.
Оригинала у тебя нет, оценивай только запись.

Свяжи разделы между собой: проверь, подтверждают ли доказательства и цифры
заявленные утверждения. То, что в записи прямо отмечено как «не указано»,
считай отсутствующим подтверждением. Пометки о нечитаемости не засчитывай
как слабость заявки.

Критерии (по 1–10): рынок, команда, продукт, тракшн, риски.
Дай краткое резюме, сильные стороны, слабые стороны, вопросы к авторам
и общий балл 1–10.

Запись заявки:
[вставить результат запроса 1]

Результат: Из запроса 1 придёт сухая запись фактов без «революционной экосистемы». Из запроса 2 — оценка по критериям с сильными и слабыми сторонами и общим баллом. Затем вы отдельно просите строгую оценку полной заявки по тем же критериям и усредняете два общих балла.

🧠

Почему это работает

Слабость. Если дать модели полный текст и написать «игнорируй риторику», она всё равно читает всю упаковку. Тон, структура и громкие слова остаются во входе и влияют на ответ. Инструкция «не поддавайся» с этим не справляется, поэтому результат нестабилен.

Сильная сторона. Модель хорошо переписывает текст в заданную форму: выдёргивает факты, переводит в нейтральный тон, раскладывает по полям. Перенести факты проще и надёжнее, чем при чтении одновременно «не поддаваться» тону.

Как метод это использует. Он убирает упаковку до оценки, а не просит о ней забыть. Усреднение с полным чтением сохраняет контекст, который извлечение могло потерять. Если запись плохая, вторая ветка подстрахует.

Рычаги управления: - Что извлекаем → список полей под вашу задачу (для питча — тракшн и юнит-экономика, для резюме — опыт и результаты). - «Не указано» → чем строже правило не додумывать, тем меньше выдуманных фактов в записи. - Протокол полной ветки → в статье это строгий рубрикатор. Можно усилить требования к доказательствам. - Веса при усреднении → в статье 50/50 без подбора. Менять веса стоит только после проверки на ваших данных.

📋

Шаблон промпта

Запрос 1 — извлечение:

Ты готовишь нейтральную запись материала для эксперта.
Извлеки из текста ниже:
- {поле_1: проблема / цель}
- {поле_2: утверждения и заявленный вклад авторов}
- {поле_3: метод / решение и допущения}
- {поле_4: доказательства и результаты, с цифрами}
- {поле_5: ограничения, названные самими авторами}

Правила:
- Третье лицо, нейтральный язык, приписывай утверждения авторам.
- Без оценок, эмоций и выводов о значимости.
- Цифры, формулы, таблицы переноси как есть (таблицы перепиши текстом).
- Что не нашёл или не смог прочитать — пометь «не указано», не додумывай.

Текст:
{текст}

Запрос 2 — оценка записи (новый чат, оригинала нет):

Ты {роль_эксперта}. Ниже запись материала. Оригинала у тебя нет.
Объясню структуру: {что_лежит_в_каждом_разделе}.
Свяжи проблему и утверждения с методом и доказательствами:
подтверждают ли результаты то, что заявлено?
Прямо отмеченное «не указано» — отсутствие подтверждения.
Неясность из-за извлечения — не слабость самого материала.

Критерии и шкала: {критерии_и_шкала}
Выдай: резюме, сильные стороны, слабые стороны, вопросы, общий балл.

Запись:
{запись}

Запрос 3 — оценка полного текста (параллельно):

Ты {роль_эксперта}. Оцени материал строго: высокий порог по доказательствам.
Критерии и шкала: {критерии_и_шкала}
Выдай: резюме, сильные стороны, слабые стороны, вопросы, общий балл.

Текст:
{текст}

Итог: (балл_запроса_2 + балл_запроса_3) / 2

Подставляйте: поля для записи под ваш тип материала; роль эксперта; критерии и шкалу (те же в запросах 2 и 3); сам текст.

🚀 Быстрый старт — вставь в чат:

Вот шаблон SciCore (оценка через нейтральную запись фактов + полная оценка).
Адаптируй под мою задачу: [что ты оцениваешь: заявки, резюме, питчи, тендерные предложения].
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, что за материалы вы оцениваете, по каким критериям и какая шкала. Это нужно, чтобы подобрать поля для записи фактов и критерии оценки, одинаковые в обеих ветках. Она возьмёт паттерн из шаблона и соберёт три готовых промпта под вашу задачу.

⚠️

Ограничения

⚠️ Проверено на научных статьях: Тестировали рецензирование рукописей. Перенос на питчи, резюме и заявки логичен, но авторами не проверялся.

⚠️ Одна основная модель: Главное сравнение SciCore сделано на одной модели (GPT-5.5). На других моделях выигрыш не гарантирован.

⚠️ Извлечение — приближение: Запись фактов делает та же LLM. Она может потерять важное, исказить или пронести часть тона. Устойчивость второй ветки нужно проверять, а не предполагать.

⚠️ Не лучший по всем метрикам: SciCore выигрывает по устойчивости с сохранением различимости работ. Наименьший разброс баллов у него не самый низкий, а по согласию с людьми он уступает строгому протоколу GPT-5.5 по корреляции рангов.

⚠️ Дороже и сложнее: Вместо одного запроса — три плюс усреднение.

⚠️ Подача иногда важна: Если ясность и качество изложения — часть критерия, нейтрализация подачи вредит. Метод для оценки сути.

⚠️ Неполный источник: В доступной части нет раздела разбора компонентов и сравнения с вариантом «восстановить текст из записи». Выводы об этом сделать нельзя.

🔍

Как исследовали

Исследователи взяли 60 заявок на конференцию ICLR 2026, по 10 из шести диапазонов человеческих оценок, чтобы покрыть и сильные, и слабые работы. Каждую заявку переписали 10 способами: мягче или жёстче по новизне, другая подача доказательств, другой технический регистр, несколько раундов правок, правка по отзыву ревьюера. Переписывали два разных LLM (GPT-5.5 и Claude Opus 4.8). Смысл должен был остаться прежним. Получилось 1260 версий. Затем проверили 30 конфигураций ревьюеров: восемь общих моделей в трёх режимах, три специализированные и три агентные системы.

Измеряли две вещи сразу: насколько балл прыгает при переписывании одной работы и насколько различаются баллы разных работ. Нужны обе, иначе «всем семёрка» выглядит идеальной стабильностью.

Удивили три вещи. Во-первых, модель Gemini Flash-Lite показала самый маленький разброс (0,205), но её способность различать работы почти на уровне случайности (0,511). Во-вторых, повторяемая инструкция «оценивай суть» (режим Persistent) улучшила все пять метрик устойчивости только у GPT-5.5. В-третьих, согласие с людьми и устойчивость к формулировкам оказались разными качествами: лучший по первому режим не лучший по второму. SciCore получил ICC 0,775 против 0,615 у лучшего одиночного ревьюера и различимость 0,726 против 0,649, а по согласию с людьми остался на уровне лидеров.

Вывод для практики: уговоры в промпте дают нестабильный эффект, а изменение того, что именно видит оценщик, — стабильнее. «Хорошо ли судья совпадает с людьми» и «не ведётся ли он на красивые слова» нужно проверять отдельно.

💡

Адаптации и экстраполяции

🔧 Техника: проверка вашего LLM-судьи на «ложную устойчивость» → понимаете, можно ли ему доверять

Возьмите 5 реальных работ разного качества, например 5 ответов поддержки или 5 текстов подрядчиков. Попросите LLM переписать каждую в двух стилях: пафосный и сухой, со всеми фактами и цифрами. Прогоните оценщика на всех 15 версиях и посмотрите два показателя: 1. Прыгает ли балл внутри одной работы между стилями. 2. Различаются ли баллы между пятью разными работами.

Хороший судья — тот, у кого балл внутри работы стабилен, а между работами разный. Если у всех 7±0,3, это ложная устойчивость.

Экстраполяция: комбинация с шаблоном записи для разных ролей

Из тендерного предложения подрядчика извлеки нейтральную запись:
цена в рублях, сроки, состав работ, гарантии, кейсы с цифрами,
допущения и риски, названные самим подрядчиком.
Третье лицо, без рекламных слов, цифры как в оригинале,
отсутствующее пометь «не указано».
Затем в новом чате оцени запись по критериям: цена, сроки, полнота, надёжность.

Это перенос идеи на выбор подрядчика. Сама статья этого не проверяла.

🔗

Ресурсы

  • Статья: A Missing Piece for Trustworthy AI Reviewers: From Benchmarking Rhetorical Robustness to SciCore Review
  • Код и данные: https://github.com/c-steve-wang/Robust_Review
  • Авторы: Chenguang Wang, Ming Li, Chengrui Fan, Jianpeng Chen, Han Chen, Tianyi Zhou, Dawei Zhou
  • Организации: Virginia Tech, University of Maryland, MBZUAI

📋 Дайджест исследования

Ключевая суть

Проблема: две заявки с одинаковыми цифрами получают разный балл, если одну написали как «революционную экосистему», а другую как сухой отчёт. Просьба «оценивай суть, а не стиль» тоже подводит: на одной модели улучшились все пять метрик, на другой часть ухудшилась. Метод SciCore позволяет оценивать заявки, резюме и питчи так, чтобы красивая подача не влияла на балл. Фишка: не проси модель забыть красивые слова, а убери их до оценки. Одним запросом ты переписываешь текст в нейтральную запись фактов, вторым оцениваешь только её, а потом усредняешь с обычной оценкой полного текста.

Принцип работы

Работает как конвейер из трёх станков, а не один мастер, который делает всё сразу. 1. Извлечение. Модель переписывает текст: третье лицо, без оценок и эмоций. Цифры остаются, непонятное помечается «не указано». 2. Оценка записи. Новый чат, оригинала нет. Оценщик видит только факты и проверяет, подтверждают ли доказательства заявленное. 3. Оценка полного текста. Параллельно идёт строгая оценка оригинала по тем же критериям. 4. Итог. Среднее двух баллов. Красивая упаковка не доходит до оценщика, потому что её убрали заранее, а не потому что его попросили не обращать на неё внимания. Ветка с полным текстом подстраховывает: если извлечение что-то потеряло, контекст остаётся.

Почему работает

Если дать модели полный текст и написать «игнорируй риторику», она всё равно читает всю упаковку. Тон, структура и громкие слова остаются во входе и влияют на ответ. Поэтому уговоры работают нестабильно. Переписывать текст в заданную форму модель умеет хорошо. Выдернуть факты, сделать тон нейтральным и разложить по полям проще, чем читать и одновременно «не поддаваться». Задачу «не поддавайся тону» заменили на задачу «перепиши в нейтральную форму», с которой модель справляется надёжнее. Есть и вторая ловушка, «ложная устойчивость». Модель, которая всем ставит почти одинаковый балл, выглядит стабильной. Но отличать сильное от слабого она уже не умеет. SciCore держит баллы устойчивыми и при этом сохраняет разницу между работами.

Когда применять

Отбор заявок, резюме, питчей и тендерных предложений → особенно когда в тексте есть проверяемые факты, утверждения и цифры, а авторы пишут с разной степенью пафоса. Оригинальная проверка проводилась на рецензировании научных статей. Перенос на заявки и резюме логичен, но авторы его не проверяли. НЕ подходит, если ясность и качество изложения входят в критерий: нейтрализация подачи тогда вредит. Метод дороже обычного: три запроса вместо одного. Главное сравнение сделано на одной модели, поэтому на своих данных проверь сам. По согласию с оценками людей метод уступает строгому протоколу одной модели.

Мини-рецепт

1. Выбери поля записи. Под твою задачу. Для питча это проблема, решение, метрики, доказательства, риски. Для резюме это опыт и результаты.
2. Запусти извлечение. Третье лицо, без оценок, цифры как в оригинале. Чего нет, помечай «не указано», ничего не додумывай.
3. Открой новый чат. Вставь туда только запись. Оригинала у оценщика быть не должно.
4. Объясни структуру записи. Скажи, что лежит в каждом разделе. Прямо отмеченное «не указано» считается отсутствием подтверждения. Нечитаемость из-за извлечения слабостью не считается.
5. Оцени полный текст параллельно. Те же критерии и та же шкала, но строго: высокий порог по доказательствам.
6. Усредни. Сложи два общих балла и раздели на два. Веса 50/50 в статье не подбирали. Менять их стоит только после проверки на своих данных.
7. Лень писать промпты? Вставь шаблон в чат и попроси адаптировать под задачу. Модель сама задаст вопросы про критерии и шкалу.

Примеры

[ПЛОХО]: `Оцени заявку от 1 до 10. Не обращай внимания на стиль, оценивай только суть.` [ХОРОШО] (запрос 1, извлечение): `Ты готовишь нейтральную запись заявки для эксперта акселератора. Извлеки: проблему, решение, утверждения авторов, рынок, метрики и цифры, доказательства (клиенты, пилоты, выручка), риски, названные самими авторами. Правила: третье лицо, «авторы утверждают…». Без оценок и рекламных слов. Все цифры сохрани как в оригинале. Чего нет в тексте, пиши «в заявке не указано», ничего не додумывай. Текст заявки: [вставить заявку]` [ХОРОШО] (запрос 2, новый чат): `Ты эксперт акселератора. Ниже запись заявки, оригинала у тебя нет. Проверь, подтверждают ли доказательства и цифры заявленные утверждения. «Не указано» считай отсутствием подтверждения. Критерии по 1–10: рынок, команда, продукт, подтверждённый рост, риски. Дай резюме, сильные и слабые стороны, вопросы к авторам и общий балл. Запись: [вставить результат запроса 1]` [ХОРОШО] (запрос 3, параллельно): `Ты эксперт акселератора. Оцени заявку строго, высокий порог по доказательствам. Те же критерии, та же шкала. Дай резюме, сильные и слабые стороны, вопросы и общий балл. Текст: [вставить заявку]` Итог: `(балл из запроса 2 + балл из запроса 3) / 2`. Два фаундера описали одну компанию: 40 клиентов, 3 млн ₽ выручки в месяц, отток 8%. Один написал «революционная экосистема», другой сухо. После извлечения обе записи выглядят почти одинаково, и пафос на балл не влияет.
Источник: A Missing Piece for Trustworthy AI Reviewers: From Benchmarking Rhetorical Robustness to SciCore Review
ArXiv ID: 2609.39027 | Сгенерировано: 2026-10-06 09:20

Проблемы LLM

ПроблемаСутьКак обойти
Оценка зависит от подачи, а не от сути. Просьба «не поддавайся» не спасаетПросишь модель оценить заявку, резюме или текст. Два материала с одинаковыми фактами получают разные баллы. Хвалебный тон и громкие слова поднимают балл. Сухая подача его снижает. Фраза «оценивай суть, а не стиль» помогает нестабильно. На одних данных лучше, на других хуже. Упаковка остаётся во входе и продолжает влиятьУбери упаковку до оценки. Сначала пусть модель перепишет текст в сухую запись фактов. Потом оценивай только запись (см. метод ниже)
Модель выглядит устойчивой, но перестала различать сильное и слабоеТы борешься с влиянием стиля жёсткими инструкциями. Модель начинает ставить всем почти одинаковый балл. Разброс между вариантами маленький, кажется, что всё стабильно. Но сильную и слабую работу она уже не отличает. Оценка бесполезнаПроверяй не только стабильность, но и различимость. Возьми заведомо сильный и заведомо слабый материал. Убедись, что баллы заметно расходятся. Если нет, защита «задушила» оценку

Методы

МетодСуть
Сначала факты, потом оценка — убирает влияние подачиЧто делать: три отдельных запроса. Запрос 1: «Извлеки из текста проблему, утверждения, метод, доказательства с цифрами, ограничения. Пиши в третьем лице. Не оценивай. Убери эмоции и рекламу. Цифры сохрани. Чего нет — пиши "не указано", не додумывай». Запрос 2 (новый чат): дай модели только запись, без оригинала. Попроси оценить по критериям и шкале. Объясни структуру записи. Скажи: «"Не указано" — это отсутствие подтверждения. Неясность из-за извлечения — не слабость материала». Запрос 3 (параллельно): оценка полного текста по тем же критериям, со строгим порогом по доказательствам. Итог: (балл_2 + балл_3) / 2. Почему работает: модель хорошо переписывает текст в заданную форму. Это проще, чем читать красивый текст и при этом не поддаваться. Упаковка просто не доходит до оценщика. Полная оценка возвращает контекст, который мог потеряться при извлечении. Настройка: поля записи подбирай под задачу (для питча — метрики и клиенты, для резюме — опыт и результаты). Критерии в запросах 2 и 3 держи одинаковыми. Веса 50/50 меняй только после проверки на своих данных. Работает: в тексте есть проверяемые факты, утверждения и цифры, а оценка нужна по сути. Не работает: ясность и качество изложения входят в критерии. Тогда нейтрализация подачи вредит. Цена: три запроса вместо одного. Запись делает та же модель, она может исказить или потерять важное

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с