TL;DR
SciCore — двухветочная схема для LLM-судьи. Первая ветка оценивает текст целиком. Вторая сначала просит модель вытащить из текста сухую запись фактов: проблема, утверждения, метод, доказательства, результаты, ограничения. Затем в новом запросе оценивает только эту запись, оригинала в нём нет. Итоговый балл — среднее двух оценок.
Главная боль: один и тот же смысл, поданный другими словами, получает разные баллы. Хвалебный тон, громкие слова и другая структура поднимают оценку, сухая подача — опускает. Очевидное лекарство — дописать в промпт «оценивай суть, а не стиль» и повторить это несколько раз. Оно работает нестабильно: на одной модели из пяти метрик улучшились все, на другой часть ухудшилась. Есть и вторая ловушка — «ложная устойчивость». Модель, которая всем ставит почти одинаковый балл, выглядит стабильной, но отличать сильное от слабого она перестала.
Метод обходит проблему структурой, а не уговорами. Шаг 1: модель переписывает текст в нейтральную запись фактов, третье лицо, без оценок и эмоций, с сохранением цифр и с пометкой «не удалось прочитать». Шаг 2: оценщик видит только эту запись. Красивая упаковка до него не доходит. Шаг 3: усредняем с обычной оценкой полного текста.
Схема метода
ШАГ 1 (запрос 1): полный текст → структурированная запись фактов
(третье лицо, без оценок, цифры сохранены, неясное помечено)
ШАГ 2 (запрос 2, новый чат): ТОЛЬКО запись фактов → оценка по критериям
ШАГ 3 (запрос 3, параллельно): полный текст → строгая оценка по тем же критериям
ШАГ 4: итог = (оценка шага 2 + оценка шага 3) / 2
Шаги 2 и 3 независимы друг от друга. Шаг 1 нужен только для шага 2. Это отдельные запросы, лучше в разных чатах.
Пример применения
Задача: Вы отбираете заявки в акселератор вроде ФРИИ или «Сколково». Два фаундера описали одну и ту же сервисную компанию: 40 клиентов, выручка 3 млн ₽ в месяц, отток 8%. Первый пишет «революционная экосистема, которая перевернёт рынок». Второй — сухо, как в отчёте. LLM-судья без защиты поставит первому балл выше. Это сильная зона метода: в тексте есть проверяемые факты, утверждения и цифры.
Промпт (запрос 1 — извлечение):
Ты готовишь нейтральную запись заявки для эксперта акселератора.
Из текста заявки ниже извлеки: проблему, решение, утверждения авторов,
рынок и аудиторию, метрики и цифры, доказательства (клиенты, пилоты, выручка),
ограничения и риски, которые авторы назвали сами.
Правила:
- Пиши в третьем лице, нейтрально: «авторы утверждают…», «заявлено…».
- Не оценивай, не хвали, не критикуй. Не решай, убедительно ли это.
- Убери эмоциональные и рекламные формулировки, оставь суть.
- Сохрани все цифры и названия как в оригинале.
- Если чего-то нет в тексте или оно не читается, напиши «в заявке не указано».
Ничего не додумывай.
Текст заявки:
[вставить заявку]
Промпт (запрос 2 — оценка записи, новый чат):
Ты эксперт акселератора. Ниже — структурированная запись заявки.
Оригинала у тебя нет, оценивай только запись.
Свяжи разделы между собой: проверь, подтверждают ли доказательства и цифры
заявленные утверждения. То, что в записи прямо отмечено как «не указано»,
считай отсутствующим подтверждением. Пометки о нечитаемости не засчитывай
как слабость заявки.
Критерии (по 1–10): рынок, команда, продукт, тракшн, риски.
Дай краткое резюме, сильные стороны, слабые стороны, вопросы к авторам
и общий балл 1–10.
Запись заявки:
[вставить результат запроса 1]
Результат: Из запроса 1 придёт сухая запись фактов без «революционной экосистемы». Из запроса 2 — оценка по критериям с сильными и слабыми сторонами и общим баллом. Затем вы отдельно просите строгую оценку полной заявки по тем же критериям и усредняете два общих балла.
Почему это работает
Слабость. Если дать модели полный текст и написать «игнорируй риторику», она всё равно читает всю упаковку. Тон, структура и громкие слова остаются во входе и влияют на ответ. Инструкция «не поддавайся» с этим не справляется, поэтому результат нестабилен.
Сильная сторона. Модель хорошо переписывает текст в заданную форму: выдёргивает факты, переводит в нейтральный тон, раскладывает по полям. Перенести факты проще и надёжнее, чем при чтении одновременно «не поддаваться» тону.
Как метод это использует. Он убирает упаковку до оценки, а не просит о ней забыть. Усреднение с полным чтением сохраняет контекст, который извлечение могло потерять. Если запись плохая, вторая ветка подстрахует.
Рычаги управления: - Что извлекаем → список полей под вашу задачу (для питча — тракшн и юнит-экономика, для резюме — опыт и результаты). - «Не указано» → чем строже правило не додумывать, тем меньше выдуманных фактов в записи. - Протокол полной ветки → в статье это строгий рубрикатор. Можно усилить требования к доказательствам. - Веса при усреднении → в статье 50/50 без подбора. Менять веса стоит только после проверки на ваших данных.
Шаблон промпта
Запрос 1 — извлечение:
Ты готовишь нейтральную запись материала для эксперта.
Извлеки из текста ниже:
- {поле_1: проблема / цель}
- {поле_2: утверждения и заявленный вклад авторов}
- {поле_3: метод / решение и допущения}
- {поле_4: доказательства и результаты, с цифрами}
- {поле_5: ограничения, названные самими авторами}
Правила:
- Третье лицо, нейтральный язык, приписывай утверждения авторам.
- Без оценок, эмоций и выводов о значимости.
- Цифры, формулы, таблицы переноси как есть (таблицы перепиши текстом).
- Что не нашёл или не смог прочитать — пометь «не указано», не додумывай.
Текст:
{текст}
Запрос 2 — оценка записи (новый чат, оригинала нет):
Ты {роль_эксперта}. Ниже запись материала. Оригинала у тебя нет.
Объясню структуру: {что_лежит_в_каждом_разделе}.
Свяжи проблему и утверждения с методом и доказательствами:
подтверждают ли результаты то, что заявлено?
Прямо отмеченное «не указано» — отсутствие подтверждения.
Неясность из-за извлечения — не слабость самого материала.
Критерии и шкала: {критерии_и_шкала}
Выдай: резюме, сильные стороны, слабые стороны, вопросы, общий балл.
Запись:
{запись}
Запрос 3 — оценка полного текста (параллельно):
Ты {роль_эксперта}. Оцени материал строго: высокий порог по доказательствам.
Критерии и шкала: {критерии_и_шкала}
Выдай: резюме, сильные стороны, слабые стороны, вопросы, общий балл.
Текст:
{текст}
Итог: (балл_запроса_2 + балл_запроса_3) / 2
Подставляйте: поля для записи под ваш тип материала; роль эксперта; критерии и шкалу (те же в запросах 2 и 3); сам текст.
🚀 Быстрый старт — вставь в чат:
Вот шаблон SciCore (оценка через нейтральную запись фактов + полная оценка).
Адаптируй под мою задачу: [что ты оцениваешь: заявки, резюме, питчи, тендерные предложения].
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, что за материалы вы оцениваете, по каким критериям и какая шкала. Это нужно, чтобы подобрать поля для записи фактов и критерии оценки, одинаковые в обеих ветках. Она возьмёт паттерн из шаблона и соберёт три готовых промпта под вашу задачу.
Ограничения
⚠️ Проверено на научных статьях: Тестировали рецензирование рукописей. Перенос на питчи, резюме и заявки логичен, но авторами не проверялся.
⚠️ Одна основная модель: Главное сравнение SciCore сделано на одной модели (GPT-5.5). На других моделях выигрыш не гарантирован.
⚠️ Извлечение — приближение: Запись фактов делает та же LLM. Она может потерять важное, исказить или пронести часть тона. Устойчивость второй ветки нужно проверять, а не предполагать.
⚠️ Не лучший по всем метрикам: SciCore выигрывает по устойчивости с сохранением различимости работ. Наименьший разброс баллов у него не самый низкий, а по согласию с людьми он уступает строгому протоколу GPT-5.5 по корреляции рангов.
⚠️ Дороже и сложнее: Вместо одного запроса — три плюс усреднение.
⚠️ Подача иногда важна: Если ясность и качество изложения — часть критерия, нейтрализация подачи вредит. Метод для оценки сути.
⚠️ Неполный источник: В доступной части нет раздела разбора компонентов и сравнения с вариантом «восстановить текст из записи». Выводы об этом сделать нельзя.
Как исследовали
Исследователи взяли 60 заявок на конференцию ICLR 2026, по 10 из шести диапазонов человеческих оценок, чтобы покрыть и сильные, и слабые работы. Каждую заявку переписали 10 способами: мягче или жёстче по новизне, другая подача доказательств, другой технический регистр, несколько раундов правок, правка по отзыву ревьюера. Переписывали два разных LLM (GPT-5.5 и Claude Opus 4.8). Смысл должен был остаться прежним. Получилось 1260 версий. Затем проверили 30 конфигураций ревьюеров: восемь общих моделей в трёх режимах, три специализированные и три агентные системы.
Измеряли две вещи сразу: насколько балл прыгает при переписывании одной работы и насколько различаются баллы разных работ. Нужны обе, иначе «всем семёрка» выглядит идеальной стабильностью.
Удивили три вещи. Во-первых, модель Gemini Flash-Lite показала самый маленький разброс (0,205), но её способность различать работы почти на уровне случайности (0,511). Во-вторых, повторяемая инструкция «оценивай суть» (режим Persistent) улучшила все пять метрик устойчивости только у GPT-5.5. В-третьих, согласие с людьми и устойчивость к формулировкам оказались разными качествами: лучший по первому режим не лучший по второму. SciCore получил ICC 0,775 против 0,615 у лучшего одиночного ревьюера и различимость 0,726 против 0,649, а по согласию с людьми остался на уровне лидеров.
Вывод для практики: уговоры в промпте дают нестабильный эффект, а изменение того, что именно видит оценщик, — стабильнее. «Хорошо ли судья совпадает с людьми» и «не ведётся ли он на красивые слова» нужно проверять отдельно.
Адаптации и экстраполяции
🔧 Техника: проверка вашего LLM-судьи на «ложную устойчивость» → понимаете, можно ли ему доверять
Возьмите 5 реальных работ разного качества, например 5 ответов поддержки или 5 текстов подрядчиков. Попросите LLM переписать каждую в двух стилях: пафосный и сухой, со всеми фактами и цифрами. Прогоните оценщика на всех 15 версиях и посмотрите два показателя: 1. Прыгает ли балл внутри одной работы между стилями. 2. Различаются ли баллы между пятью разными работами.
Хороший судья — тот, у кого балл внутри работы стабилен, а между работами разный. Если у всех 7±0,3, это ложная устойчивость.
Экстраполяция: комбинация с шаблоном записи для разных ролей
Из тендерного предложения подрядчика извлеки нейтральную запись:
цена в рублях, сроки, состав работ, гарантии, кейсы с цифрами,
допущения и риски, названные самим подрядчиком.
Третье лицо, без рекламных слов, цифры как в оригинале,
отсутствующее пометь «не указано».
Затем в новом чате оцени запись по критериям: цена, сроки, полнота, надёжность.
Это перенос идеи на выбор подрядчика. Сама статья этого не проверяла.
Ресурсы
- Статья: A Missing Piece for Trustworthy AI Reviewers: From Benchmarking Rhetorical Robustness to SciCore Review
- Код и данные: https://github.com/c-steve-wang/Robust_Review
- Авторы: Chenguang Wang, Ming Li, Chengrui Fan, Jianpeng Chen, Han Chen, Tianyi Zhou, Dawei Zhou
- Организации: Virginia Tech, University of Maryland, MBZUAI
