Если попросить ChatGPT оценить текст одним числом от 1 до 10 — оценка почти случайна и жмётся к середине. Но если попросить оценить несколько раз с разной формулировкой вопроса, усреднить баллы и сравнить ранги между текстами — точность ранжирования становится сравнимой с оценкой живого эксперта, а иногда и выше.
Исследователи сравнили, как ChatGPT-5.4 и реальные рецензенты (профессора университета Шеффилда) оценивают научные статьи по внутренним рейтингам для государственной оценки качества исследований (аналог российской ВАК-аттестации, но серьёзнее — от неё зависит финансирование вуза). Оказалось: два разных живых рецензента соглашаются друг с другом слабее, чем каждый из них соглашается с ChatGPT. То есть один человек-эксперт — не золотой стандарт, как принято думать: субъективность экспертов выше, чем кажется.
Метод простой: задать модели один и тот же вопрос про качество текста 5-6 раз с чуть разными формулировками, попросить обосновать оценку перед тем как назвать число, усреднить все ответы — и использовать не сам балл, а порядок (ранг) текстов относительно друг друга.
Схема метода
ШАГ 1 (один промпт): Задать структуру оценки — обоснование по каждому критерию → потом балл по критерию → итоговое обоснование → итоговый балл
ШАГ 2 (5-6 отдельных запросов): Повторить тот же промпт, каждый раз чуть изменив формулировку первого предложения ("Оцени..." / "Дай оценку..." / "Оцени текст в диапазоне...")
ШАГ 3 (вручную или попросить LLM посчитать): Усреднить итоговые баллы по каждому тексту
ШАГ 4: Отранжировать тексты по среднему баллу — доверять порядку, не самому числу
Пример применения
Задача: Вы организуете отбор заявок в бизнес-акселератор (по типу ФРИИ или Сколково) — 8 текстовых питчей стартапов, и нужно объективно ранжировать их по качеству идеи, а не доверять одному быстрому прочтению.
Промпт (повторить 5-6 раз с вариациями первой строки):
Оцени эту заявку стартапа по шкале от 1 до 4, дробные значения допустимы (например, 2.5, 3.25).
Используй такой формат ответа:
Оценка идеи (оригинальность, решает ли реальную проблему):
Балл за идею:
Оценка реализуемости (команда, ресурсы, план):
Балл за реализуемость:
Оценка рыночного потенциала (размер рынка, конкуренты):
Балл за рынок:
Итоговое заключение:
Итоговый балл:
Заявка:
{текст_заявки}
Варианты первой строки для повторов: "Дай оценку этой заявке от 1 до 4" / "Оцени заявку в диапазоне от 1 до 4" / "Оцени заявку стартапа от 1 до 4, включая дробные значения".
Результат: На каждый запуск ChatGPT выдаст текстовое обоснование по трём критериям и итоговый балл. Отдельные баллы будут скакать (то 3.0, то 3.5, то 2.75) — это нормально, единичная оценка ненадёжна. После 5-6 повторов на каждую заявку вы получите 5-6 чисел, усредните их — и ранжирование заявок по среднему баллу окажется куда устойчивее, чем ранжирование по одной оценке.
Почему это работает
Одна оценка LLM — шумный сигнал: модель склонна давать баллы около середины шкалы и редко ставит крайние значения, поэтому единичный балл почти не отражает реальное качество. Это похоже на то, как один человек, быстро пробежав текст глазами, может ошибиться — только у модели эта ошибка происходит систематически при каждом запросе.
Зато у модели есть слабая, но стабильная склонность немного повышать балл лучшим текстам и немного понижать слабым — сигнал есть, просто он тонет в шуме. Если повторить оценку много раз с разными формулировками вопроса, шум частично гасится, а слабый, но настоящий сигнал накапливается — как в опросах, где мнение толпы точнее мнения одного человека.
Рычаги управления: - Число повторов (в исследовании — 30: 5 формулировок × 6 повторов) → для простых задач хватит 3-5 повторов, экономия времени - Просьба обосновать балл перед тем как назвать число → структурирует рассуждение модели, повышает точность (это лёгкий вариант chain-of-thought) - Критерии оценки (rigour/originality/significance в оригинале) → замените на свои: идея/команда/рынок для питчей, структура/аргументация/язык для текстов
Шаблон промпта
Оцени этот {тип_текста} по шкале от 1 до {макс_балл}, дробные значения допустимы.
Используй такой формат ответа:
Оценка по критерию "{критерий_1}":
Балл по критерию "{критерий_1}":
Оценка по критерию "{критерий_2}":
Балл по критерию "{критерий_2}":
Оценка по критерию "{критерий_3}":
Балл по критерию "{критерий_3}":
Итоговое заключение:
Итоговый балл:
Текст:
{текст}
Подставь в {тип_текста} — что оцениваешь (заявка, резюме, статья, слоган), в {критерий_1-3} — свои критерии качества, в {текст} — сам контент. Повтори запрос 5-6 раз, каждый раз слегка меняя формулировку первой строки.
🚀 Быстрый старт — вставь в чат:
Вот шаблон для надёжной оценки качества текстов через многократный запрос. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит какие критерии важны для твоей задачи и сколько текстов сравниваешь — потому что метод работает только при сравнении нескольких текстов между собой, а критерии должны отражать именно твою область, а не научные "rigour/originality".
Ограничения
⚠️ Абсолютному баллу не верь: даже после усреднения число "3.2 из 4" не означает то же самое, что оценка "3.2" от человека — это просто позиция в рейтинге, не объективная мера качества.
⚠️ Больше информации — не значит точнее: полный документ с картинками и таблицами не улучшает ранжирование по сравнению с одним заголовком и кратким описанием. Модель формально "читает" картинки в PDF, но почти не использует эту информацию при оценке.
⚠️ Работает только для сравнения, не для оценки в одиночку: метод даёт надёжный результат, когда есть несколько текстов для ранжирования. Оценивать один текст без сравнения этим способом бессмысленно.
⚠️ Точность умеренная, не идеальная: даже лучший результат ChatGPT совпадает с экспертной оценкой не полностью. Для критичных решений (гранты, публикации, увольнения) метод — подсказка, не замена человеческого решения.
Как исследовали
Исследователи добыли конфиденциальные внутренние рейтинги университета Шеффилда — так называемые mini-REF оценки, которые профессора ставят статьям коллег перед национальной оценкой качества исследований в Британии (от неё зависит финансирование вуза). Это заняло 18 месяцев переговоров, потому что данные чувствительные и влияют на карьеры. Собрали три набора: 98 статей по медицинским наукам (с оценками от двух отдельных рецензентов), 44 по архитектуре и 58 по медиаисследованиям (только согласованные командные оценки).
Ключевой трюк: раз для медицинских статей были оценки от двух разных людей, можно сравнить, насколько люди согласны друг с другом — и сравнить это с тем, насколько ChatGPT согласен с каждым из них. Результат удивил: два живых рецензента соглашались друг с другом слабее (корреляция около 0.13-0.20), чем каждый из них соглашался с ChatGPT-5.4 (около 0.25-0.32). Разница статистически не значима из-за небольшой выборки, но направление чёткое.
Второй сюрприз: подача модели полного PDF со всеми картинками и таблицами почти не изменила ранжирование по сравнению с одним заголовком и аннотацией — значит, модель либо игнорирует визуальную информацию, либо не использует её для оценки качества.
Адаптации и экстраполяции
🔧 Техника: замена критериев оценки → любая область применения
Оригинал использует критерии науки (rigour/originality/significance). Замени на свои: - Для резюме: релевантный опыт / достижения с цифрами / соответствие вакансии - Для маркетингового текста: цепкость заголовка / ясность оффера / призыв к действию - Для бизнес-плана: идея / команда / финансовая модель
Логика метода (повтор + усреднение + ранг) остаётся неизменной — меняются только критерии внутри структуры промпта.
Ресурсы
Thelwall, M., & Ali, P. Is ChatGPT as reliable as individual reviewers assessing the quality of published journal articles from PDFs or titles and abstracts? University of Sheffield. Связанные работы: Thelwall, M. (2026b) — сравнение версий ChatGPT-5 для оценки статей; Sandstrom & Thelwall (2026) — аналогичное сравнение для грантовых заявок.
