3,583 papers
arXiv:2607.25965 80 28 июля 2026 г. FREE

Многократная оценка с усреднением: как заставить ChatGPT надёжно ранжировать тексты по качеству

КЛЮЧЕВАЯ СУТЬ
Парадокс: два живых профессора-рецензента, оценивая одну статью, соглашаются друг с другом реже, чем каждый из них — с ChatGPT. Метод многократной оценки позволяет ранжировать тексты по качеству так же надёжно, как экспертная комиссия. Иногда даже точнее. Фишка — не верить единичному баллу: спроси модель 5-6 раз с разной формулировкой, усредни числа, сравнивай ранг, а не сам балл. Точность ранжирования сравнима с человеком-экспертом, хотя один запрос выдаёт почти случайное число.
Адаптировать под запрос

Если попросить ChatGPT оценить текст одним числом от 1 до 10 — оценка почти случайна и жмётся к середине. Но если попросить оценить несколько раз с разной формулировкой вопроса, усреднить баллы и сравнить ранги между текстами — точность ранжирования становится сравнимой с оценкой живого эксперта, а иногда и выше.

Исследователи сравнили, как ChatGPT-5.4 и реальные рецензенты (профессора университета Шеффилда) оценивают научные статьи по внутренним рейтингам для государственной оценки качества исследований (аналог российской ВАК-аттестации, но серьёзнее — от неё зависит финансирование вуза). Оказалось: два разных живых рецензента соглашаются друг с другом слабее, чем каждый из них соглашается с ChatGPT. То есть один человек-эксперт — не золотой стандарт, как принято думать: субъективность экспертов выше, чем кажется.

Метод простой: задать модели один и тот же вопрос про качество текста 5-6 раз с чуть разными формулировками, попросить обосновать оценку перед тем как назвать число, усреднить все ответы — и использовать не сам балл, а порядок (ранг) текстов относительно друг друга.

🔬

Схема метода

ШАГ 1 (один промпт): Задать структуру оценки — обоснование по каждому критерию → потом балл по критерию → итоговое обоснование → итоговый балл
ШАГ 2 (5-6 отдельных запросов): Повторить тот же промпт, каждый раз чуть изменив формулировку первого предложения ("Оцени..." / "Дай оценку..." / "Оцени текст в диапазоне...")
ШАГ 3 (вручную или попросить LLM посчитать): Усреднить итоговые баллы по каждому тексту
ШАГ 4: Отранжировать тексты по среднему баллу — доверять порядку, не самому числу

🚀

Пример применения

Задача: Вы организуете отбор заявок в бизнес-акселератор (по типу ФРИИ или Сколково) — 8 текстовых питчей стартапов, и нужно объективно ранжировать их по качеству идеи, а не доверять одному быстрому прочтению.

Промпт (повторить 5-6 раз с вариациями первой строки):

Оцени эту заявку стартапа по шкале от 1 до 4, дробные значения допустимы (например, 2.5, 3.25).
Используй такой формат ответа:

Оценка идеи (оригинальность, решает ли реальную проблему):
Балл за идею:
Оценка реализуемости (команда, ресурсы, план):
Балл за реализуемость:
Оценка рыночного потенциала (размер рынка, конкуренты):
Балл за рынок:
Итоговое заключение:
Итоговый балл:

Заявка:
{текст_заявки}

Варианты первой строки для повторов: "Дай оценку этой заявке от 1 до 4" / "Оцени заявку в диапазоне от 1 до 4" / "Оцени заявку стартапа от 1 до 4, включая дробные значения".

Результат: На каждый запуск ChatGPT выдаст текстовое обоснование по трём критериям и итоговый балл. Отдельные баллы будут скакать (то 3.0, то 3.5, то 2.75) — это нормально, единичная оценка ненадёжна. После 5-6 повторов на каждую заявку вы получите 5-6 чисел, усредните их — и ранжирование заявок по среднему баллу окажется куда устойчивее, чем ранжирование по одной оценке.


🧠

Почему это работает

Одна оценка LLM — шумный сигнал: модель склонна давать баллы около середины шкалы и редко ставит крайние значения, поэтому единичный балл почти не отражает реальное качество. Это похоже на то, как один человек, быстро пробежав текст глазами, может ошибиться — только у модели эта ошибка происходит систематически при каждом запросе.

Зато у модели есть слабая, но стабильная склонность немного повышать балл лучшим текстам и немного понижать слабым — сигнал есть, просто он тонет в шуме. Если повторить оценку много раз с разными формулировками вопроса, шум частично гасится, а слабый, но настоящий сигнал накапливается — как в опросах, где мнение толпы точнее мнения одного человека.

Рычаги управления: - Число повторов (в исследовании — 30: 5 формулировок × 6 повторов) → для простых задач хватит 3-5 повторов, экономия времени - Просьба обосновать балл перед тем как назвать число → структурирует рассуждение модели, повышает точность (это лёгкий вариант chain-of-thought) - Критерии оценки (rigour/originality/significance в оригинале) → замените на свои: идея/команда/рынок для питчей, структура/аргументация/язык для текстов


📋

Шаблон промпта

Оцени этот {тип_текста} по шкале от 1 до {макс_балл}, дробные значения допустимы.
Используй такой формат ответа:

Оценка по критерию "{критерий_1}":
Балл по критерию "{критерий_1}":
Оценка по критерию "{критерий_2}":
Балл по критерию "{критерий_2}":
Оценка по критерию "{критерий_3}":
Балл по критерию "{критерий_3}":
Итоговое заключение:
Итоговый балл:

Текст:
{текст}

Подставь в {тип_текста} — что оцениваешь (заявка, резюме, статья, слоган), в {критерий_1-3} — свои критерии качества, в {текст} — сам контент. Повтори запрос 5-6 раз, каждый раз слегка меняя формулировку первой строки.

🚀 Быстрый старт — вставь в чат:

Вот шаблон для надёжной оценки качества текстов через многократный запрос. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит какие критерии важны для твоей задачи и сколько текстов сравниваешь — потому что метод работает только при сравнении нескольких текстов между собой, а критерии должны отражать именно твою область, а не научные "rigour/originality".


⚠️

Ограничения

⚠️ Абсолютному баллу не верь: даже после усреднения число "3.2 из 4" не означает то же самое, что оценка "3.2" от человека — это просто позиция в рейтинге, не объективная мера качества.

⚠️ Больше информации — не значит точнее: полный документ с картинками и таблицами не улучшает ранжирование по сравнению с одним заголовком и кратким описанием. Модель формально "читает" картинки в PDF, но почти не использует эту информацию при оценке.

⚠️ Работает только для сравнения, не для оценки в одиночку: метод даёт надёжный результат, когда есть несколько текстов для ранжирования. Оценивать один текст без сравнения этим способом бессмысленно.

⚠️ Точность умеренная, не идеальная: даже лучший результат ChatGPT совпадает с экспертной оценкой не полностью. Для критичных решений (гранты, публикации, увольнения) метод — подсказка, не замена человеческого решения.


🔍

Как исследовали

Исследователи добыли конфиденциальные внутренние рейтинги университета Шеффилда — так называемые mini-REF оценки, которые профессора ставят статьям коллег перед национальной оценкой качества исследований в Британии (от неё зависит финансирование вуза). Это заняло 18 месяцев переговоров, потому что данные чувствительные и влияют на карьеры. Собрали три набора: 98 статей по медицинским наукам (с оценками от двух отдельных рецензентов), 44 по архитектуре и 58 по медиаисследованиям (только согласованные командные оценки).

Ключевой трюк: раз для медицинских статей были оценки от двух разных людей, можно сравнить, насколько люди согласны друг с другом — и сравнить это с тем, насколько ChatGPT согласен с каждым из них. Результат удивил: два живых рецензента соглашались друг с другом слабее (корреляция около 0.13-0.20), чем каждый из них соглашался с ChatGPT-5.4 (около 0.25-0.32). Разница статистически не значима из-за небольшой выборки, но направление чёткое.

Второй сюрприз: подача модели полного PDF со всеми картинками и таблицами почти не изменила ранжирование по сравнению с одним заголовком и аннотацией — значит, модель либо игнорирует визуальную информацию, либо не использует её для оценки качества.


💡

Адаптации и экстраполяции

🔧 Техника: замена критериев оценки → любая область применения

Оригинал использует критерии науки (rigour/originality/significance). Замени на свои: - Для резюме: релевантный опыт / достижения с цифрами / соответствие вакансии - Для маркетингового текста: цепкость заголовка / ясность оффера / призыв к действию - Для бизнес-плана: идея / команда / финансовая модель

Логика метода (повтор + усреднение + ранг) остаётся неизменной — меняются только критерии внутри структуры промпта.


🔗

Ресурсы

Thelwall, M., & Ali, P. Is ChatGPT as reliable as individual reviewers assessing the quality of published journal articles from PDFs or titles and abstracts? University of Sheffield. Связанные работы: Thelwall, M. (2026b) — сравнение версий ChatGPT-5 для оценки статей; Sandstrom & Thelwall (2026) — аналогичное сравнение для грантовых заявок.


📋 Дайджест исследования

Ключевая суть

Парадокс: два живых профессора-рецензента, оценивая одну статью, соглашаются друг с другом реже, чем каждый из них — с ChatGPT. Метод многократной оценки позволяет ранжировать тексты по качеству так же надёжно, как экспертная комиссия. Иногда даже точнее. Фишка — не верить единичному баллу: спроси модель 5-6 раз с разной формулировкой, усредни числа, сравнивай ранг, а не сам балл. Точность ранжирования сравнима с человеком-экспертом, хотя один запрос выдаёт почти случайное число.

Принцип работы

Один запрос к ChatGPT — как один быстрый взгляд человека на текст. Быстро, но ненадёжно. Модель повторяет оценку 5-6 раз с чуть другой первой строкой — «Оцени...» / «Дай оценку...» / «Оцени в диапазоне...». Каждый прогон гасит немного шума, а слабый настоящий сигнал качества накапливается — как в опросе толпы, где среднее мнение точнее одного голоса. В итоге используется не сам балл, а ранг — позиция текста среди остальных.

Почему работает

Одиночная оценка LLM — это шум. Модель жмётся к середине шкалы и почти не ставит крайние баллы. Но у неё есть слабая устойчивая тенденция — чуть повышать балл сильным текстам и чуть понижать слабым. Этот слабый сигнал тонет в шуме одного запроса, но всплывает после усреднения 5-6 попыток. Точность ранжирования становится сравнимой с человеком-экспертом, а иногда и выше.

Когда применять

Сравнение и отбор текстов → конкретно для заявок, питчей, эссе, статей, когда нужно выбрать топ из нескольких кандидатов, а не поставить абсолютную оценку одному тексту. НЕ подходит для критичных решений в одиночку — грантов, публикаций, увольнений, где финальный вердикт должен оставаться за человеком.

Мини-рецепт

1. Задай структуру: обоснование по каждому критерию → балл по критерию → итоговое заключение → итоговый балл.
2. Повтори 5-6 раз: каждый раз меняй первую строку — «Оцени...» / «Дай оценку...» / «Оцени в диапазоне от...».
3. Усредни баллы: вручную или попроси саму модель посчитать среднее по каждому тексту.
4. Ранжируй, не верь баллу: сортируй тексты по среднему числу, но не считай сам балл объективной оценкой.

Примеры

[ПЛОХО] : Оцени эту заявку стартапа по шкале от 1 до 10
[ХОРОШО] : Оцени эту заявку стартапа по шкале от 1 до 4, дробные значения допустимы. Формат: Оценка идеи: / Балл за идею: / Оценка реализуемости: / Балл: / Оценка рынка: / Балл: / Итоговый балл: — повторить с 5-6 разными первыми строками для каждой из 8 заявок, усреднить баллы, ранжировать по среднему числу.
Источник: Is ChatGPT as reliable as individual reviewers assessing the quality of published journal articles from PDFs or titles and abstracts?
ArXiv ID: 2607.25965 | Сгенерировано: 2026-07-29 06:22

Проблемы LLM

ПроблемаСутьКак обойти
Одна оценка модели почти случайна и жмётся к середине шкалыПросишь оценить текст числом от 1 до 10 (или любую другую шкалу) — модель редко ставит крайние баллы. Один и тот же текст при повторном запросе может получить 3, потом 3.5, потом 2.75. Единичный балл почти не отражает реальное качество текстаЗадай один и тот же вопрос 5-6 раз, каждый раз чуть меняя формулировку первой строки промпта. Усредни все полученные баллы. Доверяй не самому числу, а порядку текстов после усреднения (ранжированию)

Методы

МетодСуть
Многократная оценка с усреднением и сравнением по рангуЗадай модели один и тот же вопрос про качество текста 5-6 раз, каждый раз меняя формулировку первого предложения ("Оцени..." / "Дай оценку..." / "Оцени в диапазоне..."). Попроси сначала письменно обосновать оценку по каждому критерию, потом дать число — это заставляет модель рассуждать перед ответом и повышает точность. Усредни итоговые баллы по каждому тексту. Сравнивай тексты по среднему баллу, а не по абсолютному значению. Оценка по критерию X: ... Балл по критерию X: ... Работает: когда сравниваешь несколько текстов между собой (питчи, резюме, статьи, эссе). Не работает: когда оцениваешь один текст без сравнения с другими — тогда усреднённое число всё равно не значит "объективное качество"

Тезисы

ТезисКомментарий
В шумной оценке модели есть слабый, но настоящий сигнал качестваМодель слегка занижает баллы слабым текстам и слегка повышает сильным, но этот сигнал тонет в случайном шуме одной попытки. При многократном повторе с разными формулировками шум гасится, а слабый сигнал накапливается — похоже на то, как усреднённое мнение толпы точнее мнения одного человека. Применяй: не полагайся на один запрос для важного ранжирования, делай 3-5+ повторов и усредняй
После усреднения важен порядок текстов, а не само числоСредний балл 3.2 из 4 — это не мера объективного качества, а просто позиция текста в ряду других оцениваемых текстов. Число сильно зависит от того, что именно ты сравниваешь и какие критерии задал. Применяй: используй усреднённые баллы только чтобы отранжировать тексты друг относительно друга, не как абсолютную оценку для отчётов или сравнения с другими шкалами
📖 Простыми словами

IsChatGPTas reliable as individual reviewers assessing the quality of published journal articles from PDFs or titles and abstracts?

arXiv: 2607.25965

ChatGPT работает не как вдумчивый эксперт, а как уставший чиновник: он не вникает в нюансы, а просто штампует средние оценки. Фундаментальная проблема в том, что одиночный запрос к LLM дает слишком шумный сигнал. Модель боится крайностей и обожает «безопасную середину», поэтому если ты попросишь её оценить статью или питч по шкале от 1 до 10, она почти всегда выдаст что-то в районе шестерки. Это не объективность, а статистическая трусость, из-за которой реальное качество текста тонет в цифровом мусоре.

Это как если бы ты нанял на работу ленивого стажера, который вместо проверки отчетов просто ставит всем «нормально», чтобы от него отстали. Формально работа сделана, но толку от нее ноль, потому что ты не можешь отличить гениальный проект от полной лажи. В итоге единичный балл от AI — это лотерея, где шанс на ошибку выше, чем вероятность получить адекватный вердикт.

Чтобы выжать из модели правду, исследователи применили метод множественных прогонов. Вместо того чтобы спрашивать один раз, они заставляют AI оценивать один и тот же текст десятки раз, а потом усредняют результат. Выяснилось, что агрегированная оценка 20-40 прогонов внезапно становится точнее, чем мнение одного живого рецензента. Магия чисел превращает «галлюцинации» и рандом в стабильный измерительный прибор, который видит качество там, где человек замыленным глазом его пропускает.

Этот принцип — ансамбль одного актера — применим везде, где нужно ранжировать тексты: от отбора заявок в бизнес-акселератор до фильтрации резюме. Тестировали на научных статьях, но схема универсальна: если тебе нужно выбрать 3 лучших стартапа из 100, не верь первому ответу ChatGPT. Заставь его «проголосовать» 30 раз, и среднее арифметическое покажет реальных лидеров. SEO-тексты, питчи, эссе — любая субъективщина превращается в твердые данные через многократный повтор.

Короче: никогда не полагайся на один ответ AI в вопросах оценки качества — это путь к посредственности. Хочешь точности — используй массовый опрос одной модели и считай среднее. Это единственный способ заставить нейронку перестать врать из вежливости и начать выдавать результат, который реально коррелирует с успехом. Либо ты делаешь 30 итераций, либо получаешь рандомный шум вместо аналитики.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с