TL;DR
Исследователи сравнили три способа заставить GPT-4o-mini оценивать открытые студенческие работы по рубрике (как если бы это делал преподаватель): (1) дать примеры уже оценённых работ + попросить объяснить рассуждение по каждому критерию перед баллом (Few-shot + Chain-of-Thought), (2) подложить в промпт справочные материалы по теме (RAG), (3) сгенерировать несколько независимых оценок одного и того же текста и взять медиану (Self-Consistency). Каждая стратегия дала свой устойчивый "почерк" оценивания.
Главная находка: LLM-оценщик не просто "неточен" — он предсказуемо смещён в одну сторону, и направление смещения зависит от того, как построен промпт. Модель с примерами и пошаговым рассуждением систематически занижала баллы (была строже живых преподавателей), модель со справочными материалами систематически завышала (засчитывала упоминание термина, даже если студент применил его неправильно). А модель, усредняющая несколько своих ответов, оценивала стабильно и без явного перекоса в среднем — но по каждой конкретной работе ошибка оставалась большой. Стабильность оценки не равна её точности.
Выбор промпт-стратегии для проверки текстов — это фактически выбор профиля смещения: суровый оценщик, мягкий оценщик или непредсказуемо-нейтральный на уровне отдельного ответа. Комбинация "примеры оценок + рассуждение по каждому критерию перед баллом" дала самое близкое совпадение с мнением людей.
Схема метода (сравнение трёх подходов)
ПОДХОД 1 (Fs+CoT) — один запрос:
Даём 2+ примера уже оценённых работ → просим рассудить по каждому критерию →
модель выдаёт объяснение + баллы
Результат: точнее всего совпадает с человеком, но систематически строже (занижает)
ПОДХОД 2 (RAG) — один запрос:
Подкладываем в контекст справочные материалы/эталонные знания по теме →
модель оценивает с оглядкой на них
Результат: систематически мягче человека (завышает баллы)
ПОДХОД 3 (Self-Consistency) — 5 отдельных запросов:
Просим модель оценить один и тот же текст 5 раз независимо →
берём медиану/среднее из 5 оценок
Результат: очень стабильно от раза к разу, но ошибки на уровне конкретного ответа остаются большими
Пример применения
Задача: Методист онлайн-школы по копирайтингу хочет прогнать 200 домашних работ студентов через ChatGPT, чтобы получить предварительную оценку по рубрике (структура, аргументация, стиль, ошибки) — до того, как работы попадут к живому преподавателю на финальную проверку.
Промпт:
Ты — опытный преподаватель курса копирайтинга. Оцени домашнюю работу студента
по 4 критериям: Структура, Аргументация, Стиль, Грамотность.
Каждый критерий — от 1 до 5 баллов.
Вот два примера уже оценённых работ для калибровки шкалы:
Пример 1:
[текст работы №1]
→ Структура: 4, Аргументация: 3, Стиль: 5, Грамотность: 4
Обоснование: структура чёткая, вступление-тезис-аргументы-вывод, но один
аргумент слабо подкреплён фактами...
Пример 2:
[текст работы №2]
→ Структура: 2, Аргументация: 2, Стиль: 3, Грамотность: 3
Обоснование: логика скачет между абзацами, аргументы декларативные без
доказательств...
Теперь оцени новую работу. Сначала пройдись по каждому критерию отдельно
и объясни своё рассуждение в 2-3 предложениях. Только после этого поставь
итоговый балл по каждому критерию и сумму.
Работа студента: {текст}
Результат: Модель выдаст структурированный разбор — по каждому из 4 критериев короткое рассуждение, затем баллы и сумму. По данным исследования, такая оценка будет ближе всего к оценке живого преподавателя из всех протестированных способов, но с поправкой: модель скорее всего будет немного строже — стоит держать это в уме или явно указать в промпте "не будь излишне строг, ориентируйся на средний уровень группы".
Почему это работает
LLM без структуры выдаёт нестабильную и непредсказуемую оценку — балл может скакать от запуска к запуску, и совпадение с "экспертным" мнением случайно. Модель не имеет внутреннего эталона, что такое "5 баллов за аргументацию" — этот эталон нужно задать явно.
Сильная сторона LLM — она отлично копирует паттерн, если показать примеры (few-shot работает как калибровочная линейка), и хорошо проговаривает рассуждение по шагам, если её попросить (Chain-of-Thought не даёт срезать путь напрямую к баллу, минуя анализ).
Метод использует это так: примеры-якоря задают модели "систему координат" — что значит хорошая и плохая работа, а пошаговое рассуждение по каждому критерию заставляет модель действительно разобрать текст, а не выдать усреднённую интуитивную цифру.
Рычаги управления: - Количество few-shot примеров → больше примеров = точнее калибровка шкалы, но длиннее промпт - Число повторных генераций в Self-Consistency-подходе → больше повторов = стабильнее оценка, но дороже по времени/токенам; для быстрой проверки достаточно 3 повторов и медианы - Инструкция "объясни рассуждение перед баллом" → если убрать, оценка станет быстрее, но менее точной и без видимой логики - Добавление справочных материалов в контекст → делает оценщика мягче; используйте с осторожностью, если важна строгость проверки
Шаблон промпта
Ты — опытный {эксперт в предметной области}. Оцени {тип работы}
по критериям: {критерий_1}, {критерий_2}, {критерий_3}, {критерий_4}.
Каждый критерий — от 1 до {макс_балл} баллов.
Вот примеры уже оценённых работ для калибровки шкалы:
Пример 1:
[{текст примера 1}]
→ {критерий_1}: X, {критерий_2}: X, {критерий_3}: X, {критерий_4}: X
Обоснование: {почему такие баллы}
Пример 2:
[{текст примера 2}]
→ {критерий_1}: X, {критерий_2}: X, {критерий_3}: X, {критерий_4}: X
Обоснование: {почему такие баллы}
Теперь оцени новую работу. Сначала пройдись по каждому критерию отдельно
и объясни рассуждение в 2-3 предложениях. Только после этого поставь
итоговый балл по каждому критерию и сумму.
Работа: {текст для оценки}
Подставляй: тип работы (эссе, код, резюме, коммерческое предложение), критерии рубрики, максимальный балл по шкале, 1-3 примера уже оценённых работ с обоснованием.
🚀 Быстрый старт — вставь в чат:
Вот шаблон промпта для оценки текстов по рубрике с калибровкой на примерах.
Адаптируй под мою задачу: {твоя задача — что именно нужно оценивать}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит про критерии оценки и попросит 1-2 примера уже оценённых текстов — потому что без этих "якорей" модель не знает, какую строгость применять. Она возьмёт паттерн рассуждения из шаблона и подстроит под твою рубрику.
Ограничения
⚠️ Систематическое смещение: промпт с примерами и пошаговым рассуждением делает модель строже человека — она будет занижать баллы. Учитывайте это при калибровке или прямо просите "не будь излишне строг".
⚠️ Справочные материалы смягчают оценку: если подкладываете в промпт эталонные знания или критерии, модель может засчитывать упоминание понятия, даже если оно применено неправильно.
⚠️ Усреднение даёт стабильность, не точность: если сгенерировать несколько оценок и взять среднее — цифра не будет "скакать" от запуска к запуску, но для конкретного человека/текста ошибка может остаться большой. Такой подход годится для агрегированной статистики (средний балл по группе), но не для решений про отдельного человека.
⚠️ Не все критерии оцениваются одинаково точно: в исследовании точность терминологии оценивалась хуже всего во всех трёх подходах, а логика рассуждения — лучше всего. Проверяйте точность модели по каждому критерию рубрики отдельно, не доверяйте общему баллу.
Ресурсы
Lin, B., Jin, L., Min, K.-S. Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses. Sejong University & Ewha Womans University, South Korea.
