3,583 papers
arXiv:2608.01783 73 3 авг. 2026 г. FREE

Fs+CoT против RAG против Self-Consistency: как промпт-стратегия делает AI-оценщика строже или мягче человека

КЛЮЧЕВАЯ СУТЬ
Три способа попросить нейросеть оценить студенческую работу — и получаешь трёх разных экзаменаторов. Один занижает баллы, второй завышает, третий стабилен, но может одинаково сильно ошибаться в каждом отдельном случае. Метод позволяет заранее выбрать профиль строгости AI-проверяльщика, а не удивляться непонятным баллам постфактум. Фишка: примеры оценённых работ плюс рассуждение по каждому критерию перед баллом делают модель строже — но именно так она точнее всего совпадает с мнением живого преподавателя.
Адаптировать под запрос

TL;DR

Исследователи сравнили три способа заставить GPT-4o-mini оценивать открытые студенческие работы по рубрике (как если бы это делал преподаватель): (1) дать примеры уже оценённых работ + попросить объяснить рассуждение по каждому критерию перед баллом (Few-shot + Chain-of-Thought), (2) подложить в промпт справочные материалы по теме (RAG), (3) сгенерировать несколько независимых оценок одного и того же текста и взять медиану (Self-Consistency). Каждая стратегия дала свой устойчивый "почерк" оценивания.

Главная находка: LLM-оценщик не просто "неточен" — он предсказуемо смещён в одну сторону, и направление смещения зависит от того, как построен промпт. Модель с примерами и пошаговым рассуждением систематически занижала баллы (была строже живых преподавателей), модель со справочными материалами систематически завышала (засчитывала упоминание термина, даже если студент применил его неправильно). А модель, усредняющая несколько своих ответов, оценивала стабильно и без явного перекоса в среднем — но по каждой конкретной работе ошибка оставалась большой. Стабильность оценки не равна её точности.

Выбор промпт-стратегии для проверки текстов — это фактически выбор профиля смещения: суровый оценщик, мягкий оценщик или непредсказуемо-нейтральный на уровне отдельного ответа. Комбинация "примеры оценок + рассуждение по каждому критерию перед баллом" дала самое близкое совпадение с мнением людей.


🔬

Схема метода (сравнение трёх подходов)

ПОДХОД 1 (Fs+CoT) — один запрос:
Даём 2+ примера уже оценённых работ → просим рассудить по каждому критерию → 
модель выдаёт объяснение + баллы
Результат: точнее всего совпадает с человеком, но систематически строже (занижает)

ПОДХОД 2 (RAG) — один запрос:
Подкладываем в контекст справочные материалы/эталонные знания по теме → 
модель оценивает с оглядкой на них
Результат: систематически мягче человека (завышает баллы)

ПОДХОД 3 (Self-Consistency) — 5 отдельных запросов:
Просим модель оценить один и тот же текст 5 раз независимо → 
берём медиану/среднее из 5 оценок
Результат: очень стабильно от раза к разу, но ошибки на уровне конкретного ответа остаются большими

🚀

Пример применения

Задача: Методист онлайн-школы по копирайтингу хочет прогнать 200 домашних работ студентов через ChatGPT, чтобы получить предварительную оценку по рубрике (структура, аргументация, стиль, ошибки) — до того, как работы попадут к живому преподавателю на финальную проверку.

Промпт:

Ты — опытный преподаватель курса копирайтинга. Оцени домашнюю работу студента 
по 4 критериям: Структура, Аргументация, Стиль, Грамотность. 
Каждый критерий — от 1 до 5 баллов.

Вот два примера уже оценённых работ для калибровки шкалы:

Пример 1: 
[текст работы №1]
→ Структура: 4, Аргументация: 3, Стиль: 5, Грамотность: 4
Обоснование: структура чёткая, вступление-тезис-аргументы-вывод, но один 
аргумент слабо подкреплён фактами...

Пример 2:
[текст работы №2]
→ Структура: 2, Аргументация: 2, Стиль: 3, Грамотность: 3
Обоснование: логика скачет между абзацами, аргументы декларативные без 
доказательств...

Теперь оцени новую работу. Сначала пройдись по каждому критерию отдельно 
и объясни своё рассуждение в 2-3 предложениях. Только после этого поставь 
итоговый балл по каждому критерию и сумму.

Работа студента: {текст}

Результат: Модель выдаст структурированный разбор — по каждому из 4 критериев короткое рассуждение, затем баллы и сумму. По данным исследования, такая оценка будет ближе всего к оценке живого преподавателя из всех протестированных способов, но с поправкой: модель скорее всего будет немного строже — стоит держать это в уме или явно указать в промпте "не будь излишне строг, ориентируйся на средний уровень группы".


🧠

Почему это работает

LLM без структуры выдаёт нестабильную и непредсказуемую оценку — балл может скакать от запуска к запуску, и совпадение с "экспертным" мнением случайно. Модель не имеет внутреннего эталона, что такое "5 баллов за аргументацию" — этот эталон нужно задать явно.

Сильная сторона LLM — она отлично копирует паттерн, если показать примеры (few-shot работает как калибровочная линейка), и хорошо проговаривает рассуждение по шагам, если её попросить (Chain-of-Thought не даёт срезать путь напрямую к баллу, минуя анализ).

Метод использует это так: примеры-якоря задают модели "систему координат" — что значит хорошая и плохая работа, а пошаговое рассуждение по каждому критерию заставляет модель действительно разобрать текст, а не выдать усреднённую интуитивную цифру.

Рычаги управления: - Количество few-shot примеров → больше примеров = точнее калибровка шкалы, но длиннее промпт - Число повторных генераций в Self-Consistency-подходе → больше повторов = стабильнее оценка, но дороже по времени/токенам; для быстрой проверки достаточно 3 повторов и медианы - Инструкция "объясни рассуждение перед баллом" → если убрать, оценка станет быстрее, но менее точной и без видимой логики - Добавление справочных материалов в контекст → делает оценщика мягче; используйте с осторожностью, если важна строгость проверки


📋

Шаблон промпта

Ты — опытный {эксперт в предметной области}. Оцени {тип работы} 
по критериям: {критерий_1}, {критерий_2}, {критерий_3}, {критерий_4}.
Каждый критерий — от 1 до {макс_балл} баллов.

Вот примеры уже оценённых работ для калибровки шкалы:

Пример 1:
[{текст примера 1}]
→ {критерий_1}: X, {критерий_2}: X, {критерий_3}: X, {критерий_4}: X
Обоснование: {почему такие баллы}

Пример 2:
[{текст примера 2}]
→ {критерий_1}: X, {критерий_2}: X, {критерий_3}: X, {критерий_4}: X
Обоснование: {почему такие баллы}

Теперь оцени новую работу. Сначала пройдись по каждому критерию отдельно 
и объясни рассуждение в 2-3 предложениях. Только после этого поставь 
итоговый балл по каждому критерию и сумму.

Работа: {текст для оценки}

Подставляй: тип работы (эссе, код, резюме, коммерческое предложение), критерии рубрики, максимальный балл по шкале, 1-3 примера уже оценённых работ с обоснованием.

🚀 Быстрый старт — вставь в чат:

Вот шаблон промпта для оценки текстов по рубрике с калибровкой на примерах. 
Адаптируй под мою задачу: {твоя задача — что именно нужно оценивать}. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про критерии оценки и попросит 1-2 примера уже оценённых текстов — потому что без этих "якорей" модель не знает, какую строгость применять. Она возьмёт паттерн рассуждения из шаблона и подстроит под твою рубрику.


⚠️

Ограничения

⚠️ Систематическое смещение: промпт с примерами и пошаговым рассуждением делает модель строже человека — она будет занижать баллы. Учитывайте это при калибровке или прямо просите "не будь излишне строг".

⚠️ Справочные материалы смягчают оценку: если подкладываете в промпт эталонные знания или критерии, модель может засчитывать упоминание понятия, даже если оно применено неправильно.

⚠️ Усреднение даёт стабильность, не точность: если сгенерировать несколько оценок и взять среднее — цифра не будет "скакать" от запуска к запуску, но для конкретного человека/текста ошибка может остаться большой. Такой подход годится для агрегированной статистики (средний балл по группе), но не для решений про отдельного человека.

⚠️ Не все критерии оцениваются одинаково точно: в исследовании точность терминологии оценивалась хуже всего во всех трёх подходах, а логика рассуждения — лучше всего. Проверяйте точность модели по каждому критерию рубрики отдельно, не доверяйте общему баллу.


🔗

Ресурсы

Lin, B., Jin, L., Min, K.-S. Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses. Sejong University & Ewha Womans University, South Korea.


📋 Дайджест исследования

Ключевая суть

Три способа попросить нейросеть оценить студенческую работу — и получаешь трёх разных экзаменаторов. Один занижает баллы, второй завышает, третий стабилен, но может одинаково сильно ошибаться в каждом отдельном случае. Метод позволяет заранее выбрать профиль строгости AI-проверяльщика, а не удивляться непонятным баллам постфактум. Фишка: примеры оценённых работ плюс рассуждение по каждому критерию перед баллом делают модель строже — но именно так она точнее всего совпадает с мнением живого преподавателя.

Принцип работы

Каждая промпт-стратегия — это не просто техника, а профиль смещения. Даёшь модели примеры оценок и просишь объяснить рассуждение по каждому критерию (Few-shot + Chain-of-Thought, рассуждение по шагам) — получаешь строгого экзаменатора, который занижает баллы. Подкладываешь в промпт справочные материалы по теме (RAG, поиск с дополнением контекста) — модель становится мягкой и засчитывает термин, даже если студент влепил его не в тему. Просишь оценить один текст пять раз и берёшь среднее (Self-Consistency) — балл не скачет от запуска к запуску, но стабильность — это не то же самое что точность на конкретном ответе.

Почему работает

Модель не хранит внутри готовый эталон того, что такое 'пять баллов за аргументацию'. Без примеров она просто гадает. Примеры-якоря задают систему координат — работают как калибровочная линейка. Пошаговое рассуждение по каждому критерию не даёт срезать путь напрямую к цифре, минуя разбор текста. Справочные материалы работают наоборот — модель видит нужный термин в тексте и слишком охотно засчитывает его, даже если студент применил его неправильно. И во всех трёх подходах хуже всего оценивается именно точность терминологии — а логика рассуждений оценивается лучше всего.

Когда применять

Проверка текстовых работ по рубрике → домашние задания, эссе, коммерческие предложения, отбор резюме — особенно когда нужно быстро прогнать десятки или сотни работ до финальной проверки человеком. Не подходит как единственный источник итоговой оценки для конкретного человека — систематический перекос и слабая точность на уровне одного ответа означают, что финальное решение должно оставаться за человеком.

Мини-рецепт

1. Собери калибровочную линейку: 2-3 примера работ, уже оценённых человеком, с баллами по каждому критерию и коротким обоснованием.
2. Заставь рассуждать до балла: сначала разбор каждого критерия в 2-3 предложениях, потом цифра — иначе модель угадывает вместо анализа.
3. Выбери профиль строгости: нужен строгий оценщик — примеры плюс рассуждение без справочных материалов; нужен мягкий — добавь справочные материалы; нужна стабильность для статистики по группе — прогони 3-5 раз и возьми медиану.
4. Проверь каждый критерий отдельно: не доверяй итоговой сумме — терминология обычно оценивается хуже логики рассуждений.

Примеры

[ПЛОХО] : Оцени это эссе по рубрике: структура, аргументация, стиль, грамотность. Поставь баллы от 1 до 5.
[ХОРОШО] : Вот два примера уже оценённых эссе с баллами и обоснованием: [пример 1], [пример 2]. Теперь оцени новое эссе — сначала разбери каждый критерий в 2-3 предложениях, потом поставь баллы: {текст}
Источник: Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses
ArXiv ID: 2608.01783 | Сгенерировано: 2026-08-04 06:40

Проблемы LLM

ПроблемаСутьКак обойти
Модель не знает "свою" шкалу оценкиПросишь оценить текст от 1 до 5. Модель не понимает что для тебя значит "5 баллов". Ставит баллы интуитивно, без опоры на эталон. Оценка скачет от запуска к запуску, слабо совпадает с мнением человекаДай 1-3 примера уже оценённых текстов с баллами и объяснением почему. Примеры задают модели систему координат — что такое хорошая и плохая работа по твоей шкале

Методы

МетодСуть
Примеры + рассуждение по критериям перед баллом — калибровка оценщикаДай 1-3 примера оценённых текстов с обоснованием баллов. Попроси модель разобрать новый текст по каждому критерию отдельно, объяснить рассуждение в 2-3 предложениях, и только потом поставить балл. Почему работает: примеры задают модели точку отсчёта строгости, а рассуждение перед баллом не даёт "срезать путь" — модель вынуждена реально разобрать текст, а не выдать усреднённую интуитивную цифру. Когда применять: нужна оценка текста по рубрике с несколькими критериями (эссе, код, заявки). Когда не работает: нет заранее оценённых примеров для калибровки
Несколько независимых оценок + медиана — для агрегированной статистикиПопроси модель оценить один и тот же текст несколько раз отдельными запросами (без памяти о предыдущих). Возьми медиану или среднее. Почему работает: усреднение гасит случайный шум одного запуска. Когда применять: нужен средний балл по большой группе текстов, устраивает погрешность на уровне отдельного ответа. Когда не работает: нужно принять решение про конкретного человека или текст — усреднение маскирует ошибку именно там

Тезисы

ТезисКомментарий
Структура промпта задаёт направление смещения оценкиЭто не случайная погрешность, а предсказуемый перекос. Примеры оценённых работ + пошаговое рассуждение перед баллом делают оценщика строже человека — модель дотошно сверяется с эталонами и находит недочёты. Справочные материалы в контексте делают оценщика мягче — модель засчитывает упоминание нужного термина или понятия, даже если студент применил его неправильно, потому что видит совпадение с "правильным" материалом. Применяй: если нужна строгая проверка — используй примеры + рассуждение и не подкладывай справочные материалы. Если нужна мягкая, поддерживающая оценка — справочные материалы допустимы
📖 Простыми словами

Comparative Validation ofGPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias

arXiv: 2608.01783

Нейросети оценивают сложные работы не как живые люди, а как статистические калькуляторы, у которых нет встроенного чувства прекрасного или понимания «правильного» ответа. Когда ты просишь GPT поставить балл за эссе, она не вчитывается в смысл, а ищет знакомые паттерны. Без четких инструкций модель начинает галлюцинировать критериями: в один заход она поставит «пятерку» за красивый слог, а в другой — «тройку» за отсутствие запятой. Чтобы превратить этот хаос в адекватную проверку, нужно жестко ограничить «фантазию» алгоритма и дать ему внешнюю опору, иначе результат будет чистой лотереей.

Это как если бы ты нанял проверять экзамены случайного прохожего, который вообще не в теме предмета. Если просто дать ему стопку работ, он будет ставить оценки по настроению или длине текста. Но если ты дашь ему шпаргалку с примерами, заставишь сначала вслух проговорить логику оценки и попросишь перепроверить себя трижды — он внезапно станет работать не хуже опытного профессора. Весь секрет не в «интеллекте» проверяющего, а в том, насколько плотно ты обложил его инструкциями и проверками.

Исследователи выделили три метода, которые реально меняют правила игры. Первый — Few-shot + Chain-of-Thought: ты даешь модели примеры «идеальных» и «провальных» работ и заставляешь её сначала расписать аргументы, а только потом лепить балл. Второй — RAG, когда в промпт подкладывают учебник или справочник, чтобы нейронка не выдумывала факты из головы. Третий — Self-Consistency: ты просишь модель оценить текст несколько раз и берешь среднее арифметическое. Оказалось, что каждый метод создает свой уникальный «почерк» оценивания, и их комбинация позволяет добиться почти идеального совпадения с мнением живых преподавателей.

Этот подход — спасение для любого массового обучения, от курсов по музыке до онлайн-школ копирайтинга. Принцип универсален: если у тебя есть четкая рубрика и гора текстов, которые нужно отфильтровать, ты можешь настроить конвейер, который сделает 90% черновой работы за методиста. Это не просто «автоматизация», это создание цифрового двойника эксперта, который не устает, не пьет кофе и не завышает оценки просто потому, что у него сегодня хорошее настроение.

Короче: хватит надеяться на «ум» нейросети — она тупая, пока ты не дашь ей структуру и контекст. Используй связку из примеров, справочных данных и многократных проверок, чтобы получить стабильный результат. Если модель просто выдает цифру без объяснения причин — это бесполезный мусор, которому нельзя доверять проверку даже самого простого теста. Кто научится правильно «дрессировать» GPT на проверку работ, тот сэкономит тысячи часов живых экспертов, пока остальные будут возиться с рандомными баллами.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с