3,583 papers
arXiv:2609.06315 78 6 сент. 2026 г. FREE

OCG-PRES: пятимерная рубрика для проверки ответов вместо одной общей оценки

КЛЮЧЕВАЯ СУТЬ
Обнаружено: когда LLM просят просто сказать "верно или нет", модель либо цепляется за совпадение слов с эталоном, либо каждый раз выдаёт разный вердикт — нет чёткой опоры для решения. Метод OCG-PRES позволяет получать стабильную и детализированную оценку короткого текстового ответа — студента, кандидата, поддержки — вместо одного мутного "зачёт/незачёт". Фишка: вместо одного расплывчатого суждения модель отвечает на пять конкретных узких вопроса — есть ли нужные понятия, верно ли они связаны, развёрнуто ли объяснение, нет ли противоречий, не ушёл ли ответ в другую тему. Каждый критерий — балл 0-4, а не общее "да/нет".
Адаптировать под запрос

TL;DR

OCG-PRES — это способ попросить LLM оценивать короткий текстовый ответ (студенческий, ответ кандидата, ответ поддержки) не одной общей оценкой «правильно/неправильно», а по пяти отдельным критериям: есть ли нужные понятия, верно ли связаны между собой, достаточно ли развёрнуто объяснение, нет ли противоречий с эталоном, и не ушёл ли ответ в другую тему. Каждый критерий получает свой балл от 0 до 4.

Главная проблема, которую решает метод: когда LLM просят просто сказать «верно или нет», модель либо цепляется за совпадение слов с эталоном, либо каждый раз даёт немного другую оценку. А ещё разные модели ведут себя по-разному строго: одна щедрая, другая скупая на баллы, хотя расставляют ответы в одном и том же порядке по качеству.

Решение — разбить суждение на 5 конкретных вопросов вместо одного размытого, оценивать их отдельно, а затем усреднять результат по нескольким прогонам (для стабильности) и, если нужно, по нескольким моделям (для нейтрализации «характера» конкретной LLM). Это резко повышает точность отделения хороших ответов от плохих по сравнению с простым сравнением слов.


🔬

Схема метода

ШАГ 1: Дать LLM вопрос, эталонный ответ и проверяемый ответ (один запрос)
ШАГ 2: LLM выставляет 5 баллов по шкале 0-4:
   — покрытие понятий (нужные термины/идеи присутствуют?)
   — точность связей (связи между понятиями верны?)
   — полнота рассуждения (объяснение развёрнуто достаточно?)
   — контроль противоречий (нет конфликта с эталоном?)
   — релевантность теме (ответ не ушёл в сторону?)
ШАГ 3 (опционально, для важных решений): повторить оценку 2-3 раза → взять средний балл
ШАГ 4 (опционально, для критичных решений): повторить в 2-3 разных LLM → усреднить → ансамбль

Шаги 1-2 выполняются в одном промпте. Шаги 3-4 требуют отдельных запросов.


🚀

Пример применения

Задача: Онлайн-школа (в духе Skillbox или Нетологии) проверяет открытые ответы студентов на тест по маркетингу. Преподаватель хочет не просто «зачёт/незачёт», а понимать, ГДЕ именно студент ошибся.

Промпт:

Ты — эксперт по проверке ответов студентов.

Вопрос: "Почему снижение цены не всегда увеличивает выручку?"
Эталонный ответ: "Потому что при эластичном спросе снижение цены увеличивает продажи, 
но при неэластичном спросе выручка падает, так как рост объёма продаж не компенсирует 
падение цены за единицу товара."
Ответ студента: "Потому что люди не всегда покупают больше, даже если цена упала. 
Иногда товар просто не нужен большинству людей."

Оцени ответ студента по 5 критериям, каждый по шкале 0-4:

1. Покрытие понятий: упомянуты ли ключевые понятия (эластичность спроса, объём продаж, цена за единицу)?
2. Точность связей: верно ли объяснена связь между ценой, спросом и выручкой?
3. Полнота рассуждения: достаточно ли развёрнуто объяснение механизма?
4. Контроль противоречий: нет ли утверждений, противоречащих эталону?
5. Релевантность теме: ответ остаётся в рамках экономики/маркетинга?

Для каждого критерия дай балл 0-4 и короткое объяснение почему.
В конце — средний балл по всем пяти критериям.

Результат: Модель выдаст 5 баллов с пояснениями (скорее всего, средние баллы по «покрытию понятий» и «точности связей» — студент не назвал эластичность спроса напрямую, но интуитивно близок к идее). В финале — средний балл 0-4, который можно сравнить с проходным порогом. Преподаватель сразу видит: студент понял суть интуитивно, но не знает термин «эластичность» — это конкретная зона для доработки, а не просто «неверно».


🧠

Почему это работает

LLM плохо справляется, когда её просят вынести одно общее суждение по расплывчатому критерию типа «правильно ли это». В такой ситуации модель либо хватается за поверхностные сигналы — совпадение слов с эталоном, — либо даёт разный ответ от запуска к запуску, потому что нет чёткой опоры для решения.

Зато LLM хорошо справляется с конкретными, узкими вопросами: «есть тут понятие X?», «верна ли связь между А и Б?». Каждый такой вопрос — это маленькая, чётко сформулированная задача, а не расплывчатое суждение.

OCG-PRES использует эту сильную сторону: вместо одного мутного вопроса модель отвечает на пять узких. Это снижает шум в каждом отдельном суждении, а усреднение по нескольким прогонам и нескольким моделям гасит оставшуюся случайность и «характер» конкретной модели.

Рычаги управления: - Число критериев — можно сократить до 2-3 самых важных для твоей задачи (в исследовании точность связей оказалась самым сильным предиктором правильности ответа — если нужно сократить, оставляй именно этот критерий первым) - Число повторных прогонов — для черновой проверки хватит одного запуска, для итоговой оценки, влияющей на оценку/деньги, стоит повторить 2-3 раза и усреднить - Число моделей — если под рукой только один чат, ансамбль не нужен; если решение важное, прогони через ChatGPT и Claude и сравни - Шкала 0-4 — можно заменить на 0-10 для более тонкой градации, суть метода не изменится


📋

Шаблон промпта

Ты — эксперт по проверке {тип_текста}.

Задание/вопрос: {вопрос}
Эталонный ответ: {эталон}
Проверяемый ответ: {ответ}

Оцени проверяемый ответ по 5 критериям, каждый по шкале 0-4:

1. Покрытие понятий: содержит ли ответ необходимые ключевые понятия из эталона?
2. Точность связей: верно ли описаны связи и причинно-следственные отношения между понятиями?
3. Полнота рассуждения: достаточно ли развёрнуто и логично объяснение?
4. Контроль противоречий: нет ли утверждений, противоречащих эталону?
5. Релевантность теме: остаётся ли ответ в рамках заданной темы/домена?

Для каждого критерия дай балл и короткое обоснование.
В конце выведи средний балл (0-4) по всем критериям.

Подставляй: {тип_текста} — что проверяешь (эссе, ответ кандидата, тестовое задание), {вопрос} — сам вопрос или задание, {эталон} — правильный/образцовый ответ, {ответ} — то, что нужно оценить.

🚀 Быстрый старт — вставь в чат:

Вот шаблон OCG-PRES для оценки текстовых ответов по 5 критериям. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, что именно ты оцениваешь (эссе, тестовые ответы, резюме кандидатов) и какой у тебя есть эталон — потому что без эталона критерии «точность связей» и «контроль противоречий» не с чем сравнивать. Модель адаптирует формулировки критериев под твой контекст.


⚠️

Ограничения

⚠️ Нет сравнения с живыми людьми: исследование проверяло LLM-оценки против меток из датасета, а не против оценок реальных живых экспертов. Насколько метод совпадает с мнением конкретного преподавателя или HR — неизвестно.

⚠️ Строгость моделей разная: одна модель ставит оценки щедрее, другая — строже, при одинаковом ранжировании ответов по качеству. Если используешь фиксированный порог «прошёл/не прошёл», его нужно откалибровать под конкретную модель — иначе точность классификации падает.

⚠️ Проверено только на научных ответах школьников: метод тестировали на коротких научных ответах (SciEntsBank). Для других форматов — код, юридические тексты, творческие эссе — метод не проверен, критерии могут не переноситься напрямую.

⚠️ Это инструмент поддержки, не финального решения: авторы прямо предупреждают — метод даёт вспомогательную оценку, а не должен автоматически заменять итоговое решение человека, особенно в ситуациях с высокими ставками (экзамены, зачисление).


🔍

Как исследовали

Исследователи взяли 996 коротких ответов школьников из датасета SciEntsBank — каждый с вопросом, эталонным ответом и официальной меткой (правильно/неправильно + одна из 5 диагностических категорий). Три модели — GPT, DeepSeek и Qianwen — оценили все 996 ответов по три раза каждая, получив почти 9000 отдельных оценок.

Результаты сравнили с четырьмя простыми методами без LLM: длина ответа, совпадение ключевых слов, TF-IDF-сходство и комбинированная логистическая регрессия на этих признаках. Логика простая: если LLM-оценка не превосходит банальное совпадение слов, то весь метод бесполезен.

Оказалось, что все три модели давали стабильные оценки при повторных прогонах (особенно DeepSeek), сильно согласовывались друг с другом в ранжировании ответов, но расходились в строгости — GPT ставил оценки чуть выше остальных. И главное: OCG-PRES-оценка любой из моделей обошла все текстовые baseline-методы по точности отделения правильных ответов от неправильных. Отдельный любопытный вывод: среди пяти критериев именно точность связей между понятиями оказалась самым сильным предсказателем правильности ответа — сильнее, чем просто наличие нужных слов.


🔗

Ресурсы

Zhao, C. & Li, C. (AIEd Governance). Reliability, validity, and diagnostic evidence for multi-model LLM short-answer scoring. Датасет: SciEntsBank (Dzikovska et al., 2013). Теоретическая база OCG-PRES: принципы представления знаний (Brachman & Levesque, 2004), онтологический фреймворк OntoClean (Guarino & Welty, 2002), стандарты семантического веба W3C (RDF, OWL, SPARQL).


📋 Дайджест исследования

Ключевая суть

Обнаружено: когда LLM просят просто сказать "верно или нет", модель либо цепляется за совпадение слов с эталоном, либо каждый раз выдаёт разный вердикт — нет чёткой опоры для решения. Метод OCG-PRES позволяет получать стабильную и детализированную оценку короткого текстового ответа — студента, кандидата, поддержки — вместо одного мутного "зачёт/незачёт". Фишка: вместо одного расплывчатого суждения модель отвечает на пять конкретных узких вопроса — есть ли нужные понятия, верно ли они связаны, развёрнуто ли объяснение, нет ли противоречий, не ушёл ли ответ в другую тему. Каждый критерий — балл 0-4, а не общее "да/нет".

Принцип работы

LLM плохо справляется с одним размытым вопросом "правильно ли это в целом" — слишком много всего нужно взвесить сразу. Зато отлично справляется с узкими конкретными вопросами типа "есть здесь понятие X?" или "верна ли связь между А и Б?". Принцип OCG-PRES: разбей одно мутное суждение на пять чётких — и точность вырастет сама. Для важных решений добавь усреднение — прогони оценку 2-3 раза, а если ставки высокие — ещё и через 2-3 разные модели.

Почему работает

Модель как студент, которого спросили "ну как, всё в целом норм?" — теряется и хватается за первое, что бросается в глаза, например совпадающие слова с эталоном. А теперь спроси её пять раз конкретное: "есть тут термин X?" — и она отвечает точно, потому что задача маленькая и ясная. Самый сильный из пяти критериев — точность связей между понятиями: именно он лучше всего предсказывает правильность ответа. Разные модели при этом ставят баллы по-разному строго — одна щедрая, другая скупая, но порядок ответов по качеству у них совпадает.

Когда применять

Проверка открытых текстовых ответов → конкретно для ситуаций, где важно не просто узнать "верно/неверно", а понять ГДЕ именно ошибка — тесты студентов, ответы кандидатов на собеседовании, тикеты поддержки. Особенно ценно, когда нужна диагностика для обратной связи, а не просто финальный балл. НЕ проверено для кода, юридических текстов и творческих эссе — метод тестировали только на коротких научных ответах школьников, для других форматов критерии могут не сработать напрямую.

Мини-рецепт

1. Собери тройку: вопрос, эталонный ответ, проверяемый ответ — всё в один промпт.
2. Задай пять узких вопросов: покрытие понятий, точность связей, полнота рассуждения, противоречия с эталоном, релевантность теме — каждый по шкале 0-4.
3. Для важных решений — повтори: прогони оценку 2-3 раза и возьми средний балл, чтобы погасить случайность.
4. Для критичных решений — собери ансамбль: прогони через 2-3 разные модели (например ChatGPT и Claude) и усредни — так нейтрализуешь "характер" конкретной LLM.
5. Откалибруй порог: если ставишь фиксированную границу "прошёл/не прошёл", подбирай её под ту модель, которую используешь — щедрая и скупая модель дают разные шкалы.

Примеры

[ПЛОХО] : Оцени, правильный ли это ответ студента: [ответ]
[ХОРОШО] : Оцени ответ студента по 5 критериям 0-4: покрытие понятий, точность связей, полнота рассуждения, противоречия с эталоном, релевантность теме. Для каждого — балл и короткое объяснение почему. Вопрос: [вопрос]. Эталон: [эталонный ответ]. Ответ студента: [ответ]
Источник: Reliability, validity, and diagnostic evidence for multi-model LLM short-answer scoring
ArXiv ID: 2609.06315 | Сгенерировано: 2026-09-09 04:22

Проблемы LLM

ПроблемаСутьКак обойти
Модель ненадёжна при общей оценке «правильно/неправильно»Просишь оценить ответ одним суждением. Модель либо цепляется за совпадение слов с эталоном, либо от запуска к запуску даёт разный вердикт. Нет чёткой опоры для решения — суждение слишком размытоеРазбей одну общую оценку на 3-5 узких конкретных вопросов: «есть ли понятие X?», «верна ли связь между А и Б?». Каждый вопрос — маленькая чёткая задача, а не размытое суждение
LLM-судья не откалиброван по строгостиОдна модель ставит оценки щедро, другая — скупо, при этом обе одинаково ранжируют ответы от плохих к хорошим. Фиксированный порог «прошёл/не прошёл» (например, «балл выше 3 = зачёт») работает для одной модели и ломается для другойНе привязывайся к абсолютному числу как порогу. Либо откалибруй порог под конкретную модель на тестовых примерах, либо сравнивай ответы между собой (ранжирование), а не с фиксированной планкой

Методы

МетодСуть
Декомпозиция оценки на узкие критерии — точнее общего сужденияВместо одного вопроса «правильно ли это?» задай 3-5 конкретных: покрытие нужных понятий, точность связей между ними, полнота объяснения, отсутствие противоречий с эталоном, релевантность теме. Каждому — свой балл 0-4. Оцени по критериям: 1) есть ли понятие X, 2) верна ли связь A-B, 3).... Почему работает: узкий вопрос — конкретная задача с чёткой опорой, размытый вопрос — нет опоры, модель гадает. Работает для любой оценки текста: эссе, резюме, ответы поддержки, код-ревью. Не работает без эталона для сравнения — критерии типа «нет противоречий» повисают в воздухе
Усреднение по прогонам и моделям — гасит случайность оценкиПовтори одну и ту же оценку 2-3 раза в одной модели и возьми средний балл — гасит случайный шум одного запуска. Для важных решений прогони оценку через 2-3 разные модели (например, GPT и Claude) и усредни — гасит «характер» конкретной модели (склонность быть щедрой или скупой). Почему работает: единичный ответ модели — это одна случайная выборка из её распределения, усреднение сглаживает выбросы. Работает: когда решение влияет на что-то важное (оценка, деньги, допуск). Не работает: для быстрой черновой проверки — лишние затраты без выгоды

Тезисы

ТезисКомментарий
Узкие вопросы дают более надёжную оценку, чем один размытыйКогда просишь модель ответить на конкретный узкий вопрос («есть тут понятие X?»), она отвечает стабильнее и точнее, чем на общий вопрос («это правильно?»). Размытый вопрос не даёт модели чёткой опоры — она либо хватается за поверхностные совпадения слов, либо колеблется между запусками. Применяй: любую задачу оценки или классификации разбивай на несколько узких да/нет или числовых вопросов вместо одного общего вердикта
📖 Простыми словами

Reliability, validity, and diagnostic evidence for multi-modelLLMshort-answer scoring

arXiv: 2609.06315

Когда ты просишь нейросеть оценить текстовый ответ одной общей плашкой "правильно или нет", получается полная ерунда. Модель начинает тупо цепляться за совпадение отдельных слов с эталоном или выдавать разный вердикт при каждом перезапуске. LLM не умеет судить «по понятиям» — без чётких внешних опор она неизбежно скатывается в галлюцинации и поверхностный шум.

Это как если бы автоинструктор на экзамене просто орал «ты не умеешь водить!», вместо того чтобы объяснить, где именно косяк. Формально оценку влепил, но толку ноль — ученик не понимает ошибку, а сам вердикт зависит от настроения экзаменатора. Чтобы система работала стабильно, нужен детальный чек-лист, а не абстрактное экспертное «ну мне не нравится».

Решает проблему подход OCG-PRES, который заставляет модель оценивать ответ по 5 независимым критериям с градацией от 0 до 4 баллов. LLM отдельно проверяет наличие ключевых концептов, логику связей между ними, глубину объяснения, отсутствие фактических противоречий и то, не ушёл ли автор в глухую степь.

Метод тестировали на учебных тестах, но принцип абсолютно универсален. Точно так же можно без потерь качества проверять ответы кандидатов на собеседованиях в HR, оценивать сложные тикеты службы поддержки или качество работы менеджеров по продажам. Везде, где вместо бинарного «сойдёт / не сойдёт» требуется прозрачная диагностика проблемы.

Короче: забудь про ленивые промпты в духе "проверь этот текст". Разбивай задачу на атомарные параметры, фиксируй шкалу и требуй пошаговый скоринг. Кто внедряет многомерную оценку — заменяет рутину живых ревьюеров без потери качества, а остальные продолжают ловить рандомные ошибки и гадать на кофейной гуще.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с