TL;DR
OCG-PRES — это способ попросить LLM оценивать короткий текстовый ответ (студенческий, ответ кандидата, ответ поддержки) не одной общей оценкой «правильно/неправильно», а по пяти отдельным критериям: есть ли нужные понятия, верно ли связаны между собой, достаточно ли развёрнуто объяснение, нет ли противоречий с эталоном, и не ушёл ли ответ в другую тему. Каждый критерий получает свой балл от 0 до 4.
Главная проблема, которую решает метод: когда LLM просят просто сказать «верно или нет», модель либо цепляется за совпадение слов с эталоном, либо каждый раз даёт немного другую оценку. А ещё разные модели ведут себя по-разному строго: одна щедрая, другая скупая на баллы, хотя расставляют ответы в одном и том же порядке по качеству.
Решение — разбить суждение на 5 конкретных вопросов вместо одного размытого, оценивать их отдельно, а затем усреднять результат по нескольким прогонам (для стабильности) и, если нужно, по нескольким моделям (для нейтрализации «характера» конкретной LLM). Это резко повышает точность отделения хороших ответов от плохих по сравнению с простым сравнением слов.
Схема метода
ШАГ 1: Дать LLM вопрос, эталонный ответ и проверяемый ответ (один запрос)
ШАГ 2: LLM выставляет 5 баллов по шкале 0-4:
— покрытие понятий (нужные термины/идеи присутствуют?)
— точность связей (связи между понятиями верны?)
— полнота рассуждения (объяснение развёрнуто достаточно?)
— контроль противоречий (нет конфликта с эталоном?)
— релевантность теме (ответ не ушёл в сторону?)
ШАГ 3 (опционально, для важных решений): повторить оценку 2-3 раза → взять средний балл
ШАГ 4 (опционально, для критичных решений): повторить в 2-3 разных LLM → усреднить → ансамбль
Шаги 1-2 выполняются в одном промпте. Шаги 3-4 требуют отдельных запросов.
Пример применения
Задача: Онлайн-школа (в духе Skillbox или Нетологии) проверяет открытые ответы студентов на тест по маркетингу. Преподаватель хочет не просто «зачёт/незачёт», а понимать, ГДЕ именно студент ошибся.
Промпт:
Ты — эксперт по проверке ответов студентов.
Вопрос: "Почему снижение цены не всегда увеличивает выручку?"
Эталонный ответ: "Потому что при эластичном спросе снижение цены увеличивает продажи,
но при неэластичном спросе выручка падает, так как рост объёма продаж не компенсирует
падение цены за единицу товара."
Ответ студента: "Потому что люди не всегда покупают больше, даже если цена упала.
Иногда товар просто не нужен большинству людей."
Оцени ответ студента по 5 критериям, каждый по шкале 0-4:
1. Покрытие понятий: упомянуты ли ключевые понятия (эластичность спроса, объём продаж, цена за единицу)?
2. Точность связей: верно ли объяснена связь между ценой, спросом и выручкой?
3. Полнота рассуждения: достаточно ли развёрнуто объяснение механизма?
4. Контроль противоречий: нет ли утверждений, противоречащих эталону?
5. Релевантность теме: ответ остаётся в рамках экономики/маркетинга?
Для каждого критерия дай балл 0-4 и короткое объяснение почему.
В конце — средний балл по всем пяти критериям.
Результат: Модель выдаст 5 баллов с пояснениями (скорее всего, средние баллы по «покрытию понятий» и «точности связей» — студент не назвал эластичность спроса напрямую, но интуитивно близок к идее). В финале — средний балл 0-4, который можно сравнить с проходным порогом. Преподаватель сразу видит: студент понял суть интуитивно, но не знает термин «эластичность» — это конкретная зона для доработки, а не просто «неверно».
Почему это работает
LLM плохо справляется, когда её просят вынести одно общее суждение по расплывчатому критерию типа «правильно ли это». В такой ситуации модель либо хватается за поверхностные сигналы — совпадение слов с эталоном, — либо даёт разный ответ от запуска к запуску, потому что нет чёткой опоры для решения.
Зато LLM хорошо справляется с конкретными, узкими вопросами: «есть тут понятие X?», «верна ли связь между А и Б?». Каждый такой вопрос — это маленькая, чётко сформулированная задача, а не расплывчатое суждение.
OCG-PRES использует эту сильную сторону: вместо одного мутного вопроса модель отвечает на пять узких. Это снижает шум в каждом отдельном суждении, а усреднение по нескольким прогонам и нескольким моделям гасит оставшуюся случайность и «характер» конкретной модели.
Рычаги управления: - Число критериев — можно сократить до 2-3 самых важных для твоей задачи (в исследовании точность связей оказалась самым сильным предиктором правильности ответа — если нужно сократить, оставляй именно этот критерий первым) - Число повторных прогонов — для черновой проверки хватит одного запуска, для итоговой оценки, влияющей на оценку/деньги, стоит повторить 2-3 раза и усреднить - Число моделей — если под рукой только один чат, ансамбль не нужен; если решение важное, прогони через ChatGPT и Claude и сравни - Шкала 0-4 — можно заменить на 0-10 для более тонкой градации, суть метода не изменится
Шаблон промпта
Ты — эксперт по проверке {тип_текста}.
Задание/вопрос: {вопрос}
Эталонный ответ: {эталон}
Проверяемый ответ: {ответ}
Оцени проверяемый ответ по 5 критериям, каждый по шкале 0-4:
1. Покрытие понятий: содержит ли ответ необходимые ключевые понятия из эталона?
2. Точность связей: верно ли описаны связи и причинно-следственные отношения между понятиями?
3. Полнота рассуждения: достаточно ли развёрнуто и логично объяснение?
4. Контроль противоречий: нет ли утверждений, противоречащих эталону?
5. Релевантность теме: остаётся ли ответ в рамках заданной темы/домена?
Для каждого критерия дай балл и короткое обоснование.
В конце выведи средний балл (0-4) по всем критериям.
Подставляй: {тип_текста} — что проверяешь (эссе, ответ кандидата, тестовое задание), {вопрос} — сам вопрос или задание, {эталон} — правильный/образцовый ответ, {ответ} — то, что нужно оценить.
🚀 Быстрый старт — вставь в чат:
Вот шаблон OCG-PRES для оценки текстовых ответов по 5 критериям. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, что именно ты оцениваешь (эссе, тестовые ответы, резюме кандидатов) и какой у тебя есть эталон — потому что без эталона критерии «точность связей» и «контроль противоречий» не с чем сравнивать. Модель адаптирует формулировки критериев под твой контекст.
Ограничения
⚠️ Нет сравнения с живыми людьми: исследование проверяло LLM-оценки против меток из датасета, а не против оценок реальных живых экспертов. Насколько метод совпадает с мнением конкретного преподавателя или HR — неизвестно.
⚠️ Строгость моделей разная: одна модель ставит оценки щедрее, другая — строже, при одинаковом ранжировании ответов по качеству. Если используешь фиксированный порог «прошёл/не прошёл», его нужно откалибровать под конкретную модель — иначе точность классификации падает.
⚠️ Проверено только на научных ответах школьников: метод тестировали на коротких научных ответах (SciEntsBank). Для других форматов — код, юридические тексты, творческие эссе — метод не проверен, критерии могут не переноситься напрямую.
⚠️ Это инструмент поддержки, не финального решения: авторы прямо предупреждают — метод даёт вспомогательную оценку, а не должен автоматически заменять итоговое решение человека, особенно в ситуациях с высокими ставками (экзамены, зачисление).
Как исследовали
Исследователи взяли 996 коротких ответов школьников из датасета SciEntsBank — каждый с вопросом, эталонным ответом и официальной меткой (правильно/неправильно + одна из 5 диагностических категорий). Три модели — GPT, DeepSeek и Qianwen — оценили все 996 ответов по три раза каждая, получив почти 9000 отдельных оценок.
Результаты сравнили с четырьмя простыми методами без LLM: длина ответа, совпадение ключевых слов, TF-IDF-сходство и комбинированная логистическая регрессия на этих признаках. Логика простая: если LLM-оценка не превосходит банальное совпадение слов, то весь метод бесполезен.
Оказалось, что все три модели давали стабильные оценки при повторных прогонах (особенно DeepSeek), сильно согласовывались друг с другом в ранжировании ответов, но расходились в строгости — GPT ставил оценки чуть выше остальных. И главное: OCG-PRES-оценка любой из моделей обошла все текстовые baseline-методы по точности отделения правильных ответов от неправильных. Отдельный любопытный вывод: среди пяти критериев именно точность связей между понятиями оказалась самым сильным предсказателем правильности ответа — сильнее, чем просто наличие нужных слов.
Ресурсы
Zhao, C. & Li, C. (AIEd Governance). Reliability, validity, and diagnostic evidence for multi-model LLM short-answer scoring. Датасет: SciEntsBank (Dzikovska et al., 2013). Теоретическая база OCG-PRES: принципы представления знаний (Brachman & Levesque, 2004), онтологический фреймворк OntoClean (Guarino & Welty, 2002), стандарты семантического веба W3C (RDF, OWL, SPARQL).
