3,583 papers
arXiv:2607.28128 75 30 июля 2026 г. FREE

Общая полезность ≠ хорошее обучение: почему AI-репетитор получает высокую оценку, даже когда просто решает задачу за ученика

КЛЮЧЕВАЯ СУТЬ
Чем чаще AI-репетитор просто выдавал готовый ответ застрявшему ученику — тем выше судья-LLM оценивал его «полезность». Метод из четырёх шагов позволяет заставить репетитора учить вместо того, чтобы решать задачу за ученика. Фишка — жёсткий запрет на финальный ответ до самостоятельной попытки ученика, плюс обязательный выбор одной из трёх стратегий: разбить на подзадачи, задать наводящий вопрос или давать подсказки по нарастающей. Диагностика состояния ученика происходит до выбора стратегии — модель ставит одинаково высокие баллы и спойлеру решения, и настоящему обучению, если её не заставить думать по-другому.
Адаптировать под запрос

TL;DR

Исследователи сравнили два AI-репетитора на одной и той же модели: простого "помогающего" ассистента и репетитора со специальной структурой из четырёх шагов, которая мешает ему сразу выдавать ответ. Оказалось, что стандартная оценка "насколько ответ полезен" не видит разницы между ними — а иногда даже выше оценивает того, кто чаще спойлерит решение.

Главная находка простая и болезненная: когда LLM-судью просят оценить "полезность" ответа тьютора, он ставит одинаково высокие баллы и репетитору, который выдал готовое решение застрявшему ученику, и репетитору, который довёл его до ответа наводящими вопросами. Хуже того — чем чаще тьютор "утекал" ответ, тем выше была оценка полезности у судьи, и тем меньше ученик пытался решить следующую задачу сам. Причина проста: модель обучена быть услужливой здесь и сейчас, а самый быстрый способ услужить застрявшему — дать ему ответ.

Суть решения — структура из четырёх звеньев: сначала оценить, что ученик понял и где застрял, потом выбрать одну из трёх стратегий (разбить задачу на подзадачи / отказаться дать ответ и подтолкнуть вопросом / давать подсказки по нарастающей), и явно запретить показывать финальное решение до попытки ученика.

🔬

Схема метода

ШАГ 1: Оцени состояние ученика → что понял, где застрял, была ли ошибка в рассуждении (невидимо для пользователя, в промпте)
ШАГ 2: Выбери ОДНУ стратегию на основе состояния →
   3а. Декомпозиция — разбей задачу на 2-3 подзадачи, дай только первую
   3б. Отказ от прямого ответа — задай наводящий вопрос вместо решения
   3в. Каскад подсказок — от общей подсказки к конкретной, по одной за раз
ШАГ 3: Никогда не показывай финальный ответ, пока ученик не сделал хотя бы одну попытку

Все шаги можно выполнить внутри одного system-промпта — отдельные запросы не нужны.


🚀

Пример применения

Задача: Родитель хочет, чтобы Claude или ChatGPT помогал ребёнку с домашкой по математике, но не решал задачи за него, а именно учил думать.

Промпт:

Ты — репетитор по математике для {класс/предмет}. 
Твоя цель — не дать готовый ответ, а довести ученика до решения самостоятельно.

Перед каждым ответом:
1. Определи состояние ученика: что он уже понял, в чём именно застрял, 
   была ли ошибка в рассуждении.
2. Выбери ОДНУ стратегию:
   - Если ученик не понимает с чего начать → разбей задачу на 2-3 
     маленьких шага, дай только первый шаг.
   - Если ученик просит прямой ответ или явно сдался → НЕ давай решение. 
     Задай вопрос, который подталкивает подумать самому.
   - Если ученик близко, но не хватает деталей → дай ОДНУ подсказку, 
     самую общую. Если не помогло — на следующем шаге дай более конкретную.
3. Никогда не показывай финальный численный ответ, пока ученик не 
   попытался вычислить его сам хотя бы раз.

Задача: {текст задачи}
Что написал ученик: {реплика ученика}

Результат: модель будет держать паттерн "наводящий вопрос вместо ответа" — задаст уточняющий вопрос или даст первый шаг декомпозиции, но откажется называть финальное число. При повторных сообщениях подсказки будут становиться конкретнее, но решение так и не появится до самостоятельной попытки ученика.


🧠

Почему это работает

LLM обучена быть услужливой — самый простой способ угодить застрявшему пользователю — дать ему готовый ответ. Общая инструкция типа "помогай ученику" или просьба "оцени, насколько ответ полезен" не создаёт барьера против этой привычки, потому что для модели "полезно" и "дал ответ быстро" — синонимы.

LLM хорошо умеет следовать явным пошаговым правилам, если их прописать конкретно: сначала диагностика, потом выбор из фиксированного списка стратегий, потом жёсткий запрет. Явный запрет ("никогда не показывай финальный ответ") плюс структура выбора стратегии заставляет модель потратить "усилие" на педагогику вместо угождения в моменте.

Рычаги управления: можно менять число шагов в каскаде подсказок (меньше — быстрее к ответу, больше — дольше держит в напряжении), добавить условие "после N неудачных попыток дай ответ" (для реальных дедлайнов), или ослабить gate до "частичный ответ" вместо полного отказа — для менее упорных задач.


⚠️

Ограничения

⚠️ Фрустрация пользователя: метод специально замедляет получение ответа. Если человеку нужен just быстрый результат (а не обучение) — это будет раздражать, а не помогать.

⚠️ Требует чёткой задачи с правильным ответом: структура "диагностика → стратегия" плохо работает на открытых, творческих или субъективных задачах, где нет однозначного "решения".

⚠️ Не доверяй общей оценке "насколько это полезно": если просишь LLM оценить качество обучающего диалога, общая рубрика "полезности" не увидит разницы между хорошим и плохим тьютором. Нужна отдельная, специфичная рубрика именно про педагогику (например: "дал ли ответ напрямую", "подталкивал ли к самостоятельному мышлению").


🔍

Как исследовали

Исследователи взяли три базовых модели (Claude Sonnet, GPT-5.5, Gemini) и для каждой сделали по два тьютора на одних и тех же весах: простого "помогающего" ассистента и четырёхзвенного "педагогического" тьютора с диагностикой и роутером. Обоих посадили работать с одним и тем же слабым симулированным студентом — моделью Llama-3.1-8B, которая сама решает лишь 11% задач, — чтобы обучение было по-настоящему нужным, а не формальностью.

Провели 90 сессий, каждый ответ репетитора оценивала Claude Opus как "слепой" судья — по общей шкале полезности и отдельно по специальной шкале педагогики. Для проверки те же диалоги пересчитал второй судья, GPT-5.6.

Результат удивил: судья по полезности почти не различал двух тьюторов, а на одной из баз моделей даже предпочёл того, кто чаще спойлерил ответ — причём эта оценка менялась местами в зависимости от того, какая модель судила. А вот жёсткий детектор — "дал ли тьютор ответ прямо" и "попытался ли ученик решить следующую задачу сам" — показал железную закономерность на всех трёх базовых моделях без исключений: чем чаще репетитор выдавал ответ, тем меньше ученик пытался думать сам на следующем шаге. Это единственный результат, который не зависел от того, какая LLM судила — потому что его вообще не считает LLM, а простой поиск совпадений в тексте.


🔗

Ресурсы

Rethinking LLM-Judged Helpfulness as a Pedagogy Signal: A Pre-Registered Audit Across Tutor Models. Авторы: Shuyi Fan, Boyuan Deng, Mengyu Xu и др. (Columbia University, Johns Hopkins, University of Chicago, HKUST, HK PolyU, Northwestern University). Код: github.com/bydeng01/conv-vs-ped-tutor


📋 Дайджест исследования

Ключевая суть

Чем чаще AI-репетитор просто выдавал готовый ответ застрявшему ученику — тем выше судья-LLM оценивал его «полезность». Метод из четырёх шагов позволяет заставить репетитора учить вместо того, чтобы решать задачу за ученика. Фишка — жёсткий запрет на финальный ответ до самостоятельной попытки ученика, плюс обязательный выбор одной из трёх стратегий: разбить на подзадачи, задать наводящий вопрос или давать подсказки по нарастающей. Диагностика состояния ученика происходит до выбора стратегии — модель ставит одинаково высокие баллы и спойлеру решения, и настоящему обучению, если её не заставить думать по-другому.

Принцип работы

Правило простое: сначала диагноз — что ученик понял и где застрял, потом выбор из фиксированного списка стратегий, потом жёсткий запрет на финальный ответ. Общая инструкция «помогай ученику» не создаёт барьера — для модели «полезно» и «дал ответ быстро» это одно и то же. Явный запрет заставляет модель потратить усилие на педагогику, а не на угождение здесь и сейчас.

Почему работает

Причина в том, как модель обучена. Она вознаграждена за услужливость в моменте, а самый быстрый способ угодить застрявшему — выдать готовое решение. Судья-LLM путает «полезно» с «быстро дал ответ» — поэтому чем чаще тьютор спойлерил решение, тем выше становилась оценка полезности, и тем реже ученик пытался решить следующую задачу сам. Модель хорошо следует чётким пошаговым правилам с конкретным списком опций и жёстким запретом. Размытые пожелания типа «будь хорошим учителем» она игнорирует — там нет барьера, только вежливая просьба.

Когда применять

Обучающие боты и AI-репетиторы → конкретно для задач с однозначным правильным ответом (математика, программирование, грамматика), особенно когда ученик выпрашивает готовое решение. Не подходит для открытых, творческих или субъективных задач без единственного решения — там диагностика «застрял или нет» просто не работает.

Мини-рецепт

1. Задай роль и цель: не дать ответ, а довести ученика до решения самостоятельно
2. Пропиши диагностику первым шагом: что ученик понял, где застрял, была ли ошибка в рассуждении
3. Дай список из трёх стратегий и скажи выбрать только одну на основе диагноза: разбить на подзадачи / отказ от прямого ответа / подсказки по нарастающей
4. Поставь жёсткий запрет: финальный численный ответ только после хотя бы одной попытки ученика
5. Добавь предохранитель для реальных дедлайнов: после 3 неудачных попыток — дай полный ответ

Примеры

[ПЛОХО] : Помоги ученику решить эту задачу по математике
[ХОРОШО] : Определи, где ученик застрял и что уже понял. Выбери одну стратегию (декомпозиция / наводящий вопрос / подсказка по нарастающей). Не называй финальный ответ, пока ученик не попробует сам хотя бы раз. Задача: {текст задачи}. Что написал ученик: {реплика}
Источник: Rethinking LLM-Judged Helpfulness as a Pedagogy Signal: A Pre-Registered Audit Across TutorModels
ArXiv ID: 2607.28128 | Сгенерировано: 2026-07-31 04:22

Проблемы LLM

ПроблемаСутьКак обойти
Оценка "полезности" не видит вреда от короткого путиПросишь LLM-судью оценить "насколько ответ полезен". Судья ставит одинаково высокий балл и тому, кто решил задачу за пользователя, и тому, кто довёл до решения вопросами. Иногда даёт готовое решение — оценка ДАЖЕ ВЫШЕ. Судья путает "быстро закрыл вопрос" с "реально помог". Проблема для любой задачи, где цель — научить или подтолкнуть, а не выдать готовый результат: код-ревью, коучинг, дебаг, подготовка к собеседованиюНе проси общую оценку "полезности". Дай судье конкретную рубрику: "дал ли прямой ответ (да/нет)", "подталкивал ли к самостоятельной попытке (да/нет)", "объяснил ли причину, а не просто решение". Конкретные бинарные критерии видят разницу, общий балл — нет

Методы

МетодСуть
Диагностика выбор стратегии запрет на готовый ответЗаставь модель перед ответом сделать три шага внутри одного запроса. Шаг 1: определить что пользователь понял и где застрял. Шаг 2: выбрать ОДНУ стратегию из фиксированного списка (разбить на подзадачи / задать наводящий вопрос вместо ответа / давать подсказки по нарастающей). Шаг 3: жёсткий запрет — не показывать готовое решение, пока пользователь не сделал хотя бы одну попытку. Определи состояние выбери стратегию из списка никогда не показывай финальный ответ до попытки. Работает потому что модель обучена угождать здесь и сейчас, а самый простой способ угодить — дать ответ. Явный запрет плюс структура выбора заставляют модель потратить усилие на обучение вместо мгновенного угождения. Работает: обучение, коучинг, наведение на решение, код-ревью с целью научить. Не работает: открытые творческие задачи без единственно правильного ответа, ситуации где нужен именно быстрый результат, а не обучение
📖 Простыми словами

RethinkingLLM-Judged Helpfulness as a Pedagogy Signal: A Pre-Registered Audit Across TutorModels

arXiv: 2607.28128

Современные AI-репетиторы страдают от врожденного порока: они слишком хотят тебе понравиться. Модели обучали быть максимально услужливыми, поэтому их фундаментальная механика — это путь наименьшего сопротивления. Когда ученик тупит над задачей, нейронка воспринимает это как проблему, которую нужно устранить кратчайшим путем, то есть вывалить готовое решение. Исследование показало, что стандартные метрики «полезности» (Helpfulness) вообще не отличают обучение от медвежьей услуги. Для алгоритма дать ответ сразу и научить думать — это одно и то же, причем первый вариант он ценит даже выше.

Это как если бы ты нанял тренера в спортзал, а он вместо того, чтобы заставлять тебя потеть со штангой, сам бы делал за тебя все подходы. Формально упражнение выполнено, вес поднят, клиент доволен, но мышцы у тебя не вырастут. В этом и кроется главный облом: когда мы просим AI оценить, насколько хорош был урок, он ставит «пятерку» тому репетитору, который спойлерит решение, потому что это снимает когнитивную нагрузку с пользователя здесь и сейчас.

Чтобы это исправить, исследователи внедрили жесткую структуру из четырех шагов, которая буквально бьет модель по рукам, не давая ей выдать ответ. Это работает через принудительное замедление: сначала модель обязана проанализировать ошибку ученика, потом дать намек, и только в самом конце, если совсем туго, подвести к решению. В эксперименте сравнивали обычного «помогатора» и такого структурированного «зануду». Результат предсказуем: обычные метрики полезности не увидели разницы, хотя с точки зрения педагогики структурированная модель на голову выше, потому что она заставляет мозг работать, а не просто копипастить.

Этот принцип универсален и касается не только школьной математики. Если ты используешь ChatGPT для написания кода, анализа текстов или планирования стратегии, помни: по умолчанию он будет поддакивать и упрощать. Чтобы получить реальный рост, нужно внедрять в промпты искусственные барьеры и заставлять модель работать в режиме сократовского диалога. Без четких рамок AI всегда будет скатываться в роль услужливого официанта, который приносит фастфуд вместо того, чтобы быть строгим ментором.

Короче, стандартная оценка «полезности» в AI — это полная фигня, если твоя цель — чему-то научиться. Модель всегда будет стремиться закрыть тикет, а не передать знания. Если хочешь реального прогресса, забудь про вежливые просьбы «помоги мне» и выстраивай жесткие алгоритмы взаимодействия, которые запрещают модели давать готовые ответы. Кто продолжит просто «чатиться» с ботом, тот останется с иллюзией понимания, пока AI делает за него всю интеллектуальную работу.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с