TL;DR:
Когда вы просите ИИ оценить, насколько человек понимает суть (эссе, ответ на экзамене, объяснение идеи), модель систематически занижает оценку, если текст написан простым или неуклюжим языком — даже если сама мысль верна. Это подтвердилось и на классических ML-моделях, и на GPT-4.1, и на GPT-5-mini: все они делают одну и ту же ошибку.
Представьте: два школьника одинаково правильно объясняют физику звука. Один пишет гладко, научным языком. Второй — тем же смыслом, но простыми словами с ошибками. ИИ (как и учителя-люди в прошлых исследованиях) ставит второму ниже балл за понимание темы, хотя оценивать должен был только содержание. Интересно, что обратного эффекта почти нет: красивый язык не заставляет ИИ переоценивать слабое содержание — проблема именно в недооценке, а не в лести за стиль.
Причина фундаментальна: понять, что человек думает, можно только через то, что он написал. Языка без содержания не существует — они слиты. Поэтому ИИ (и человек) невольно использует качество речи как подсказку о качестве мысли, и это работает против людей, которые формулируют неуклюже, но думают правильно — например, не носителей языка.
Пример применения
Задача: Вы преподаёте онлайн-курс или ведёте HR-собеседования и просите ChatGPT оценить ответ студента/кандидата — понял ли он суть темы, а не как красиво он пишет.
Промпт:
Оцени, насколько человек понимает суть темы «{тема}» —
НЕ оценивай стиль, грамматику или красоту речи.
Сначала перескажи мысль автора своими словами, максимально нейтральным языком,
как будто убираешь всю «шелуху» стиля.
Затем оцени ТОЛЬКО этот пересказ по шкале 1-5:
насколько логично и верно раскрыта суть.
Текст автора:
{текст_объяснения}
Результат: Модель отдельно покажет "очищенный" пересказ смысла и только потом даст оценку. Это не убирает проблему полностью (исследователи прямо говорят — неизвестно, помогает ли такой приём), но снижает шанс, что корявые формулировки утащат оценку контента вниз.
Почему это происходит
ИИ обучен на текстах, где обычно хороший язык и хорошее содержание идут вместе — так устроен мир текстов, на которых тренировались модели. Поэтому и классические ML-алгоритмы, и LLM используют язык как подсказку о содержании, а не как что-то отдельное.
Сильная сторона LLM — она хорошо ловит паттерны "гладкий текст = вероятно, автор разбирается". Слабость — модель путает корреляцию с причиной: гладкий текст не гарантирует понимания, а корявый — не гарантирует непонимания. Просьба "раздели язык и содержание" помогает частично, потому что заставляет модель явно выделить смысловое ядро перед оценкой, но не решает проблему полностью — это подтверждено даже у людей-экспертов, специально обученных разделять эти два критерия.
Ограничения
⚠️ Нет готового решения: авторы сами говорят — неизвестно, помогает ли просить модель "оценивать осознанно, отдельно от языка". Это открытый вопрос для будущих исследований, не проверенный факт.
⚠️ Узкая выборка: проверено на немецких школьниках 9 класса, одна тема по физике (звук), один язык. Неизвесно, так же ли ведёт себя ИИ на других языках, темах и форматах текста.
⚠️ Не для генерации текста: находка касается оценки чужих текстов ИИ, а не написания текста самим ИИ.
Как исследовали
Взяли 116 письменных объяснений немецких школьников про то, как передаётся звук. Каждый текст дважды оценили эксперты: отдельно балл за понимание физики и отдельно балл за качество языка — экспертов специально тренировали не путать одно с другим.
Дальше запустили 9 ML-конвейеров (3 модели векторизации текста × 3 алгоритма классификации) и 2 LLM (GPT-4.1 и продвинутый GPT-5-mini) — все должны были оценить только понимание физики, без учёта языка. Сравнили результат AI с оценками экспертов через статистику (мультиномиальную логистическую регрессию), чтобы проверить: связано ли расхождение именно с качеством языка.
Совпадение с экспертами было неплохим (67–78%), но там, где AI ошибался — почти всегда занижал оценку слабо написанным текстам, и это повторилось во всех 11 системах без исключения. Переоценка красиво написанных, но слабых по содержанию текстов встретилась лишь в 2 системах из 11. Это и есть главный, неожиданный результат: проблема не в конкретной архитектуре, а в самой природе задачи "оценить мысль через текст".
