3,583 papers
arXiv:2607.28210 70 30 июля 2026 г. FREE

Языковая предвзятость AI-оценки: ИИ путает "плохо написано" с "не понимает"

КЛЮЧЕВАЯ СУТЬ
Обнаружено: ИИ занижает оценку понимания темы, если текст написан простыми или неуклюжими словами — даже когда сама мысль правильная. Метод (точнее, приём проверки) позволяет уменьшить эту ошибку при автоматической проверке эссе, ответов на экзамене или собеседований — оценивать суть, а не стиль изложения. Фишка: попроси модель сначала пересказать мысль автора своими словами, нейтрально, а потом оценивать только этот пересказ — так модель перестаёт путать корявую формулировку с непониманием. Работает не идеально, но снижает риск, что кривой язык утащит оценку смысла вниз.
Адаптировать под запрос

TL;DR:

Когда вы просите ИИ оценить, насколько человек понимает суть (эссе, ответ на экзамене, объяснение идеи), модель систематически занижает оценку, если текст написан простым или неуклюжим языком — даже если сама мысль верна. Это подтвердилось и на классических ML-моделях, и на GPT-4.1, и на GPT-5-mini: все они делают одну и ту же ошибку.

Представьте: два школьника одинаково правильно объясняют физику звука. Один пишет гладко, научным языком. Второй — тем же смыслом, но простыми словами с ошибками. ИИ (как и учителя-люди в прошлых исследованиях) ставит второму ниже балл за понимание темы, хотя оценивать должен был только содержание. Интересно, что обратного эффекта почти нет: красивый язык не заставляет ИИ переоценивать слабое содержание — проблема именно в недооценке, а не в лести за стиль.

Причина фундаментальна: понять, что человек думает, можно только через то, что он написал. Языка без содержания не существует — они слиты. Поэтому ИИ (и человек) невольно использует качество речи как подсказку о качестве мысли, и это работает против людей, которые формулируют неуклюже, но думают правильно — например, не носителей языка.

🚀

Пример применения

Задача: Вы преподаёте онлайн-курс или ведёте HR-собеседования и просите ChatGPT оценить ответ студента/кандидата — понял ли он суть темы, а не как красиво он пишет.

Промпт:

Оцени, насколько человек понимает суть темы «{тема}» — 
НЕ оценивай стиль, грамматику или красоту речи.

Сначала перескажи мысль автора своими словами, максимально нейтральным языком, 
как будто убираешь всю «шелуху» стиля. 
Затем оцени ТОЛЬКО этот пересказ по шкале 1-5: 
насколько логично и верно раскрыта суть.

Текст автора:
{текст_объяснения}

Результат: Модель отдельно покажет "очищенный" пересказ смысла и только потом даст оценку. Это не убирает проблему полностью (исследователи прямо говорят — неизвестно, помогает ли такой приём), но снижает шанс, что корявые формулировки утащат оценку контента вниз.


📌

Почему это происходит

ИИ обучен на текстах, где обычно хороший язык и хорошее содержание идут вместе — так устроен мир текстов, на которых тренировались модели. Поэтому и классические ML-алгоритмы, и LLM используют язык как подсказку о содержании, а не как что-то отдельное.

Сильная сторона LLM — она хорошо ловит паттерны "гладкий текст = вероятно, автор разбирается". Слабость — модель путает корреляцию с причиной: гладкий текст не гарантирует понимания, а корявый — не гарантирует непонимания. Просьба "раздели язык и содержание" помогает частично, потому что заставляет модель явно выделить смысловое ядро перед оценкой, но не решает проблему полностью — это подтверждено даже у людей-экспертов, специально обученных разделять эти два критерия.


⚠️

Ограничения

⚠️ Нет готового решения: авторы сами говорят — неизвестно, помогает ли просить модель "оценивать осознанно, отдельно от языка". Это открытый вопрос для будущих исследований, не проверенный факт.

⚠️ Узкая выборка: проверено на немецких школьниках 9 класса, одна тема по физике (звук), один язык. Неизвесно, так же ли ведёт себя ИИ на других языках, темах и форматах текста.

⚠️ Не для генерации текста: находка касается оценки чужих текстов ИИ, а не написания текста самим ИИ.


🔍

Как исследовали

Взяли 116 письменных объяснений немецких школьников про то, как передаётся звук. Каждый текст дважды оценили эксперты: отдельно балл за понимание физики и отдельно балл за качество языка — экспертов специально тренировали не путать одно с другим.

Дальше запустили 9 ML-конвейеров (3 модели векторизации текста × 3 алгоритма классификации) и 2 LLM (GPT-4.1 и продвинутый GPT-5-mini) — все должны были оценить только понимание физики, без учёта языка. Сравнили результат AI с оценками экспертов через статистику (мультиномиальную логистическую регрессию), чтобы проверить: связано ли расхождение именно с качеством языка.

Совпадение с экспертами было неплохим (67–78%), но там, где AI ошибался — почти всегда занижал оценку слабо написанным текстам, и это повторилось во всех 11 системах без исключения. Переоценка красиво написанных, но слабых по содержанию текстов встретилась лишь в 2 системах из 11. Это и есть главный, неожиданный результат: проблема не в конкретной архитектуре, а в самой природе задачи "оценить мысль через текст".


📋 Дайджест исследования

Ключевая суть

Обнаружено: ИИ занижает оценку понимания темы, если текст написан простыми или неуклюжими словами — даже когда сама мысль правильная. Метод (точнее, приём проверки) позволяет уменьшить эту ошибку при автоматической проверке эссе, ответов на экзамене или собеседований — оценивать суть, а не стиль изложения. Фишка: попроси модель сначала пересказать мысль автора своими словами, нейтрально, а потом оценивать только этот пересказ — так модель перестаёт путать корявую формулировку с непониманием. Работает не идеально, но снижает риск, что кривой язык утащит оценку смысла вниз.

Принцип работы

Правило простое: не проси оценить текст как есть — заставь модель сначала пересказать мысль нейтральным языком, без стиля автора. Суть приёма — оценка идёт не по оригиналу, а по обезличенному пересказу. И классические ML-модели, и GPT-4.1, и GPT-5-mini попадаются на одну и ту же удочку — значит, дело не в конкретной архитектуре, а в самой природе задачи.

Почему работает

Причина фундаментальная: понять мысль человека можно только через то, что он написал. Языка без содержания не существует — они слиты в тех текстах, на которых обучали модель. Модель видит паттерн 'гладкий текст = автор разбирается' и путает корреляцию с причиной. Корявый текст — не доказательство непонимания, но модель считает иначе. При этом обратного перекоса почти нет: красивый язык не заставляет модель переоценивать слабое содержание — проблема именно в недооценке, а не в лести за стиль.

Когда применять

Автоматическая проверка эссе и онлайн-курсы → оценка ответов на экзамене или на собеседовании, особенно когда среди авторов есть не носители языка или люди, которые пишут просто. НЕ подходит как готовое решение — сами исследователи не проверяли, снимает ли просьба 'разделить язык и содержание' проблему полностью.

Мини-рецепт

1. Задай рамку: прямо напиши модели — оцени ТОЛЬКО суть, не стиль и не грамматику.
2. Попроси пересказ: сначала пусть модель перескажет мысль автора своими словами, максимально нейтрально.
3. Оценивай пересказ, не оригинал: балл ставится по обезличенному тексту, а не по авторской формулировке.
4. Проверь на выборке: сравни несколько оценок с ручной проверкой — приём снижает перекос, но не убирает его полностью.

Примеры

[ПЛОХО] : Оцени понимание темы «звук» в этом ответе ученика: [текст]
[ХОРОШО] : Перескажи суть этого ответа своими словами, максимально нейтрально, без учёта стиля и грамматики. Затем оцени ТОЛЬКО пересказ по шкале 1-5, насколько логично раскрыта суть темы «звук»: [текст]
Источник: AI-based scoring systematically underestimates conceptual understanding of linguistically weak students' explanations in physics
ArXiv ID: 2607.28210 | Сгенерировано: 2026-07-31 04:21

Проблемы LLM

ПроблемаСутьКак обойти
ИИ занижает оценку понимания из-за плохого стиля текстаПросишь оценить, понял ли автор суть темы. Если текст написан неуклюже или с ошибками — модель снижает оценку понимания, даже если мысль верна. Работает только в одну сторону: красивый язык не поднимает оценку слабого содержания, а корявый язык топит оценку сильного содержания. Проблема касается любой задачи где оценивают понимание через текст: эссе, экзамены, собеседования, отзывы, объясненияПопроси модель сначала пересказать мысль автора нейтральным языком — убрать "шелуху" стиля. Затем оценивать только этот пересказ. Приём снижает влияние стиля, но не убирает его полностью

Методы

МетодСуть
Пересказ перед оценкой — отделяет смысл от стиляПопроси модель сначала переформулировать текст автора максимально простым нейтральным языком, без сохранения оригинальных формулировок. Только после этого — оценить смысл пересказа по шкале. Сначала перескажи мысль своими словами. Потом оцени только пересказ. Почему работает: модель вынуждена явно выделить смысловое ядро, а не оценивать сразу весь текст целиком, где стиль и содержание слиты. Когда применять: оценка понимания у людей с неуклюжей речью — не носители языка, ученики, слабые писатели. Ограничение: приём снижает искажение, но не устраняет его полностью — даже люди-эксперты, специально обученные разделять язык и содержание, всё равно частично путают эти критерии
📖 Простыми словами

AI-based scoring systematically underestimates conceptual understanding of linguistically weak students' explanations in physics

arXiv: 2607.28210

Суть проблемы в том, что нейросети — это лингвистические снобы. Когда мы просим ИИ оценить, понимает ли человек физику или маркетинг, модель не лезет вглубь смыслов, а тупо смотрит на обёртку. Если студент излагает гениальную мысль, но делает это коряво, с ошибками или просто «не по-умному», ИИ ставит ему двойку. Это фундаментальный баг: нейронки путают качество языка и глубину понимания, наказывая тех, кто не умеет лить красивую воду.

Это как если бы вы пришли сдавать вождение, идеально припарковались и проехали змейку, но инспектор влепил бы вам пересдачу, потому что вы были в грязных кроссовках и невнятно поздоровались. Машина едет правильно, навык есть, но «вайб» не тот. В итоге ИИ работает как предвзятый препод, который ставит «отлично» не за знания, а за красивый почерк и умные слова.

Исследователи прогнали через это всё: от старых ML-моделей до GPT-4 и GPT-4o-mini, и результат везде один — систематическое занижение оценок. Если в тексте есть грамматические косяки или лексика «слабого» студента, модель автоматически режет баллы, даже если физический смысл передан верно. ИИ просто не видит логику за плохим синтаксисом, превращая проверку знаний в скрытый тест на грамотность.

Тестировали это на школьных задачах по физике, но принцип универсален для любого бизнеса. Если вы используете ChatGPT, чтобы отсеивать кандидатов по их ответам в анкетах или проверять эссе на курсах, вы рискуете выкинуть в мусорку лучшие мозги, которые просто не привыкли выражаться как лорды. Лингвистическая предвзятость убивает объективность везде, где форма важнее содержания.

Короче: нельзя доверять ИИ оценку «понимания», пока вы не вычистили из критериев влияние стиля. Сейчас автоматический скоринг — это лотерея, где выигрывают те, кто умеет красиво болтать, а не те, кто реально шарит. Если не учитывать этот перекос, вы просто будете плодить армию краснобаев, которые ничего не смыслят в деле, но идеально попадают в ожидания алгоритма.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с