3,583 papers
arXiv:2608.01629 75 3 авг. 2026 г. FREE

Скрытая предвзятость LLM-судей: как ошибки в языке снижают оценку кандидата, даже если содержание не хуже

КЛЮЧЕВАЯ СУТЬ
Обнаружено: LLM снижает оценку текста за неродной язык — даже когда смысл письма идентичен оригиналу. Тройная шкала (беглость, статус, теплота) позволяет вскрыть эту скрытую предвзятость LLM-судей при проверке резюме, эссе и заявок. Модель не знает откуда автор — она считывает только форму текста. Разрыв в оценке беглости почти в два раза больше, чем по другим параметрам — бьёт по компетентности незаметно даже для самой модели.
Адаптировать под запрос

TL;DR

Когда LLM оценивает письмо человека, который пишет на неродном языке, модель автоматически снижает баллы — даже если ей не сказали, что автор иностранец, и даже если содержание письма идентично оригиналу. Разница в оценке возникает только из-за того, КАК написан текст, а не из-за того, что в нём сказано — исследователи специально брали пары писем с одинаковым смыслом, где одно написал носитель, а другое — переписал на "плохом" японском изучающий язык.

Сильнее всего страдает оценка "понятности текста" (fluency) — разрыв там почти в два раза больше, чем по другим параметрам. Но интереснее другое: модели, в отличие от людей, слабо занижают "теплоту и доверие" (solidarity) — самый социальный из трёх параметров — зато различают авторов по стране происхождения (китаец, кореец, испанец), хотя живые люди-оценщики этого не делают вообще. Получается, что LLM оценивает текст тоньше, а человека за текстом — грубее, чем настоящие люди.

Вывод практический: если модель используют для скрининга резюме, эссе или заявок — предвзятость к неродной речи проникает в оценку автоматически, просто через то, как написан текст, без всякого указания на национальность. Авторы предлагают использовать тройную шкалу (беглость / статус / теплота) как инструмент аудита таких LLM-судей.

🧠

Схема происходящего (не техника, а механизм bias)

ШАГ 1: LLM получает текст без информации об авторе → оценивает по 9 пунктам (беглость, статус, теплота)
ШАГ 2: Текст неносителя языка автоматически получает ниже баллы → разрыв особенно большой в "беглости"
ШАГ 3: Модель дополнительно занижает баллы в зависимости от родного языка автора → скрытая сегментация, которой нет у людей
ШАГ 4: В текстовом объяснении модель почти не упоминает "компетентность" — хотя именно её она занижает в цифрах

🚀

Пример применения

Задача: HR-менеджер в российской компании просит Claude оценить сопроводительные письма кандидатов на позицию менеджера. Среди кандидатов — носители русского и иностранцы, которые пишут по-русски с акцентом в стиле, но по делу.

Промпт (дебиасинг-инструкция, основанная на находке исследования):

Оцени сопроводительное письмо кандидата по трём критериям: 
профессиональная компетентность, мотивация, соответствие вакансии.

Важно: не снижай оценку за грамматические ошибки, неидиоматичные 
конструкции или "неродной" стиль речи. Оценивай ТОЛЬКО содержание — 
что человек говорит о своём опыте и мотивации, а не как он это 
формулирует.

Письмо: {текст письма}

Результат: Модель даст оценку, сфокусированную на смысле, а не на стилистике. Без такой явной инструкции — как показало исследование — LLM склонна автоматически занижать баллы за "неродную" беглость речи, перенося это на оценку компетентности кандидата, даже не подозревая об этом сама (в объяснениях модель почти не признаётся, что оценивает именно язык, а не содержание).


📌

Почему это происходит

LLM обучены на текстах, где грамотная, "гладкая" речь статистически связана с более высоким статусом и компетентностью автора — это часть человеческой культуры письма, а не изобретение модели. Модель впитала эту связь из тренировочных данных и воспроизводит её автоматически, даже когда её не просят оценивать язык — только содержание.

Сильная сторона LLM — она хорошо считывает поверхностные текстовые сигналы: ошибки, неловкие конструкции, нетипичные обороты. Именно на них модель и опирается сильнее, чем человек, потому что у неё нет доступа к "социальному контексту" автора (кто он, откуда, как выглядит) — только текст. Отсюда парадокс: человек судит автора мягче в плане "теплоты", а LLM — жёстче именно в плане текста, потому что у модели нет ничего, кроме текста, чтобы делать выводы.

Рычаг управления: явная инструкция "игнорируй стилистические и грамматические особенности, оценивай только смысл" — не проверялась авторами напрямую, но логически следует из находки: раз bias идёт от текстовой формы, явное указание отделить форму от содержания должно ослаблять эффект.


⚠️

Ограничения

⚠️ Дебиасинг-инструкция не протестирована: авторы статьи не проверяли, помогает ли явная просьба "игнорировать стиль" снизить bias — это логическая экстраполяция из находки, не подтверждённый в статье приём.

⚠️ Специфика языка и жанра: результаты получены на японских деловых письмах трёх типов (просьба, отказ, перенос дедлайна). На других жанрах и языках картина может отличаться.

⚠️ Bias скрыт даже от самой модели: в текстовых объяснениях LLM почти не упоминает "компетентность" как причину низкой оценки — значит, просить модель "объяснить свою логику" не поможет её вскрыть.


🔍

Как исследовали

Исследователи взяли 145 пар писем на японском из учебного корпуса I-JAS: одно письмо написано человеком, изучающим японский (носитель английского, китайского, французского, корейского или испанского), второе — переписано носителем языка с тем же смыслом. Сначала 1536 живых японцев оценили эти письма по 9 пунктам (беглость, статус, теплота) без информации об авторе. Затем те же письма и шкалу дали шести LLM — от GPT-5.4 и Claude Sonnet 4.5 до маленькой открытой модели Llama 3.1 8B.

Люди систематически занижали оценку неродных писем, особенно по беглости — разрыв там был почти в два раза больше, чем по статусу или теплоте. Все шесть моделей повторили направление этой предвзятости, пять из шести — повторили и порядок (беглость > статус > теплота). Но модели приглушили разрыв в теплоте сильнее всего и — что не делали живые люди — различали кандидатов по родному языку. Любопытная деталь: в текстовых объяснениях моделей почти не встречалось слово "компетентность", хотя именно её оценки модели явно занижали в цифрах — bias спрятан от самой модели.


📋 Дайджест исследования

Ключевая суть

Обнаружено: LLM снижает оценку текста за неродной язык — даже когда смысл письма идентичен оригиналу. Тройная шкала (беглость, статус, теплота) позволяет вскрыть эту скрытую предвзятость LLM-судей при проверке резюме, эссе и заявок. Модель не знает откуда автор — она считывает только форму текста. Разрыв в оценке беглости почти в два раза больше, чем по другим параметрам — бьёт по компетентности незаметно даже для самой модели.

Принцип работы

Человек оценивает автора по социальному контексту — угадывает «своего» и смягчает оценку. LLM видит только текст, без лица, акцента, флага. Людям есть кого прощать — модели прощать нечему, у неё нет «своего». Прикол: LLM тайно делит авторов по родному языку — кореец, китаец, испанец. Живые люди этого вообще не замечают.

Почему работает

Модель обучена на текстах, где гладкая речь статистически связана с высоким статусом автора. LLM впитала эту связь из тренировочных данных и повторяет её автоматически — даже без просьбы оценивать язык. У модели нет ничего кроме текста — только буквы, ошибки, неловкие обороты. Отсюда и жёсткость: разрыв в оценке беглости почти в два раза больше, чем по другим параметрам.

Когда применять

Скрининг резюме, эссе, заявок на грант, сопроводительных писем → особенно когда среди кандидатов есть носители и неносители языка. Критично для HR-автоматизации, приёмных комиссий, оценки грантовых заявок. НЕ подходит для задач, где стиль текста сам является предметом оценки — переводчики, копирайтеры, дипломатическая переписка.

Мини-рецепт

1. Раздели форму и содержание: явно попроси модель не снижать оценку за грамматические ошибки, неидиоматичные конструкции или неродной стиль речи — оценивать только смысл.
2. Задай тройную шкалу для аудита: попроси оценить текст отдельно по беглости, статусу и теплоте — сравни разрыв между «родной» и «неродной» версией одного смысла.
3. Не верь объяснениям модели: она не признается, что режет балл за язык — смотри на цифры, а не на текстовый комментарий.
4. Проверь на паре писем: возьми один текст, перепиши «неуклюже» сохранив смысл, сравни оценки одной и той же модели.

Примеры

[ПЛОХО] : Оцени сопроводительное письмо кандидата и поставь оценку от 1 до 10.
[ХОРОШО] : Оцени письмо по трём критериям: профессиональная компетентность, мотивация, соответствие вакансии. Не снижай оценку за грамматические ошибки или неродной стиль речи — оценивай только содержание. Письмо: {текст письма}
Источник: Human-LLM Alignment in Language Attitudes Toward Non-Native Japanese
ArXiv ID: 2608.01629 | Сгенерировано: 2026-08-04 06:39

Проблемы LLM

ПроблемаСутьКак обойти
Модель снижает оценку за акцент в тексте, даже если смысл не хужеLLM-судья читает текст с ошибками или неродными оборотами. Снижает баллы за "компетентность" и понятность речи. Хотя содержание точь-в-точь такое же, как у носителя языка. Модель путает грамотность и качество мыслиЯвно попроси модель: "оценивай только содержание, игнорируй грамматику и стиль". Раздели критерии в промпте: смысл отдельно, форма отдельно
Модель тайно различает авторов по происхождению, хотя её не просилиLLM-судья видит только текст, без указания страны автора. Но по стилю письма угадывает "неродной" язык и занижает баллы по-разному для разных языковых групп. Человек-оценщик этого не делает вообщеУбери из промпта любые косвенные подсказки о происхождении автора. Проси модель обосновать каждую оценку конкретной цитатой — так легче поймать скрытую логику
Объяснение модели не совпадает с реальной причиной низкой оценкиПросишь LLM объяснить низкий балл. Модель называет мотивацию, опыт, что угодно. Про язык и стиль почти не упоминает. Хотя именно они снизили итоговый баллНе доверяй текстовому объяснению модели. Проверяй предвзятость отдельно: сравни оценки одного смысла в "гладкой" и "неродной" формулировке

Методы

МетодСуть
Явное разделение формы и содержания в запросе на оценкуПропиши в промпте: "не снижай оценку за грамматику, акцент, неидиоматичные конструкции. Оценивай только смысл — что сказано, а не как". Работает потому что предвзятость возникает именно из текстовой формы — явная просьба игнорировать её должна ослаблять сигнал. Не проверено экспериментально, это логический вывод из механизма bias. Применяй для скрининга резюме, эссе, заявок от неносителей языка. Проверяй результат сравнением оценок одинакового смысла в разных формулировках

Тезисы

ТезисКомментарий
LLM-судья без доступа к социальному контексту заменяет его текстовыми сигналамиЧеловек-оценщик видит биографию, поведение, контекст автора — и смягчает оценку через эмпатию. LLM видит только текст. Поэтому сильнее опирается на поверхностные признаки: ошибки, обороты, "гладкость" речи. Через них модель домысливает происхождение и статус автора — то, что человек обычно не выводит из текста. Применяй: помни — модель судит жёстче по форме именно потому, что кроме формы у неё ничего нет
📖 Простыми словами

Human-LLMAlignment inLanguageAttitudes Toward Non-Native Japanese

arXiv: 2608.01629

Нейросети оценивают тексты не по фактам, а по «вайбу», и в этом кроется главная подстава: у моделей есть встроенная предвзятость к неродной речи. Даже если смысл сообщения идеален, LLM считывает мелкие огрехи в стиле или грамматике и автоматически вешает на автора ярлык «второсортности». Это работает на уровне глубоких ассоциаций в весах модели: если текст звучит как речь иностранца, значит, он менее авторитетен, менее логичен и заслуживает низкого балла.

Это как если бы ты пришел устраиваться на работу, выдал гениальный план спасения компании, но тебя не наняли, потому что у тебя неправильный пробор или странный акцент. Интервьюер вроде бы слушает суть, но подсознательно уже решил, что ты «не свой», и поэтому твои идеи стоят дешевле. В исследовании с японским языком это доказали чисто: брали два текста с абсолютно одинаковым смыслом, но один был написан носителем, а другой — учеником. Модель стабильно топила ученика, хотя фактических ошибок в логике не было.

Что конкретно ломает оценку: стилистическая неуклюжесть, избыточность и нетипичный выбор слов. Модель видит, что структура предложения отличается от «золотого стандарта» из обучающей выборки, и срабатывает негативный триггер. Исследователи подтвердили, что даже без прямой указки на происхождение автора, LLM считывает «чужака» по косвенным признакам и занижает оценку просто за то, как это сказано. Это не баг логики, это языковой шовинизм, зашитый в алгоритмы.

Принцип универсален и касается не только японского: если ты просишь Claude или GPT оценить резюме кандидата-иностранца, который пишет по-русски с легким акцентом, модель его незаслуженно сольет. Это же работает в маркетинге, техподдержке или при проверке эссе — если текст не мимикрирует под идеального носителя, он получает штраф к «интеллектуальности». SEO для смыслов здесь бессильно, если форма выдает в тебе «неместного».

Короче: нейросети — это жуткие снобы, которые судят по одежке, даже если ты их об этом не просил. Если используешь AI для оценки людей или контента, помни, что он дискриминирует неродную речь по умолчанию. Чтобы не пропустить крутого спеца или идею, нужно либо прогонять тексты через «выравниватель» стиля перед оценкой, либо смириться с тем, что модель всегда будет немножко расистом в вопросах лингвистики.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с