TL;DR
Когда LLM оценивает письмо человека, который пишет на неродном языке, модель автоматически снижает баллы — даже если ей не сказали, что автор иностранец, и даже если содержание письма идентично оригиналу. Разница в оценке возникает только из-за того, КАК написан текст, а не из-за того, что в нём сказано — исследователи специально брали пары писем с одинаковым смыслом, где одно написал носитель, а другое — переписал на "плохом" японском изучающий язык.
Сильнее всего страдает оценка "понятности текста" (fluency) — разрыв там почти в два раза больше, чем по другим параметрам. Но интереснее другое: модели, в отличие от людей, слабо занижают "теплоту и доверие" (solidarity) — самый социальный из трёх параметров — зато различают авторов по стране происхождения (китаец, кореец, испанец), хотя живые люди-оценщики этого не делают вообще. Получается, что LLM оценивает текст тоньше, а человека за текстом — грубее, чем настоящие люди.
Вывод практический: если модель используют для скрининга резюме, эссе или заявок — предвзятость к неродной речи проникает в оценку автоматически, просто через то, как написан текст, без всякого указания на национальность. Авторы предлагают использовать тройную шкалу (беглость / статус / теплота) как инструмент аудита таких LLM-судей.
Схема происходящего (не техника, а механизм bias)
ШАГ 1: LLM получает текст без информации об авторе → оценивает по 9 пунктам (беглость, статус, теплота)
ШАГ 2: Текст неносителя языка автоматически получает ниже баллы → разрыв особенно большой в "беглости"
ШАГ 3: Модель дополнительно занижает баллы в зависимости от родного языка автора → скрытая сегментация, которой нет у людей
ШАГ 4: В текстовом объяснении модель почти не упоминает "компетентность" — хотя именно её она занижает в цифрах
Пример применения
Задача: HR-менеджер в российской компании просит Claude оценить сопроводительные письма кандидатов на позицию менеджера. Среди кандидатов — носители русского и иностранцы, которые пишут по-русски с акцентом в стиле, но по делу.
Промпт (дебиасинг-инструкция, основанная на находке исследования):
Оцени сопроводительное письмо кандидата по трём критериям:
профессиональная компетентность, мотивация, соответствие вакансии.
Важно: не снижай оценку за грамматические ошибки, неидиоматичные
конструкции или "неродной" стиль речи. Оценивай ТОЛЬКО содержание —
что человек говорит о своём опыте и мотивации, а не как он это
формулирует.
Письмо: {текст письма}
Результат: Модель даст оценку, сфокусированную на смысле, а не на стилистике. Без такой явной инструкции — как показало исследование — LLM склонна автоматически занижать баллы за "неродную" беглость речи, перенося это на оценку компетентности кандидата, даже не подозревая об этом сама (в объяснениях модель почти не признаётся, что оценивает именно язык, а не содержание).
Почему это происходит
LLM обучены на текстах, где грамотная, "гладкая" речь статистически связана с более высоким статусом и компетентностью автора — это часть человеческой культуры письма, а не изобретение модели. Модель впитала эту связь из тренировочных данных и воспроизводит её автоматически, даже когда её не просят оценивать язык — только содержание.
Сильная сторона LLM — она хорошо считывает поверхностные текстовые сигналы: ошибки, неловкие конструкции, нетипичные обороты. Именно на них модель и опирается сильнее, чем человек, потому что у неё нет доступа к "социальному контексту" автора (кто он, откуда, как выглядит) — только текст. Отсюда парадокс: человек судит автора мягче в плане "теплоты", а LLM — жёстче именно в плане текста, потому что у модели нет ничего, кроме текста, чтобы делать выводы.
Рычаг управления: явная инструкция "игнорируй стилистические и грамматические особенности, оценивай только смысл" — не проверялась авторами напрямую, но логически следует из находки: раз bias идёт от текстовой формы, явное указание отделить форму от содержания должно ослаблять эффект.
Ограничения
⚠️ Дебиасинг-инструкция не протестирована: авторы статьи не проверяли, помогает ли явная просьба "игнорировать стиль" снизить bias — это логическая экстраполяция из находки, не подтверждённый в статье приём.
⚠️ Специфика языка и жанра: результаты получены на японских деловых письмах трёх типов (просьба, отказ, перенос дедлайна). На других жанрах и языках картина может отличаться.
⚠️ Bias скрыт даже от самой модели: в текстовых объяснениях LLM почти не упоминает "компетентность" как причину низкой оценки — значит, просить модель "объяснить свою логику" не поможет её вскрыть.
Как исследовали
Исследователи взяли 145 пар писем на японском из учебного корпуса I-JAS: одно письмо написано человеком, изучающим японский (носитель английского, китайского, французского, корейского или испанского), второе — переписано носителем языка с тем же смыслом. Сначала 1536 живых японцев оценили эти письма по 9 пунктам (беглость, статус, теплота) без информации об авторе. Затем те же письма и шкалу дали шести LLM — от GPT-5.4 и Claude Sonnet 4.5 до маленькой открытой модели Llama 3.1 8B.
Люди систематически занижали оценку неродных писем, особенно по беглости — разрыв там был почти в два раза больше, чем по статусу или теплоте. Все шесть моделей повторили направление этой предвзятости, пять из шести — повторили и порядок (беглость > статус > теплота). Но модели приглушили разрыв в теплоте сильнее всего и — что не делали живые люди — различали кандидатов по родному языку. Любопытная деталь: в текстовых объяснениях моделей почти не встречалось слово "компетентность", хотя именно её оценки модели явно занижали в цифрах — bias спрятан от самой модели.
