3,583 papers
arXiv:2608.14399 76 14 авг. 2026 г. FREE

Слепое пятно ИИ: имена людей меняют выбор LLM, но модель никогда не признаётся в этом

КЛЮЧЕВАЯ СУТЬ
Модель выбирает врача по имени, а в объяснении об этом — ни слова: демографию она упомянула меньше чем в 0.03% ответов. Метод аудита позволяет вскрыть скрытое влияние имени на выбор LLM между людьми — до того как оно испортит подбор врача, найм или выбор подрядчика. Семь моделей сравнивали пять карточек врачей с одинаковой специализацией: рейтинг и цена работали ожидаемо (рост с 3.9 до 4.7 = +31 пункт выбора), но женские и «не-белые» имена получали на 1-3 пункта больше шансов быть выбранными — а модель про это ни слова не сказала в своём объяснении.
Адаптировать под запрос

TL;DR

Исследователи дали семи языковым моделям карточки пяти "врачей" с одинаковой специализацией и разными рейтингами, ценами и именами, которые сигналят пол и этническую принадлежность (Приya Шарма, Джамал Уильямс, Эмили Купер и т.д.). Модель должна была выбрать одного врача — и её выбор можно было разложить на причины: что именно повлияло на решение.

Рейтинг и цена работают предсказуемо: рост рейтинга с 3.9 до 4.7 повышает шанс выбора на 31 процентный пункт, а рост цены на 100 долларов снижает его на 20 пунктов — это ожидаемо. Но неожиданно то, что имя тоже двигает выбор: женские имена и имена, сигналящие латиноамериканское, южноазиатское или чернокожее происхождение, получали на 1–3 пункта больше шансов быть выбранными, чем "белые" мужские имена — то есть обратный перекос относительно классической дискриминации, которую находили в исследованиях с резюме людей. И самое важное: когда модель объясняла свой выбор словами, она упоминала пол или этничность меньше чем в 0.03% ответов. Модель принимает решение на основе имени, но её собственное объяснение об этом ничего не говорит.

Суть находки: нельзя доверять объяснению модели, когда просишь её сравнить людей. Если в тексте есть имя, пол, национальность — модель применит скрытый вес к этому сигналу, и попытка спросить "почему ты выбрала этот вариант" не вскроет этот вес, потому что сама модель не "знает", что учитывала имя.


📌

Схема принципа (как проверить и обойти)

ШАГ 1: Подготовь варианты для сравнения (кандидаты, подрядчики, врачи, поставщики) 
       → замени имена на нейтральные метки: "Вариант А", "Кандидат 1"
ШАГ 2: Попроси LLM выбрать лучший вариант по конкретным критериям
       → получи выбор без канала для скрытой демографической ассоциации
ШАГ 3 (проверка): Прогони то же сравнение С именами — сравни, изменился ли выбор
       → если да, значит имя влияло, хотя модель это не признает в объяснении

🚀

Пример применения

Задача: Вы — владелец малого бизнеса, нанимаете мастера-плиточника через Профи.ру и просите ChatGPT помочь выбрать между пятью анкетами с похожими рейтингами.

Промпт (с рисками скрытого влияния имени):

Вот 5 анкет мастеров с Профи.ру. Выбери лучшего и объясни почему.

1. Дмитрий Соколов — рейтинг 4.8, 120 отзывов, цена 3000₽/м²
2. Азамат Каримов — рейтинг 4.7, 95 отзывов, цена 2800₽/м²
3. Елена Петрова — рейтинг 4.9, 60 отзывов, цена 3200₽/м²
4. Отман Ахмедов — рейтинг 4.6, 200 отзывов, цена 2900₽/м²
5. Сергей Волков — рейтинг 4.8, 40 отзывов, цена 3100₽/м²

Промпт (слепая версия — для проверки/устранения скрытого влияния):

Вот 5 анкет мастеров. Выбери лучшего по цене, рейтингу и количеству отзывов, 
объясни какой критерий сыграл роль. Не упоминай пол или национальность — 
их в анкете нет намеренно.

1. Мастер А — рейтинг 4.8, 120 отзывов, цена 3000₽/м²
2. Мастер Б — рейтинг 4.7, 95 отзывов, цена 2800₽/м²
3. Мастер В — рейтинг 4.9, 60 отзывов, цена 3200₽/м²
4. Мастер Г — рейтинг 4.6, 200 отзывов, цена 2900₽/м²
5. Мастер Д — рейтинг 4.8, 40 отзывов, цена 3100₽/м²

Результат: В первом варианте модель даст выбор и объяснение через рейтинг/цену — но, по данным исследования, реальный выбор может быть смещён именем, о чём модель не упомянет. Во втором варианте канал для скрытого влияния имени закрыт — выбор будет основан только на цифрах в анкете. Сравнив ответы на оба промпта, вы увидите, изменился ли победитель — это и есть сигнал, что имя реально влияло.


🧠

Почему это работает

Модель обучена на огромном массиве текстов, где имена статистически связаны с полом, происхождением, контекстом упоминания. Эта связь зашита в веса модели ещё до того, как она видит ваш конкретный промпт — и модель не может "заметить" эту связь в момент генерации ответа, потому что её объяснение — это отдельный текст, который она пишет после того, как выбор уже сделан на уровне вероятностей.

Модель хорошо умеет объяснять то, что явно указано как критерий (рейтинг, цена — это цифры в тексте, легко на них сослаться). Но она плохо умеет вскрывать implicit-ассоциации, которые сама применила — потому что объяснение генерируется как правдоподобный текст, а не как честный отчёт о внутренних расчётах.

Убирая имя (или заменяя его на нейтральную метку), вы лишаете модель канала, через который скрытая ассоциация могла бы просочиться в выбор. Это не устраняет предвзятость модели в целом — но устраняет её в этой конкретной задаче.

Рычаги, которые можно крутить: - Замени имена на "Вариант А/Б/В" — устраняет демографический канал полностью - Попроси модель сначала проранжировать по каждому критерию отдельно, потом сложить баллы — усиливает опору на явные цифры вместо целостного "ощущения" - Прогони одно и то же сравнение 2-3 раза с разными именами при одинаковых цифрах — если победитель меняется, вы нашли скрытое влияние


⚠️

Ограничения

⚠️ Не устраняет весь bias: Если в тексте остались косвенные демографические сигналы (название вуза, декретный отпуск, хобби, район города), скрытая ассоциация может сработать даже без явного имени.

⚠️ Направление предвзятости непредсказуемо: В этом исследовании модели давали преимущество женским и "не-белым" именам — обратный эффект от классической дискриминации людей. Не считайте, что модель всегда будет дискриминировать в привычную сторону — она может давать перекос в любую сторону, и это отличается между моделями.

⚠️ Явный запрос на честность не помогает: Прямая просьба "объясни, учитывал ли ты пол или национальность" не сработает — модели упоминали демографию в объяснении меньше чем в 0.03% случаев, даже когда она реально влияла на выбор.

⚠️ Модели с цепочкой рассуждений могут ломаться на строгом формате: Одна из проверенных моделей (deepseek-r1) вообще не смогла выдать структурированный ответ — её "размышления" съедали весь лимit текста. Если просите строгий формат (JSON, таблица) от reasoning-модели — тестируйте отдельно.


🔍

Как исследовали

Команда создала синтетические анкеты пяти врачей с одинаковой специализацией, но случайно перемешанными рейтингом, ценой, стажем, откликом на отзывы — и именами, которые по методике исследований дискриминации (та же, что используют для проверки резюме реальных людей) сигналили пол и этническую принадлежность. Семь моделей (шесть открытых + gpt-4o-mini) сделали 40 068 выборов в разных вариациях промпта — с разными персонажами-пациентами, порядком карточек, температурой генерации.

Ключевая деталь дизайна: все атрибуты рандомизировались независимо друг от друга. Это значит, что если имя влияет на выбор, это можно измерить отдельно от влияния рейтинга или цены — обычные "аудиты" ИИ на реальных врачах не могут это разделить, потому что в реальности рейтинг и репутация врача коррелируют с его именем.

Удивление исследователей: они ожидали (по аналогии с человеческой дискриминацией), что модели будут занижать шансы "не-белых" и женских имён. Получилось наоборот — модели их повышали. Вывод для практики: модель не нейтральна и не воспроизводит человеческую предвзятость — она создаёт свою собственную, и заметить её можно только через слепое A/B-сравнение, а не через вопрос "почему ты так решила".


🔗

Ресурсы

Whose doctor does the AI recommend? An algorithm audit of reputation and demographic signals in large language model–assisted physician choice. Syeda Anshrah Gillani (Heidelberg University), Mirza Samad Ahmed Baig (Fandaqah, Al Khobar). Методология опирается на классические correspondence-audit исследования дискриминации по резюме (Bertrand & Mullainathan, 2004) и choice-based conjoint дизайн (Hainmueller et al., 2014).


📋 Дайджест исследования

Ключевая суть

Модель выбирает врача по имени, а в объяснении об этом — ни слова: демографию она упомянула меньше чем в 0.03% ответов. Метод аудита позволяет вскрыть скрытое влияние имени на выбор LLM между людьми — до того как оно испортит подбор врача, найм или выбор подрядчика. Семь моделей сравнивали пять карточек врачей с одинаковой специализацией: рейтинг и цена работали ожидаемо (рост с 3.9 до 4.7 = +31 пункт выбора), но женские и «не-белые» имена получали на 1-3 пункта больше шансов быть выбранными — а модель про это ни слова не сказала в своём объяснении.

Принцип работы

Выбор и объяснение — это два разных процесса внутри модели. Сначала распределение вероятностей до всякого текста решает, кто победил. Потом модель пишет объяснение — правдоподобный текст, а не честный отчёт о том, что реально считалось. Замени имена на «Вариант А/Б/В» — и канал для скрытой ассоциации закрыт. Модель как свидетель, который клянётся, что решил по фактам, но на самом деле среагировал на лицо в толпе — просто сам этого не заметил.

Почему работает

Имена в текстах интернета жёстко связаны с полом и происхождением — эта связь зашита в веса модели задолго до вашего промпта. На явные цифры модель ссылается честно: рейтинг 3.9 против 4.7 дал +31 пункт выбора, и она это проговаривает. А имя двигает выбор на 1-3 пункта — и в объяснении ни слова, потому что текст объяснения пишется уже после того, как выбор сделан на уровне вероятностей. Прямой вопрос «ты учла пол?» тоже не спасает — это разные слои модели, и один не видит другой.

Когда применять

Сравнение людей через LLM → подбор врача, найм сотрудников, выбор подрядчика, ранжирование резюме или анкет — особенно когда в карточках есть имена, фото или другие демографические намёки. НЕ используйте как единственную проверку для reasoning-моделей (типа deepseek-r1) — жёсткий формат ответа (JSON, таблица) может сломать вывод модели целиком.

Мини-рецепт

1. Подготовь карточки: замени реальные имена на нейтральные метки — «Вариант А», «Мастер Б», «Кандидат 1».
2. Прогони слепую версию: попроси LLM выбрать лучшего по конкретным цифрам (рейтинг, цена, отзывы) без имён.
3. Прогони версию с именами: тот же промпт, те же цифры, но с реальными именами кандидатов.
4. Сравни победителей: если результат изменился — имя реально влияло, хотя модель не признается в этом в объяснении.
5. Раздели оценку по этапам: сначала попроси ранжировать отдельно по каждому критерию, потом сложить баллы — так модель меньше опирается на «общее ощущение» от карточки.

Примеры

[ПЛОХО] : Вот 5 анкет мастеров с именами и рейтингами. Выбери лучшего и объясни почему.
[ХОРОШО] : Вот 5 анкет мастеров без имён (Мастер А, Б, В, Г, Д) с рейтингом, количеством отзывов и ценой. Выбери лучшего только по этим трём критериям и укажи, какой сыграл решающую роль. Прогони тот же список с реальными именами и сравни, изменился ли победитель.
Источник: Whose doctor does the AI recommend? An algorithm audit of reputation and demographic signals in LLM-assisted physician choice
ArXiv ID: 2608.14399 | Сгенерировано: 2026-08-17 05:22

Проблемы LLM

ПроблемаСутьКак обойти
Объяснение модели не раскрывает скрытое влияние имениПросишь модель сравнить людей (кандидатов, врачей, мастеров) и выбрать лучшего. Если в карточках есть имена — пол и происхождение сдвигают выбор на несколько пунктов. Но в объяснении модель почти никогда об этом не пишет. Даже прямой вопрос "учла ли ты пол или национальность" не помогает — упоминание демографии в ответе почти нулевоеУбери имена из карточек. Замени на "Вариант А", "Кандидат 1". Так исчезает канал, через который скрытая ассоциация может повлиять на выбор

Методы

МетодСуть
Слепое сравнение — нейтральные метки вместо имёнПеред тем как просить модель выбрать лучший вариант из списка людей, замени все имена на "Вариант А/Б/В" или "Кандидат 1/2/3". Мастер А — рейтинг 4.8... вместо Дмитрий Соколов — рейтинг 4.8.... Работает потому что модель может использовать только то, что явно есть в тексте — а демографического сигнала там больше нет. Применяй когда сравниваешь людей по объективным критериям (цена, рейтинг, стаж). Не работает если критерии сами по себе субъективны (например "кто вызывает больше доверия по фото")
Раздельное ранжирование по критериямНе проси модель сразу выбрать "лучшего". Сначала попроси проранжировать всех кандидатов по каждому критерию отдельно (цена, рейтинг, отзывы), затем сложить баллы. Работает потому что модель опирается на явные цифры, когда сравнивает по одному параметру, и меньше "ощущает" вариант целиком — а целостное впечатление и есть канал для скрытых ассоциаций. Применяй при сравнении 3+ вариантов с числовыми параметрами. Не работает если критерии не числовые

Тезисы

ТезисКомментарий
Объяснение модели — текст после решения, а не отчёт о причинахМодель сначала выбирает вариант на уровне вероятностей, потом отдельно генерирует правдоподобное объяснение. Эти два процесса не связаны напрямую — поэтому объяснение честно называет явные цифры (цену, рейтинг), но не called скрытые ассоциации по имени, полу, происхождению. Применяй: не доверяй объяснению модели как источнику правды о её реальных весах. Проверяй решение, а не текст комментария к нему
📖 Простыми словами

Whose doctor does theAIrecommend? An algorithm audit of reputation and demographic signals inlargelanguagemodel-assisted physician choice

arXiv: 2608.14399

AI-ассистенты выбирают специалистов не по логике здравого смысла, а по скрытым статистическим связям, которые они впитали вместе с интернетом. Когда ты просишь модель выбрать врача или мастера, она не просто сравнивает цифры в карточках, она пропускает их через глубинные веса, где имена и фамилии намертво сцеплены с полом и происхождением. Проблема в том, что этот выбор происходит на уровне математических вероятностей еще до того, как модель начнет «думать» над твоим промптом, превращая объективный анализ в алгоритмическую лотерею.

Это как если бы ты пришел в отдел кадров, а HR-менеджер принимал решение, подбрасывая монетку, на которой с одной стороны написано «Эмили», а с другой — «Джамал». При этом менеджер искренне верит, что изучает дипломы и стаж, хотя на самом деле его рука дергается в сторону определенной фамилии просто потому, что он привык видеть её в определенном контексте. Формально всё честно, но по факту решение принято за доли секунды до того, как открыли папку с документами.

Исследователи проверили это на семи моделях, подсунув им карточки врачей с разными именами, ценами и рейтингами. Выяснилось, что демографические сигналы (имя Прия Шарма или Джамал Уильямс) перевешивают сухие факты. Модели систематически лажают, отдавая предпочтение одним группам и игнорируя другие, даже если у «неугодного» кандидата лучше отзывы или ниже цена. Самое паршивое, что галлюцинация рациональности заставляет ИИ придумывать логичные оправдания своему предвзятому выбору уже после того, как он был сделан.

Этот принцип работает везде, где есть выбор между людьми: от найма плиточника на маркетплейсе до подбора юриста или репетитора. Тестировали на врачах, но алгоритмическая предвзятость универсальна — она вылезет в любом сервисе, где ChatGPT или Gemini помогают пользователю принять решение. SEO для людей здесь бессильно, потому что модель реагирует на культурный код, зашитый в имени, а не на количество ключевых слов в описании профиля.

Короче: нельзя слепо доверять советам AI в вопросах, где замешаны люди, потому что его «объективность» — это красивая обертка над системным перекосом. Если хочешь реально честный выбор, придется проверять кандидатов самому, иначе ты просто делегируешь свои решения цифровым стереотипам. Модель всегда найдет способ объяснить, почему «Эмили лучше», даже если Джамал объективно круче как профи — и это главный облом текущих технологий.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с