TL;DR
Исследователи дали семи языковым моделям карточки пяти "врачей" с одинаковой специализацией и разными рейтингами, ценами и именами, которые сигналят пол и этническую принадлежность (Приya Шарма, Джамал Уильямс, Эмили Купер и т.д.). Модель должна была выбрать одного врача — и её выбор можно было разложить на причины: что именно повлияло на решение.
Рейтинг и цена работают предсказуемо: рост рейтинга с 3.9 до 4.7 повышает шанс выбора на 31 процентный пункт, а рост цены на 100 долларов снижает его на 20 пунктов — это ожидаемо. Но неожиданно то, что имя тоже двигает выбор: женские имена и имена, сигналящие латиноамериканское, южноазиатское или чернокожее происхождение, получали на 1–3 пункта больше шансов быть выбранными, чем "белые" мужские имена — то есть обратный перекос относительно классической дискриминации, которую находили в исследованиях с резюме людей. И самое важное: когда модель объясняла свой выбор словами, она упоминала пол или этничность меньше чем в 0.03% ответов. Модель принимает решение на основе имени, но её собственное объяснение об этом ничего не говорит.
Суть находки: нельзя доверять объяснению модели, когда просишь её сравнить людей. Если в тексте есть имя, пол, национальность — модель применит скрытый вес к этому сигналу, и попытка спросить "почему ты выбрала этот вариант" не вскроет этот вес, потому что сама модель не "знает", что учитывала имя.
Схема принципа (как проверить и обойти)
ШАГ 1: Подготовь варианты для сравнения (кандидаты, подрядчики, врачи, поставщики)
→ замени имена на нейтральные метки: "Вариант А", "Кандидат 1"
ШАГ 2: Попроси LLM выбрать лучший вариант по конкретным критериям
→ получи выбор без канала для скрытой демографической ассоциации
ШАГ 3 (проверка): Прогони то же сравнение С именами — сравни, изменился ли выбор
→ если да, значит имя влияло, хотя модель это не признает в объяснении
Пример применения
Задача: Вы — владелец малого бизнеса, нанимаете мастера-плиточника через Профи.ру и просите ChatGPT помочь выбрать между пятью анкетами с похожими рейтингами.
Промпт (с рисками скрытого влияния имени):
Вот 5 анкет мастеров с Профи.ру. Выбери лучшего и объясни почему.
1. Дмитрий Соколов — рейтинг 4.8, 120 отзывов, цена 3000₽/м²
2. Азамат Каримов — рейтинг 4.7, 95 отзывов, цена 2800₽/м²
3. Елена Петрова — рейтинг 4.9, 60 отзывов, цена 3200₽/м²
4. Отман Ахмедов — рейтинг 4.6, 200 отзывов, цена 2900₽/м²
5. Сергей Волков — рейтинг 4.8, 40 отзывов, цена 3100₽/м²
Промпт (слепая версия — для проверки/устранения скрытого влияния):
Вот 5 анкет мастеров. Выбери лучшего по цене, рейтингу и количеству отзывов,
объясни какой критерий сыграл роль. Не упоминай пол или национальность —
их в анкете нет намеренно.
1. Мастер А — рейтинг 4.8, 120 отзывов, цена 3000₽/м²
2. Мастер Б — рейтинг 4.7, 95 отзывов, цена 2800₽/м²
3. Мастер В — рейтинг 4.9, 60 отзывов, цена 3200₽/м²
4. Мастер Г — рейтинг 4.6, 200 отзывов, цена 2900₽/м²
5. Мастер Д — рейтинг 4.8, 40 отзывов, цена 3100₽/м²
Результат: В первом варианте модель даст выбор и объяснение через рейтинг/цену — но, по данным исследования, реальный выбор может быть смещён именем, о чём модель не упомянет. Во втором варианте канал для скрытого влияния имени закрыт — выбор будет основан только на цифрах в анкете. Сравнив ответы на оба промпта, вы увидите, изменился ли победитель — это и есть сигнал, что имя реально влияло.
Почему это работает
Модель обучена на огромном массиве текстов, где имена статистически связаны с полом, происхождением, контекстом упоминания. Эта связь зашита в веса модели ещё до того, как она видит ваш конкретный промпт — и модель не может "заметить" эту связь в момент генерации ответа, потому что её объяснение — это отдельный текст, который она пишет после того, как выбор уже сделан на уровне вероятностей.
Модель хорошо умеет объяснять то, что явно указано как критерий (рейтинг, цена — это цифры в тексте, легко на них сослаться). Но она плохо умеет вскрывать implicit-ассоциации, которые сама применила — потому что объяснение генерируется как правдоподобный текст, а не как честный отчёт о внутренних расчётах.
Убирая имя (или заменяя его на нейтральную метку), вы лишаете модель канала, через который скрытая ассоциация могла бы просочиться в выбор. Это не устраняет предвзятость модели в целом — но устраняет её в этой конкретной задаче.
Рычаги, которые можно крутить: - Замени имена на "Вариант А/Б/В" — устраняет демографический канал полностью - Попроси модель сначала проранжировать по каждому критерию отдельно, потом сложить баллы — усиливает опору на явные цифры вместо целостного "ощущения" - Прогони одно и то же сравнение 2-3 раза с разными именами при одинаковых цифрах — если победитель меняется, вы нашли скрытое влияние
Ограничения
⚠️ Не устраняет весь bias: Если в тексте остались косвенные демографические сигналы (название вуза, декретный отпуск, хобби, район города), скрытая ассоциация может сработать даже без явного имени.
⚠️ Направление предвзятости непредсказуемо: В этом исследовании модели давали преимущество женским и "не-белым" именам — обратный эффект от классической дискриминации людей. Не считайте, что модель всегда будет дискриминировать в привычную сторону — она может давать перекос в любую сторону, и это отличается между моделями.
⚠️ Явный запрос на честность не помогает: Прямая просьба "объясни, учитывал ли ты пол или национальность" не сработает — модели упоминали демографию в объяснении меньше чем в 0.03% случаев, даже когда она реально влияла на выбор.
⚠️ Модели с цепочкой рассуждений могут ломаться на строгом формате: Одна из проверенных моделей (deepseek-r1) вообще не смогла выдать структурированный ответ — её "размышления" съедали весь лимit текста. Если просите строгий формат (JSON, таблица) от reasoning-модели — тестируйте отдельно.
Как исследовали
Команда создала синтетические анкеты пяти врачей с одинаковой специализацией, но случайно перемешанными рейтингом, ценой, стажем, откликом на отзывы — и именами, которые по методике исследований дискриминации (та же, что используют для проверки резюме реальных людей) сигналили пол и этническую принадлежность. Семь моделей (шесть открытых + gpt-4o-mini) сделали 40 068 выборов в разных вариациях промпта — с разными персонажами-пациентами, порядком карточек, температурой генерации.
Ключевая деталь дизайна: все атрибуты рандомизировались независимо друг от друга. Это значит, что если имя влияет на выбор, это можно измерить отдельно от влияния рейтинга или цены — обычные "аудиты" ИИ на реальных врачах не могут это разделить, потому что в реальности рейтинг и репутация врача коррелируют с его именем.
Удивление исследователей: они ожидали (по аналогии с человеческой дискриминацией), что модели будут занижать шансы "не-белых" и женских имён. Получилось наоборот — модели их повышали. Вывод для практики: модель не нейтральна и не воспроизводит человеческую предвзятость — она создаёт свою собственную, и заметить её можно только через слепое A/B-сравнение, а не через вопрос "почему ты так решила".
Ресурсы
Whose doctor does the AI recommend? An algorithm audit of reputation and demographic signals in large language model–assisted physician choice. Syeda Anshrah Gillani (Heidelberg University), Mirza Samad Ahmed Baig (Fandaqah, Al Khobar). Методология опирается на классические correspondence-audit исследования дискриминации по резюме (Bertrand & Mullainathan, 2004) и choice-based conjoint дизайн (Hainmueller et al., 2014).
