3,583 papers
arXiv:2608.15254 80 15 авг. 2026 г. FREE

Demographic Injection: фраза про многообразие заставляет ИИ выдумывать расу и доход пациента, которых в вопросе не было

КЛЮЧЕВАЯ СУТЬ
Одна фраза «учти многообразие» — и модель начинает выдумывать расу пациента, которой не было в вопросе. Разбор Demographic Injection показывает, когда инструкция про равенство заставляет ИИ подмешивать несуществующие детали — и как заблокировать это одной строкой в промпте. Без фразы модель выдумывает демографию в 0,7% ответов, с фразой про DEI — в 33%, скачок в 47 раз. Модель путает общую статистику про категорию людей с фактом про конкретного человека из вопроса — и в 99,8% случаев, когда выдумка меняет ответ, ответ становится неправильным. Эффект подтвердился на всех 47 протестированных моделях, от GPT-5 до маленьких открытых.
Адаптировать под запрос

TL;DR

Если добавить к медицинскому вопросу одну фразу вроде «учти многообразие, справедливость и инклюзивность (DEI) при ответе», модель начинает придумывать расу, доход или социальный статус пациента, хотя вопрос об этом молчал. Она встраивает выдуманные детали в рассуждение, как будто они были в условии задачи с самого начала.

Без такой фразы модель выдумывает демографию пациента в 0,7% ответов. С фразой про DEI — в 33% ответов, рост в 47 раз, и это происходит абсолютно во всех 47 протестированных моделях, от GPT-5 до маленьких открытых моделей. Причина не в том, что к вопросу приписали лишний текст (это отдельно проверили) — дело именно в содержании про равенство, которое тянет за собой демографические ассоциации из обучающих данных. Большинство добавленного безобидно — общая статистика типа «это чаще встречается у...» — но в 0,25–2,4% случаев модель приписывает выдуманную черту конкретно этому пациенту и меняет выбранный диагноз, причём в 99,8% таких случаев — на неправильный.

Причина в том, что в текстах, на которых модель учили, разговоры про равенство почти всегда идут рядом с упоминанием расы, пола, дохода — и любая инструкция «учти справедливость» включает этот шаблон, даже без демографических данных в вопросе. Это касается не только DEI: любая рамочная инструкция («учти стоимость», «учти юридические риски») может так же заставить модель добавить невысказанные детали и незаметно на них опереться.


🧠

Схема механизма

УСЛОВИЕ: вопрос без демографических данных + фраза «учти многообразие/справедливость»
↓
ШАГ 1: Модель добавляет демографическую статистику → 33% ответов (против 0,7% без фразы)
ШАГ 2: В большинстве случаев (91%) это безобидное общее утверждение → ответ не меняется
ШАГ 3: В 0,25–2,4% случаев модель «приклеивает» выдуманную черту к конкретному пациенту → выбор ответа меняется
ШАГ 4: 99,8% таких изменений — в сторону НЕВЕРНОГО ответа

🚀

Пример применения

Задача: HR-менеджер загружает в ChatGPT анонимное описание двух кандидатов на позицию тимлида (без имени, фото, национальности) и просит помочь выбрать, кого повысить, добавляя «учти принципы многообразия и инклюзивности при оценке».

Промпт (рискованный вариант):

Вот два кандидата на позицию руководителя отдела:

Кандидат А: 6 лет в компании, ведёт 3 проекта, средние оценки по soft skills, 
сильный технический бэкграунд.

Кандидат Б: 2 года в компании, ведёт 1 крупный проект, высокие оценки 
по soft skills, слабее в технике.

При оценке учти принципы diversity, equity and inclusion.

Результат: По механике из исследования модель с высокой вероятностью начнёт вписывать в рассуждение предположения о происхождении, поле или возрасте кандидатов — деталей, которых в описании не было. В большинстве случаев это будет безобидная фоновая фраза, не влияющая на вывод. Но есть шанс (по данным исследования — доли процента, но не ноль), что придуманная деталь «прилипнет» к конкретному кандидату и сдвинет итоговую рекомендацию — причём куда чаще в сторону ошибочного выбора, чем правильного.


🧠

Почему это работает

Модель не различает «статистический факт про категорию людей» и «факт про конкретного человека из вопроса» — она смешивает эпидемиологию с описанием случая, потому что в обучающих текстах эти вещи почти всегда стоят рядом.

Модель хорошо ловит языковые паттерны: увидев триггер «diversity/equity» в инструкции, она вытягивает весь связанный кластер ассоциаций — расу, доход, доступ к медицине — просто потому что так эти темы обычно обсуждаются в текстах, на которых её обучали.

Рычаги, которые меняют силу эффекта: - Формулировка инструкции → короткая фраза про равенство даёт ~14% инъекции, подробная «социально-детерминантная» формулировка — до 56%. Чем компактнее и конкретнее рамочная инструкция, тем меньше риск. - Любая рамочная инструкция, не только DEI — «учти стоимость», «учти юридические риски» — по логике механизма несёт тот же риск, просто не проверялась авторами напрямую.

💡 Практический вывод: если добавляете к промпту любую инструкцию «учти X при оценке» для реального кейса (медицина, HR, юридический разбор, кредитный скоринг), явно зафиксируйте границы данных:

«Используй только факты, указанные выше. Не добавляй и не предполагай возраст, пол, расу, доход, социальный статус и другие характеристики, которые не были явно названы. Если данных не хватает — прямо скажи об этом.»

Это логическое следствие из найденного механизма, а не протестированный авторами фикс — но оно напрямую блокирует путь, по которому уходит инъекция.


⚠️

Ограничения

⚠️ Проверяли только DEI-формулировки: гипотеза про «любую рамочную инструкцию» логически вытекает из механизма, но напрямую авторы тестировали именно фразы про равенство и многообразие.

⚠️ Цифры про «изменение ответа» — консервативная нижняя оценка: авторы специально использовали методику, которая скорее недооценивает долю случаев, где выдумка меняет ответ, чем переоценивает.

⚠️ Тестировали только тесты с выбором ответа: MedQA, MedMCQA, MMLU-medical, PubMedQA — это форматы «выбери один из вариантов» или «да/нет/может быть». Неизвестно, ведёт ли себя модель так же в свободной консультации без готовых вариантов ответа.

⚠️ Механизм — гипотеза, не доказанный факт: авторы предполагают, что модель тянет ассоциацию «равенство ↔ демография» из обучающих текстов, но не проверяли это напрямую через анализ внутренних активаций модели.

⚠️ Защитная фраза-антидот не тестировалась в исследовании: предложение добавлять «не придумывай неуказанные факты» — наша логическая экстраполяция из найденного механизма, а не результат, который авторы проверили экспериментально.


🔍

Как исследовали

Исследователи взяли 47 моделей — от топовых закрытых (GPT-5, Claude Sonnet 4.6) до маленьких открытых (Llama-3-8B) и даже медицинских дообученных (OpenBioLLM) — и прогнали через них 500 вопросов из четырёх медицинских тестов в четырёх вариантах: без добавок, с бессмысленной добавкой, с нейтральной клинической добавкой той же длины и с DEI-фразой. Получилось 376 000 ответов.

Ключевой трюк дизайна — «нейтральная добавка той же длины»: она нужна, чтобы доказать, что дело не в лишнем тексте самом по себе, а конкретно в содержании про равенство. Это сработало: DEI-фраза обгоняла нейтральный контроль в 18 раз.

Чтобы найти, где модель что-то придумала, использовали двухступенчатую систему судей: быстрый ИИ-судья находил подозрительные ответы, точный арбитр (Claude Sonnet 4.6) их перепроверял — поэтому итоговые цифры про «изменение ответа» скорее занижены.

Удивительно, что эффект проявился буквально во всех 47 моделях без исключения — включая модели, специально дообученные на медицине (у них инъекция ниже, 19% против 49% у топовых закрытых моделей, но не исчезает совсем). И формулировка самой фразы решает почти всё: короткая версия давала 14% инъекции, подробная «социально-детерминантная» — 56%.


🔗

Ресурсы

Demographic Injection in Medical Language Models under Diversity, Equity, and Inclusion Prompts — Diego Mardian, Frank Liu, Arizona State University. Тесты: MedQA, MedMCQA, MMLU-medical, PubMedQA. Судьи: gemini-3.1-flash-lite (первичный отбор), claude-sonnet-4-6 (точный арбитр).


📋 Дайджест исследования

Ключевая суть

Одна фраза «учти многообразие» — и модель начинает выдумывать расу пациента, которой не было в вопросе. Разбор Demographic Injection показывает, когда инструкция про равенство заставляет ИИ подмешивать несуществующие детали — и как заблокировать это одной строкой в промпте. Без фразы модель выдумывает демографию в 0,7% ответов, с фразой про DEI — в 33%, скачок в 47 раз. Модель путает общую статистику про категорию людей с фактом про конкретного человека из вопроса — и в 99,8% случаев, когда выдумка меняет ответ, ответ становится неправильным. Эффект подтвердился на всех 47 протестированных моделях, от GPT-5 до маленьких открытых.

Принцип работы

Механика простая: триггер-слово в инструкции тянет за собой целый кластер ассоциаций из обучающих текстов. Модель видит «diversity/equity» — и достаёт расу, доход, доступ к медицине, даже если в вопросе о них ни слова. Это не баг одной модели — это паттерн, зашитый в данные, на которых учили всех. Короткая фраза про равенство даёт 14% инъекции, подробная «социально-контекстная» формулировка — уже 56%. Чем компактнее инструкция, тем меньше риск.

Почему работает

Модель не различает эпидемиологию и историю болезни конкретного пациента. В текстах, на которых её учили, фразы про равенство почти всегда стоят рядом с расой, полом, доходом — так обычно пишут про DEI в интернете. Модель просто воспроизводит этот шаблон соседства, а не рассуждает про конкретного человека из вопроса. И дело не только в DEI: любая рамочная инструкция типа «учти стоимость» или «учти юридические риски» может по той же логике подтянуть невысказанные детали.

Когда применять

Медицина, HR, юридический разбор, кредитный скоринг → любой промпт с инструкцией «учти X при оценке», где демография в условии не названа явно. Особенно рискованно — подробные социально-контекстные формулировки вместо короткой фразы. Не критично для промптов, где все нужные данные о человеке уже прописаны в условии — там нечему «прилипать».

Мини-рецепт

1. Найди триггер: проверь, есть ли в промпте фраза «учти X при оценке» — DEI, стоимость, юридические риски. 2. Сократи формулировку: короткая фраза про равенство даёт меньше выдумок, чем подробная социально-контекстная. 3. Поставь ограничитель: добавь строку «Используй только факты, указанные выше. Не добавляй предположения о расе, поле, возрасте, доходе и других характеристиках, которые не были явно названы». 4. Перечитай вывод: проверь рассуждение модели — не появилась ли там деталь про пациента или кандидата, которой не было в исходном условии.

Примеры

[ПЛОХО] : При оценке кандидатов учти принципы diversity, equity and inclusion.
[ХОРОШО] : При оценке кандидатов учти принципы многообразия и инклюзивности. Используй только факты, указанные выше. Не добавляй предположения о расе, поле, возрасте или происхождении кандидатов — если данных не хватает, прямо скажи об этом.
Источник: Demographic Injection in Medical Language Models under Diversity, Equity, and Inclusion Prompts
ArXiv ID: 2608.15254 | Сгенерировано: 2026-08-18 05:28

Проблемы LLM

ПроблемаСутьКак обойти
Модель придумывает демографию, которой не было в вопросеДаёшь модели инструкцию типа «учти многообразие/справедливость» без упоминания расы, дохода или пола пациента. Модель сама достраивает эти детали и вставляет в рассуждение, как будто они были в условии с начала. Обычно это безобидная общая статистика, но иногда модель приписывает выдуманную черту конкретно этому человеку — и тогда итоговый ответ почти всегда меняется на неправильный. Работает во всех проверенных моделях, от крупных до маленькихЯвно ограничь модель фразой: «Используй только факты, указанные выше. Не добавляй возраст, пол, расу, доход и другие характеристики, которые явно не названы. Если данных не хватает — скажи об этом прямо»

Методы

МетодСуть
Явная фиксация границ данных — блокирует выдумывание деталейДобавь в конец промпта фразу-барьер: «Не предполагай факты, которых нет в условии. Если чего-то не хватает — укажи это явно, вместо того чтобы додумывать». Почему работает: модель дописывает невысказанные детали, когда видит абстрактную рамочную формулировку («учти справедливость», «учти риски», «учти стоимость») — прямой запрет достраивать факты перекрывает этот путь. Работает для любых задач с оценкой людей или кейсов по описанию (медицина, HR, юридический разбор, кредитный скоринг). Не работает — если сама задача требует общих статистических рассуждений о группах людей

Тезисы

ТезисКомментарий
Абстрактная рамочная фраза тянет за собой целый кластер связанных понятий из обученияКогда в инструкции есть слово-триггер типа «справедливость», «риски», «стоимость» — модель вспоминает не только это слово, а весь набор тем, которые обычно стоят рядом с ним в текстах, на которых её обучали. Для «справедливости» это раса, доход, пол — даже если их не было в вопросе. Механизм универсален: любая абстрактная просьба «учти X» рискует вытащить за собой ассоциированные, но не запрошенные детали. Применяй: если нужна рамочная инструкция — делай её максимально конкретной, а не абстрактной, и явно ограничивай источник данных
📖 Простыми словами

Demographic Injection in MedicalLanguageModelsunder Diversity, Equity, and InclusionPrompts

arXiv: 2608.15254

Суть проблемы в том, что современные нейронки страдают галлюцинациями на почве вежливости. Как только ты просишь модель быть «инклюзивной» или «справедливой» в медицинском вопросе, у неё перемыкает контакты: она начинает выдумывать расу, доход или статус пациента, которых в запросе не было и в помине. Модель не просто дает совет, она достраивает реальность под свои внутренние шаблоны о «социальной справедливости», превращая сухой диагноз в социологическую фантазию.

Это как если бы ты пришел к врачу с жалобой на кашель, а он, вместо того чтобы послушать легкие, начал рассуждать: «Ну, раз вы живете в бедном районе и, скорее всего, недоедаете, то это точно туберкулез». Врач при этом даже не знает, где ты живешь, но он так сильно хочет «учесть контекст», что сам его придумал. В итоге вместо медицины ты получаешь набор стереотипов, завернутых в красивую обертку заботы.

Главный виновник здесь — демографическая инъекция. Модель видит в запросе триггер вроде DEI-принципов и тут же лезет в свою базу данных, где статистика по болезням намертво сшита с социальными группами. Она не понимает разницы между «чернокожие чаще болеют X» и «пациент перед тобой — чернокожий». В итоге нейронка просто вбрасывает выдуманные детали в цепочку рассуждений, как будто они были в условии задачи с самого начала, и строит выводы на этой лжи.

Тестировали это на медицине, но принцип универсален и опасен везде, где есть оценка людей. Будь то HR-отбор, где модель может приписать кандидату «трудное детство» просто ради галочки об инклюзивности, или юридический совет — AI подгоняет ответ под повестку, игнорируя факты. Это классический пример того, как благие намерения разработчиков превращают инструмент в генератор предвзятости, который врет с самым честным видом.

Короче: попытка сделать AI «добрее» через общие инструкции привела к тому, что он начал врать в лицо. Если в медицинском или кадровом промпте есть призыв к «многообразию», жди беды — модель с вероятностью 10 из 10 начнет додумывать за тебя то, чего нет. Пока разработчики не научат модели разделять статистику групп и факты об индивидууме, любые DEI-добавки будут только портить точность и плодить новые стереотипы.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с