TL;DR
Если добавить к медицинскому вопросу одну фразу вроде «учти многообразие, справедливость и инклюзивность (DEI) при ответе», модель начинает придумывать расу, доход или социальный статус пациента, хотя вопрос об этом молчал. Она встраивает выдуманные детали в рассуждение, как будто они были в условии задачи с самого начала.
Без такой фразы модель выдумывает демографию пациента в 0,7% ответов. С фразой про DEI — в 33% ответов, рост в 47 раз, и это происходит абсолютно во всех 47 протестированных моделях, от GPT-5 до маленьких открытых моделей. Причина не в том, что к вопросу приписали лишний текст (это отдельно проверили) — дело именно в содержании про равенство, которое тянет за собой демографические ассоциации из обучающих данных. Большинство добавленного безобидно — общая статистика типа «это чаще встречается у...» — но в 0,25–2,4% случаев модель приписывает выдуманную черту конкретно этому пациенту и меняет выбранный диагноз, причём в 99,8% таких случаев — на неправильный.
Причина в том, что в текстах, на которых модель учили, разговоры про равенство почти всегда идут рядом с упоминанием расы, пола, дохода — и любая инструкция «учти справедливость» включает этот шаблон, даже без демографических данных в вопросе. Это касается не только DEI: любая рамочная инструкция («учти стоимость», «учти юридические риски») может так же заставить модель добавить невысказанные детали и незаметно на них опереться.
Схема механизма
УСЛОВИЕ: вопрос без демографических данных + фраза «учти многообразие/справедливость»
↓
ШАГ 1: Модель добавляет демографическую статистику → 33% ответов (против 0,7% без фразы)
ШАГ 2: В большинстве случаев (91%) это безобидное общее утверждение → ответ не меняется
ШАГ 3: В 0,25–2,4% случаев модель «приклеивает» выдуманную черту к конкретному пациенту → выбор ответа меняется
ШАГ 4: 99,8% таких изменений — в сторону НЕВЕРНОГО ответа
Пример применения
Задача: HR-менеджер загружает в ChatGPT анонимное описание двух кандидатов на позицию тимлида (без имени, фото, национальности) и просит помочь выбрать, кого повысить, добавляя «учти принципы многообразия и инклюзивности при оценке».
Промпт (рискованный вариант):
Вот два кандидата на позицию руководителя отдела:
Кандидат А: 6 лет в компании, ведёт 3 проекта, средние оценки по soft skills,
сильный технический бэкграунд.
Кандидат Б: 2 года в компании, ведёт 1 крупный проект, высокие оценки
по soft skills, слабее в технике.
При оценке учти принципы diversity, equity and inclusion.
Результат: По механике из исследования модель с высокой вероятностью начнёт вписывать в рассуждение предположения о происхождении, поле или возрасте кандидатов — деталей, которых в описании не было. В большинстве случаев это будет безобидная фоновая фраза, не влияющая на вывод. Но есть шанс (по данным исследования — доли процента, но не ноль), что придуманная деталь «прилипнет» к конкретному кандидату и сдвинет итоговую рекомендацию — причём куда чаще в сторону ошибочного выбора, чем правильного.
Почему это работает
Модель не различает «статистический факт про категорию людей» и «факт про конкретного человека из вопроса» — она смешивает эпидемиологию с описанием случая, потому что в обучающих текстах эти вещи почти всегда стоят рядом.
Модель хорошо ловит языковые паттерны: увидев триггер «diversity/equity» в инструкции, она вытягивает весь связанный кластер ассоциаций — расу, доход, доступ к медицине — просто потому что так эти темы обычно обсуждаются в текстах, на которых её обучали.
Рычаги, которые меняют силу эффекта: - Формулировка инструкции → короткая фраза про равенство даёт ~14% инъекции, подробная «социально-детерминантная» формулировка — до 56%. Чем компактнее и конкретнее рамочная инструкция, тем меньше риск. - Любая рамочная инструкция, не только DEI — «учти стоимость», «учти юридические риски» — по логике механизма несёт тот же риск, просто не проверялась авторами напрямую.
💡 Практический вывод: если добавляете к промпту любую инструкцию «учти X при оценке» для реального кейса (медицина, HR, юридический разбор, кредитный скоринг), явно зафиксируйте границы данных:
«Используй только факты, указанные выше. Не добавляй и не предполагай возраст, пол, расу, доход, социальный статус и другие характеристики, которые не были явно названы. Если данных не хватает — прямо скажи об этом.»
Это логическое следствие из найденного механизма, а не протестированный авторами фикс — но оно напрямую блокирует путь, по которому уходит инъекция.
Ограничения
⚠️ Проверяли только DEI-формулировки: гипотеза про «любую рамочную инструкцию» логически вытекает из механизма, но напрямую авторы тестировали именно фразы про равенство и многообразие.
⚠️ Цифры про «изменение ответа» — консервативная нижняя оценка: авторы специально использовали методику, которая скорее недооценивает долю случаев, где выдумка меняет ответ, чем переоценивает.
⚠️ Тестировали только тесты с выбором ответа: MedQA, MedMCQA, MMLU-medical, PubMedQA — это форматы «выбери один из вариантов» или «да/нет/может быть». Неизвестно, ведёт ли себя модель так же в свободной консультации без готовых вариантов ответа.
⚠️ Механизм — гипотеза, не доказанный факт: авторы предполагают, что модель тянет ассоциацию «равенство ↔ демография» из обучающих текстов, но не проверяли это напрямую через анализ внутренних активаций модели.
⚠️ Защитная фраза-антидот не тестировалась в исследовании: предложение добавлять «не придумывай неуказанные факты» — наша логическая экстраполяция из найденного механизма, а не результат, который авторы проверили экспериментально.
Как исследовали
Исследователи взяли 47 моделей — от топовых закрытых (GPT-5, Claude Sonnet 4.6) до маленьких открытых (Llama-3-8B) и даже медицинских дообученных (OpenBioLLM) — и прогнали через них 500 вопросов из четырёх медицинских тестов в четырёх вариантах: без добавок, с бессмысленной добавкой, с нейтральной клинической добавкой той же длины и с DEI-фразой. Получилось 376 000 ответов.
Ключевой трюк дизайна — «нейтральная добавка той же длины»: она нужна, чтобы доказать, что дело не в лишнем тексте самом по себе, а конкретно в содержании про равенство. Это сработало: DEI-фраза обгоняла нейтральный контроль в 18 раз.
Чтобы найти, где модель что-то придумала, использовали двухступенчатую систему судей: быстрый ИИ-судья находил подозрительные ответы, точный арбитр (Claude Sonnet 4.6) их перепроверял — поэтому итоговые цифры про «изменение ответа» скорее занижены.
Удивительно, что эффект проявился буквально во всех 47 моделях без исключения — включая модели, специально дообученные на медицине (у них инъекция ниже, 19% против 49% у топовых закрытых моделей, но не исчезает совсем). И формулировка самой фразы решает почти всё: короткая версия давала 14% инъекции, подробная «социально-детерминантная» — 56%.
Ресурсы
Demographic Injection in Medical Language Models under Diversity, Equity, and Inclusion Prompts — Diego Mardian, Frank Liu, Arizona State University. Тесты: MedQA, MedMCQA, MMLU-medical, PubMedQA. Судьи: gemini-3.1-flash-lite (первичный отбор), claude-sonnet-4-6 (точный арбитр).
