Модели предсказывают неизвестный ответ человека по его прошлым ответам. Исследователи добавляли в промпт метку "страна опроса" — иногда настоящую, иногда случайную — и смотрели, куда сдвигается прогноз. Даже когда модели прямо написали "эта страна выбрана случайно и никак не связана с записью", прогноз всё равно смещался в сторону этой страны почти так же сильно, как без предупреждения.
Причина проста: модель реагирует на присутствие информации в тексте, а не на логическую инструкцию её игнорировать. Если в промпте написано "Франция" — модель начинает тянуть ответ к французским стереотипам, и объяснение "это случайность, не обращай внимания" работает слабо. Это как если вы скажете человеку "забудь про число 40, которое я только что назвал" — число уже засело в голове и влияет на оценку.
Метод в статье не техника, а диагностика: сравнили четыре условия — без метки страны, случайная страна без пояснений, случайная страна с явным пояснением "выбрана случайно", и настоящая страна. Оказалось: настоящая релевантная метка реально повышает точность прогноза, а случайная — тянет ответ в свою сторону без всякой пользы, и предупреждение о её случайности почти не помогает.
Схема эксперимента
УСЛОВИЕ 1 (M0): Промпт без страны → базовый прогноз
УСЛОВИЕ 2 (MO): Промпт со случайной страной, без объяснений → прогноз сдвигается к этой стране
УСЛОВИЕ 3 (MR): Промпт со случайной страной + фраза "выбрана случайно, не связана с записью" → прогноз сдвигается почти так же, как в Условии 2
УСЛОВИЕ 4 (MV): Промпт с настоящей страной опроса → прогноз становится точнее (Brier loss ниже)
Все четыре промпта — отдельные независимые запросы с одинаковыми фактами о человеке, отличается только блок про страну.
Пример применения
Задача: Маркетолог собирает персоны клиентов для настройки рекламы и просит LLM спрогнозировать, купит ли условный клиент премиум-подписку сервиса, зная его прошлое поведение (10 фактов о покупках).
Промпт (вариант с "обезвреженной" меткой):
Вот данные о клиенте: [10 фактов о его прошлых покупках].
Регион клиента был выбран случайным образом для тестирования системы
и не связан с реальным профилем этого клиента: Сибирь.
Оцени вероятность (в %), что клиент оформит подписку на премиум-тариф.
Результат: Даже с явной оговоркой "регион случайный", модель скорее всего выдаст оценку, смещённую в сторону стереотипов о жителях Сибири (например, ниже вероятность подписки на "премиум", если модель ассоциирует регион с меньшим доходом). Пояснение "не связано с профилем" почти не снизит этот сдвиг по сравнению с промптом без пояснения вообще.
Почему это работает
Модель не умеет по-настоящему выкидывать информацию из "рабочей памяти" промпта по команде. Инструкция "игнорируй это" — тоже текст, и она конкурирует с паттерном "в тексте есть слово Франция → ответ должен быть похож на французский" — а этот паттерн выучен на миллионах примеров и часто сильнее логической оговорки.
Сильная сторона модели — она отлично использует релевантный контекст: когда страна была настоящей, точность прогноза реально росла. Проблема не в том, что модель "не умеет" работать с метаданными — а в том, что она не различает "информация полезна" и "информация случайна, но упомянута".
Рычаг управления: если вы не хотите, чтобы модель цеплялась за атрибут (пол, город, возраст, профессию) — не пишите инструкцию "игнорируй X". Вместо этого вообще не включайте X в промпт, если он не нужен для задачи. Удаление информации работает надёжнее, чем просьба её не учитывать.
Ограничения
⚠️ Область теста: метод проверен только на предсказании ответов в социологических опросах (согласие/несогласие с формулировками). Неизвестно, так же ли ведёт себя модель в свободных текстовых задачах.
⚠️ Статистическая неопределённость: эффект "снижения смещения через объяснение" (disclosure attenuation) имеет широкий доверительный интервал, включающий и ноль, и небольшой положительный эффект — то есть по некоторым моделям пояснение могло сработать, но статистика этого не подтверждает уверенно.
⚠️ Формат ответа: модели выдавали вероятности по вариантам ответа (проценты), а не свободный текст — поведение при генерации текста может отличаться.
Как исследовали
Исследователи взяли международный опрос EVS/WVS 2017–2022 (156 тысяч анкет из шести стран: Китай, Франция, Британия, Италия, Иордания, США) и построили задачу: показать модели 10 ответов анонимного человека, попросить угадать его ответы на 7 других вопросов. Проверили пять моделей (DeepSeek, Gemini, Mistral, GPT, Qwen) на двух непересекающихся наборах записей — 504 и 72 анкеты.
Ключевая деталь дизайна: страну для каждой анкеты либо не показывали, либо показывали случайную (с пояснением или без), либо показывали настоящую — и сравнивали, куда сдвигается прогноз (используя независимые данные о реальных распределениях ответов по странам) и насколько точнее он становится (через ошибку Брайера — метрику точности вероятностных прогнозов).
Удивительный результат: разница между "случайная метка без объяснений" и "случайная метка с явным объяснением что она случайна" оказалась почти нулевой (0.0003 — статистически не отличается от нуля). При этом настоящая страна реально снижала ошибку прогноза. Вывод: модель одинаково доверяет метке независимо от того, предупредили её о её случайности или нет — предупреждение работает не как выключатель, а скорее как шум.
