3,583 papers
arXiv:2608.06085 76 6 авг. 2026 г. FREE

Разоблачённые метки: LLM продолжают следовать нерелевантному контексту, даже если явно сказать что он случайный

КЛЮЧЕВАЯ СУТЬ
Скажи модели «эта страна случайна, не обращай внимания» — она всё равно потянет ответ к стереотипам об этой стране, почти как без предупреждения вообще. Метод из статьи не техника, а диагностика: она показывает — удалить нерелевантный атрибут из промпта работает надёжнее, чем попросить модель его игнорировать. Причина в том, что модель реагирует на присутствие слова в тексте, а не на логическую команду его выкинуть — паттерн «упомянута Франция → похоже на французов» выучен на миллионах примеров и глушит любую оговорку про случайность.
Адаптировать под запрос

Модели предсказывают неизвестный ответ человека по его прошлым ответам. Исследователи добавляли в промпт метку "страна опроса" — иногда настоящую, иногда случайную — и смотрели, куда сдвигается прогноз. Даже когда модели прямо написали "эта страна выбрана случайно и никак не связана с записью", прогноз всё равно смещался в сторону этой страны почти так же сильно, как без предупреждения.

Причина проста: модель реагирует на присутствие информации в тексте, а не на логическую инструкцию её игнорировать. Если в промпте написано "Франция" — модель начинает тянуть ответ к французским стереотипам, и объяснение "это случайность, не обращай внимания" работает слабо. Это как если вы скажете человеку "забудь про число 40, которое я только что назвал" — число уже засело в голове и влияет на оценку.

Метод в статье не техника, а диагностика: сравнили четыре условия — без метки страны, случайная страна без пояснений, случайная страна с явным пояснением "выбрана случайно", и настоящая страна. Оказалось: настоящая релевантная метка реально повышает точность прогноза, а случайная — тянет ответ в свою сторону без всякой пользы, и предупреждение о её случайности почти не помогает.

🔍

Схема эксперимента

УСЛОВИЕ 1 (M0): Промпт без страны → базовый прогноз
УСЛОВИЕ 2 (MO): Промпт со случайной страной, без объяснений → прогноз сдвигается к этой стране
УСЛОВИЕ 3 (MR): Промпт со случайной страной + фраза "выбрана случайно, не связана с записью" → прогноз сдвигается почти так же, как в Условии 2
УСЛОВИЕ 4 (MV): Промпт с настоящей страной опроса → прогноз становится точнее (Brier loss ниже)

Все четыре промпта — отдельные независимые запросы с одинаковыми фактами о человеке, отличается только блок про страну.


🚀

Пример применения

Задача: Маркетолог собирает персоны клиентов для настройки рекламы и просит LLM спрогнозировать, купит ли условный клиент премиум-подписку сервиса, зная его прошлое поведение (10 фактов о покупках).

Промпт (вариант с "обезвреженной" меткой):

Вот данные о клиенте: [10 фактов о его прошлых покупках].

Регион клиента был выбран случайным образом для тестирования системы 
и не связан с реальным профилем этого клиента: Сибирь.

Оцени вероятность (в %), что клиент оформит подписку на премиум-тариф.

Результат: Даже с явной оговоркой "регион случайный", модель скорее всего выдаст оценку, смещённую в сторону стереотипов о жителях Сибири (например, ниже вероятность подписки на "премиум", если модель ассоциирует регион с меньшим доходом). Пояснение "не связано с профилем" почти не снизит этот сдвиг по сравнению с промптом без пояснения вообще.


🧠

Почему это работает

Модель не умеет по-настоящему выкидывать информацию из "рабочей памяти" промпта по команде. Инструкция "игнорируй это" — тоже текст, и она конкурирует с паттерном "в тексте есть слово Франция → ответ должен быть похож на французский" — а этот паттерн выучен на миллионах примеров и часто сильнее логической оговорки.

Сильная сторона модели — она отлично использует релевантный контекст: когда страна была настоящей, точность прогноза реально росла. Проблема не в том, что модель "не умеет" работать с метаданными — а в том, что она не различает "информация полезна" и "информация случайна, но упомянута".

Рычаг управления: если вы не хотите, чтобы модель цеплялась за атрибут (пол, город, возраст, профессию) — не пишите инструкцию "игнорируй X". Вместо этого вообще не включайте X в промпт, если он не нужен для задачи. Удаление информации работает надёжнее, чем просьба её не учитывать.


⚠️

Ограничения

⚠️ Область теста: метод проверен только на предсказании ответов в социологических опросах (согласие/несогласие с формулировками). Неизвестно, так же ли ведёт себя модель в свободных текстовых задачах.

⚠️ Статистическая неопределённость: эффект "снижения смещения через объяснение" (disclosure attenuation) имеет широкий доверительный интервал, включающий и ноль, и небольшой положительный эффект — то есть по некоторым моделям пояснение могло сработать, но статистика этого не подтверждает уверенно.

⚠️ Формат ответа: модели выдавали вероятности по вариантам ответа (проценты), а не свободный текст — поведение при генерации текста может отличаться.


🔍

Как исследовали

Исследователи взяли международный опрос EVS/WVS 2017–2022 (156 тысяч анкет из шести стран: Китай, Франция, Британия, Италия, Иордания, США) и построили задачу: показать модели 10 ответов анонимного человека, попросить угадать его ответы на 7 других вопросов. Проверили пять моделей (DeepSeek, Gemini, Mistral, GPT, Qwen) на двух непересекающихся наборах записей — 504 и 72 анкеты.

Ключевая деталь дизайна: страну для каждой анкеты либо не показывали, либо показывали случайную (с пояснением или без), либо показывали настоящую — и сравнивали, куда сдвигается прогноз (используя независимые данные о реальных распределениях ответов по странам) и насколько точнее он становится (через ошибку Брайера — метрику точности вероятностных прогнозов).

Удивительный результат: разница между "случайная метка без объяснений" и "случайная метка с явным объяснением что она случайна" оказалась почти нулевой (0.0003 — статистически не отличается от нуля). При этом настоящая страна реально снижала ошибку прогноза. Вывод: модель одинаково доверяет метке независимо от того, предупредили её о её случайности или нет — предупреждение работает не как выключатель, а скорее как шум.


📋 Дайджест исследования

Ключевая суть

Скажи модели «эта страна случайна, не обращай внимания» — она всё равно потянет ответ к стереотипам об этой стране, почти как без предупреждения вообще. Метод из статьи не техника, а диагностика: она показывает — удалить нерелевантный атрибут из промпта работает надёжнее, чем попросить модель его игнорировать. Причина в том, что модель реагирует на присутствие слова в тексте, а не на логическую команду его выкинуть — паттерн «упомянута Франция → похоже на французов» выучен на миллионах примеров и глушит любую оговорку про случайность.

Принцип работы

Инструкция «игнорируй» — тоже просто текст. Она конкурирует с выученным паттерном «в промпте есть атрибут → ответ должен быть похож на него» — и обычно проигрывает. Единственный надёжный способ убрать влияние атрибута — не писать его в промпте вообще, а не просить модель сделать вид что не заметила.

Почему работает

Модель — как человек, которому сказали «забудь число 40, которое я только что назвал». Число уже засело в голове и тянет оценку в свою сторону. В тесте на четырёх вариантах промпта: случайная страна с пояснением «выбрана случайно, не связана с записью» смещала прогноз почти так же сильно, как случайная страна без всяких пояснений — статистика не подтвердила уверенное снижение эффекта. Зато настоящая, релевантная метка страны реально снижала ошибку прогноза — модель отлично умеет использовать полезный контекст, просто не различает «полезно» и «просто упомянуто в тексте».

Когда применять

Промпт-инжиниринг → для задач прогноза поведения или мнения человека по профилю (маркетинг, скрининг кандидатов, соцопросы), особенно когда в данных есть демографические поля — пол, город, возраст, — не влияющие на исход задачи. НЕ подходит как готовое решение для свободной текстовой генерации: метод проверен только на прогнозах с вероятностями в процентах, поведение модели при свободном ответе не изучено.

Мини-рецепт

1. Проверь атрибут: реально нужен он для задачи или просто оказался в исходных данных клиента.
2. Если не нужен — вырежь его полностью: убери поле из промпта, не пиши «игнорируй пол/город/возраст».
3. Если нужен — оставь как есть: релевантный контекст повышает точность, а не создаёт лишний шум.
4. Проверь на A/B: сравни прогнозы с полем и без него — если ответы сильно расходятся на нерелевантных полях, модель за них цепляется.

Примеры

[ПЛОХО] : Вот данные о клиенте: [10 фактов о покупках]. Регион был выбран случайно и не связан с профилем: Сибирь. Оцени вероятность подписки на премиум.
[ХОРОШО] : Вот данные о клиенте: [10 фактов о покупках, без упоминания региона]. Оцени вероятность подписки на премиум-тариф.
Источник: Signal or Spurious Cue? A Randomized Audit of Survey-Country Metadata in LLM Social Inference
ArXiv ID: 2608.06085 | Сгенерировано: 2026-08-07 04:24

Проблемы LLM

ПроблемаСутьКак обойти
Инструкция «игнорируй эту деталь» почти не работаетУпоминаешь в промпте атрибут (страна, пол, возраст) и пишешь «это случайно, не обращай внимания». Модель всё равно смещает ответ в сторону этого атрибута — почти так же сильно, как без предупреждения. Проблема для любой задачи, где в контекст попадают лишние демографические или ситуативные деталиНе пиши инструкцию «игнорируй X». Просто убери X из промпта, если он не нужен для задачи. Удаление работает надёжнее просьбы не учитывать

Тезисы

ТезисКомментарий
Присутствие информации в тексте влияет сильнее, чем логическая команда её не учитыватьМодель реагирует на то, что слово физически есть в промпте, а не на инструкцию рядом с ним. Упоминание «Франция» запускает выученную ассоциацию с французскими стереотипами — этот паттерн выучен на огромном объёме данных и сильнее короткой оговорки «это случайность». Логическая инструкция — это просто ещё один кусок текста, который конкурирует с более сильным паттерном, а не отменяет его. Применяй: если атрибут не несёт пользы для ответа — не упоминай его вообще, а не пытайся «обезвредить» пояснением
📖 Простыми словами

Signal or Spurious Cue? A Randomized Audit of Survey-Country Metadata inLLMSocial Inference

arXiv: 2608.06085

LLM не умеют по-настоящему фильтровать информацию, которую ты им скармливаешь. Если в промпте есть хоть какая-то зацепка, например, название страны, модель вцепится в неё мертвой хваткой, даже если ты трижды попросишь этого не делать. Это фундаментальный баг архитектуры: для нейронки метаданные — это не просто контекст, а мощнейший триггер, который перебивает логику. Модель работает на ассоциациях, и если она видит слово Франция, у неё в голове мгновенно всплывает весь культурный пласт, связанный с этой страной, который она впитывала на терабайтах текстов.

Это как если бы ты пришел к врачу, а он, увидев твою футболку с логотипом рок-группы, начал бы лечить тебя от алкоголизма, полностью игнорируя жалобы на колено. Ты ему говоришь: "Доктор, забудьте про футболку, у меня связки болят", а он всё равно ищет у тебя симптомы похмелья, потому что в его голове стереотип сильнее реальности. Модель ведет себя точно так же: она не может развидеть то, что уже прочитала, и подгоняет ответ под ожидания, которые сама же себе и придумала на основе лишних данных.

В исследовании это проверили через социальный инференс: когда модели давали данные о поведении людей и просили сделать прогноз, простое упоминание страны проживания ломало всю объективность. Работает это так: ложный сигнал (название страны) вступает в конфликт с инструкцией игнорирования, и инструкция почти всегда проигрывает. Даже если ты добавишь в промпт жесткое условие "не учитывай гражданство при оценке", модель всё равно выдаст результат, пропитанный стереотипами об этой нации, просто потому что этот паттерн прошит в её весах глубже, чем твоя сиюминутная просьба.

Этот принцип универсален и касается не только стран. Тестировали на социологии, но это полный провал для любого скоринга, маркетинга или HR-аналитики через AI. Если ты просишь ChatGPT оценить кандидата на работу или предсказать покупку товара, подмешивая в описание возраст, пол или локацию — ты получаешь не аналитику, а галлюцинацию на основе предрассудков. Модель будет выдавать тебе то, что "принято" думать о таких людях, а не то, что следует из их реальных действий.

Короче: если хочешь от LLM объективного прогноза, вырезай все лишние метаданные еще до того, как отправишь промпт. Не надейся на текстовые запреты — они не работают, когда на другой чаше весов лежат миллионы выученных ассоциаций. Либо ты подаешь на вход только чистые факты, либо получаешь цифровое гадание на кофейной гуще, где результат зависит от того, какой стереотип у модели сработал на слово Германия или Китай. Кто не чистит данные, тот получает мусор на выходе, даже если использует самую умную модель в мире.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с