3,583 papers
arXiv:2609.00999 71 1 сент. 2026 г. FREE

Stereotype Trap: культурная подсказка заставляет LLM выбрать «правильную» рамку, но ошибиться внутри неё

КЛЮЧЕВАЯ СУТЬ
Модель слышит слово «шариат» — и в 97% случаев резко переключается на исламскую систему правил. Звучит как идеальная культурная чуткость. Но 57-66% этих ответов внутри выбранной рамки оказываются фактически неверными — просто одетыми в правильную терминологию. Метод разделения «выбор системы» и «точность внутри неё» позволяет находить такие ошибки, которые обычная проверка «выбрала правильную рамку — да/нет» просто не видит. Вместо привычной бинарной оценки строится четырёхвариантная сетка: верно-исламский, верно-западный, неверно-исламский, неверно-западный — и именно это разделение вскрывает ловушку. 57-66% ответов внутри «правильной» рамки — ошибочны.
Адаптировать под запрос

TL;DR

Стоит упомянуть в вопросе про финансы слово «шариат», исламское имя или профессию — и модель резко переключается на исламскую систему норм. Но чаще, чем кажется, она даёт фактически неверный ответ, просто одетый в правильную терминологию.

Вот в чём боль: при самом сильном культурном сигнале (простая фраза «хочу вариант, соответствующий шариату») крупные модели выбирают исламский фреймворк в 97% случаев — выглядит как идеальная культурная чуткость. Но при проверке содержания 57-66% этих ответов оказываются ошибочными внутри самого исламского фреймворка, который модель выбрала. Обычная проверка «выбрала ли модель правильную рамку — да/нет» этого просто не видит, потому что не отделяет выбор системы правил от точности внутри неё.

Исследователи предлагают разделять два разных вопроса: какую систему правил модель выбрала и права ли она внутри этой системы. Для этого они строят четырёхвариантную сетку ответов (верный исламский / верный западный / неверный исламский / неверный западный) вместо привычной бинарной оценки — и именно это разделение вскрывает ловушку.


🔬

Схема метода (как устроена проверка)

ШАГ 1: В вопрос добавляется культурный сигнал (имя, религия, профессия, юрисдикция) → меняет вероятность выбора фреймворка
ШАГ 2: Модель отвечает на вопрос → ответ классифицируется по 4 категориям:
        CI (верно + исламский фрейм) / CW (верно + западный)
        II (неверно, но в исламском фрейме) / IW (неверно, но в западном)
ШАГ 3: Считается отдельно — % выбора исламского фрейма И % ошибок внутри него

Это исследовательская методика оценки, не промпт-техника в чистом виде. Но из неё вытекает применимый в чате принцип — ниже.


🚀

Пример применения

Задача: Вы живёте в Казани, хотите взять ипотеку без процентов и спрашиваете ChatGPT: «Я мусульманин, хочу халяльный вариант ипотеки — что мне подходит?»

Проблема без техники: Модель услышит слово «мусульманин» и «халяльный», уверенно заговорит терминами (мурабаха, иджара), но может перепутать детали конкретного механизма — например, неправильно описать, кто несёт риск владения активом до продажи. Звучит убедительно, по сути — ошибка.

Промпт с разделением:

Я подбираю ипотечный продукт без банковского процента (шариат-совместимый).
Ответь в два отдельных шага:

1. Назови конкретную нормативную систему/стандарт, на который ты опираешься 
   (например, конкретный стандарт AAOIFI или норму исламского банкинга), 
   и почему именно она подходит под мой вопрос.

2. Дай ответ строго в рамках этой системы. Укажи, на какой именно принцип 
   или документ опирается каждое утверждение. Если не уверен в точности 
   деталей — прямо скажи об этом, не подстраивай терминологию "для вида".

Результат: Модель явно разделит выбор системы и фактическое содержание. Это не гарантирует отсутствие ошибок, но заставляет её аргументировать выбор отдельно от контента — а не просто «подстроиться под тон» вопроса и выдать красиво звучащий, но неточный ответ.


🧠

Почему это работает

LLM хорошо имитирует стиль и лексику — увидев слово «шариат» или исламское имя, она мгновенно достаёт нужную терминологию из памяти. Это не значит, что она проверила факты — это значит, что она распознала паттерн и подстроилась под тон.

Слабость в том, что модель путает узнавание слова с пониманием сути. В исследовании это видно буквально: сигналы, содержащие слово «Islamic» (например, «сотрудник исламского банка»), резко поднимают активацию исламского фрейма. А сигналы без этого слова, но описывающие такую же роль по сути (например, «специалист по торговому финансированию»), почти не работают — хотя должны бы, если модель понимала суть, а не ловила ключевое слово.

Явная просьба разделить выбор системы и проверку контента заставляет модель тратить рассуждение не на подгонку тона, а на аргументацию — это использует её сильную сторону (следование явной структуре запроса) против слабости (поверхностное распознавание паттернов).

Рычаги управления: - Явно просить источник/стандарт для каждого утверждения → повышает проверяемость - Просить сравнить оба фреймворка (исламский и обычный) в одном ответе → сразу видна разница в содержании - Убрать культурные маркеры из вопроса и спросить нейтрально → сравнить, изменился ли фактический контент


📋

Шаблон промпта

У меня вопрос про {тема}, и мне важен ответ с учётом {культурный/религиозный/
профессиональный контекст}.

Ответь в два отдельных шага:
1. Назови, какую систему правил/стандарт ты применяешь для ответа на этот 
   вопрос, и почему именно эту.
2. Дай ответ строго в рамках выбранной системы. Для каждого ключевого 
   утверждения укажи, на какой конкретный принцип или документ оно 
   опирается. Если не уверен в точности деталей — скажи прямо, не 
   подгоняй терминологию под контекст без проверки фактов.

Подставляйте: {тема} — финансовый, юридический или медицинский вопрос; {контекст} — то, что может заставить модель "подстроиться" под ожидаемый тон (религия, профессия, национальность).

🚀 Быстрый старт — вставь в чат:

Вот принцип разделения выбора системы правил и проверки фактов внутри неё.
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, какая у вас тема и какой культурный/профессиональный контекст важен — потому что без этого невозможно понять, где именно возникает риск «красивого, но неточного» ответа.


⚠️

Ограничения

⚠️ Это не протестированное решение, а вывод из находки. Авторы статьи показывают существование проблемы (stereotype trap), но не проверяли, снижает ли явное разделение шагов реальную частоту ошибок в чате — это моя экстраполяция из их вывода, не прямой результат эксперимента.

⚠️ У топовых моделей разрыв меньше. Проблема выражена сильнее у моделей среднего уровня. На самых мощных моделях (уровня топовых версий Claude, GPT) риск ловушки ниже, хотя не исчезает полностью.

⚠️ Гипотеза, не доказанный механизм. Авторы честно называют объяснение («модель предпочитает фреймворк, где увереннее») гипотезой — они не доказали причинно-следственную связь, только совместное изменение двух показателей.


🔍

Как исследовали

Команда взяла корпус из 811 вопросов по исламским финансам (SAHM), очистила его от терминов, которые сразу подсказывают «правильный» фрейм, и построила 304 вопроса с двумя валидными ответами — исламским и западным (например, вопрос про просрочку платежа: по AAOIFI — благотворительный штраф без процентов, по Regulation Z — пеня с накоплением процента). К каждому вопросу добавили два «ложных» варианта ответа — по одному в каждом фрейме, чтобы получить полную сетку из 4 клеток.

Затем в вопросы внедрили 50 культурных сигналов — от прямого упоминания шариата до косвенных намёков (имя, профессия, соблюдение Рамадана) — и прогнали через 12 моделей на двух языках. Каждый ответ модели раскладывали по сетке: выбрала ли она исламский или западный фрейм, и правильно ли ответила внутри него.

Удивил разрыв: простое ключевое слово («хочу шариат-совместимый вариант») поднимало выбор исламского фрейма почти до максимума во всех моделях — то есть знание у моделей есть, оно просто не активируется без явного триггера. А обратный эффект — западные сигналы, отодвигающие модель от исламского фрейма — почти не работал: западная рамка оказалась «дефолтом», который держится, пока его не перебьёт исламский сигнал.


🔗

Ресурсы

Right Frame, Wrong Rule: Cultural Cues Expose the Financial Knowledge Gap They Were Meant to Close — Rania Elbadry, Ahmed Heakl, Saeed Almheiri и др., MBZUAI совместно с INSAIT, University of Manchester, Harvard, Georgia Tech. Бенчмарк построен на корпусе SAHM (Elbadry et al., 2026).


📋 Дайджест исследования

Ключевая суть

Модель слышит слово «шариат» — и в 97% случаев резко переключается на исламскую систему правил. Звучит как идеальная культурная чуткость. Но 57-66% этих ответов внутри выбранной рамки оказываются фактически неверными — просто одетыми в правильную терминологию. Метод разделения «выбор системы» и «точность внутри неё» позволяет находить такие ошибки, которые обычная проверка «выбрала правильную рамку — да/нет» просто не видит. Вместо привычной бинарной оценки строится четырёхвариантная сетка: верно-исламский, верно-западный, неверно-исламский, неверно-западный — и именно это разделение вскрывает ловушку. 57-66% ответов внутри «правильной» рамки — ошибочны.

Принцип работы

Модель не понимает суть вопроса — она узнаёт паттерн в словах. Стоит вставить в вопрос слово «Islamic» (например, «сотрудник исламского банка») — выбор исламского фрейма резко подскакивает. А та же самая роль по смыслу, но без этого слова («специалист по торговому финансированию») — почти не даёт эффекта, хотя должна бы, если модель реально понимала суть. Модель путает узнавание ключевого слова с пониманием сути дела — это и есть механика ловушки.

Почему работает

LLM отлично имитирует стиль и лексику. Увидела «шариат» — тут же достала из памяти нужные термины: мурабаха, иджара, кто несёт риск владения активом. Это не проверка фактов, это подстройка под тон вопроса. Явная просьба разделить выбор системы правил и содержание ответа заставляет модель тратить рассуждение на аргументацию, а не на подгонку терминов под ожидаемый тон — слабость модели (поверхностное распознавание паттернов) начинает работать против самой себя.

Когда применять

Финансовые, юридические и медицинские вопросы с религиозным, национальным или профессиональным контекстом → особенно когда есть развилка между двумя системами норм (исламский банкинг против обычного, разные юрисдикции, разные медицинские протоколы). НЕ подходит для вопросов без культурной развилки — там просто нет риска путаницы рамок, и метод избыточен.

Мини-рецепт

1. Раздели вопрос на два шага: сначала попроси модель назвать систему правил и объяснить почему именно она подходит, только потом — дать содержательный ответ.
2. Требуй источник для каждого утверждения: конкретный стандарт (например AAOIFI) или принцип, а не общие фразы.
3. Проверь без культурного сигнала: задай тот же вопрос нейтрально, без имён и религиозных маркеров, сравни — изменился ли фактический контент ответа.
4. Попроси сравнить обе рамки в одном ответе — сразу видно, где расходится не только терминология, но и суть.

Примеры

[ПЛОХО] : Я мусульманин, хочу халяльную ипотеку — что мне подходит?
[ХОРОШО] : Ответь в два отдельных шага: 1) назови конкретный стандарт исламского банкинга, на который опираешься, и почему именно он; 2) дай ответ строго в его рамках, указав для каждого утверждения принцип или документ-источник. Если не уверен в деталях — скажи прямо, не подгоняй терминологию для вида.
Источник: Right Frame, Wrong Rule: Cultural Cues Expose the Financial Knowledge Gap They Were Meant to Close
ArXiv ID: 2609.00999 | Сгенерировано: 2026-09-02 04:32

Проблемы LLM

ПроблемаСутьКак обойти
Правильный стиль — неверное содержание внутри негоСлово-триггер («шариат», религиозное имя, профессия) переключает модель на нужную терминологию. Модель звучит уместно и убедительно. Но путает детали внутри выбранной системы правил. Проверка «выбрала ли модель правильную рамку — да/нет» это не замечает. Она смотрит только на выбор стиля, а не на точность фактов внутри негоПроси модель отдельно назвать систему правил и обосновать выбор, а затем дать ответ строго в этой системе с указанием источника для каждого утверждения. Разделение выбора рамки и проверки контента вскрывает ошибки, которые прячутся за правильным тоном

Методы

МетодСуть
Двухшаговое разделение рамки и контентаПроси модель: (1) явно назвать систему правил, стандарт или норму, и объяснить почему выбрала именно её; (2) дать ответ строго в рамках этой системы, указав источник или принцип для каждого утверждения, и честно сказать если не уверена в деталях. Шаг 1: назови систему Шаг 2: отвечай внутри неё с источниками. Работает потому что заставляет модель тратить рассуждение на аргументацию, а не на подгонку тона под ключевые слова из вопроса. Помогает: вопросы с культурным, религиозным, юридическим или профессиональным маркером, где есть альтернативные системы правил (финансы, право, медицина). Не помогает: простые фактические вопросы без альтернативных систем правил
📖 Простыми словами

Right Frame, Wrong Rule: Cultural Cues Expose the Financial Knowledge Gap They Were Meant to Close

arXiv: 2609.00999

Нейросети работают не на понимании законов, а на ассоциациях. Когда ты вставляешь в запрос слово «шариат», исламское имя или специфический термин, в модели мгновенно срабатывает культурный триггер. Она переключается на нужный языковой стиль и начинает сыпать терминами, но вместо реальных расчетов и правовых норм выдает полную чушь, упакованную в благочестивую обертку.

Это как нанять актера в белом халате вместо реального хирурга. Он уверенно говорит на латыни, эффектно носит стетоскоп и сочувственно кивает, но при аппендиците пропишет подорожник. Модель идеально отыгрывает роль эксперта по исламскому банкингу, но за красивым фасадом скрывается абсолютная фактическая пустота.

Суть проблемы в механике: культурное позиционирование включает у нейросети правильный словарь, но полностью отключает логическую проверку. Спроси её про халяльную ипотеку — она виртуозно вставит термины «мурабаха» и «иджара», но переврет базовые финансовые условия и проценты. Модель выбирает правильную форму для заведомо неверного ответа.

Тестировали на религиозных нормах, но принцип универсален. Та же лажа всплывает везде, где есть субкультура, локальное право или узкий профжаргон — от медицинских протоколов до местных налогов. Стоит задать специфический контекст, и AI включает режим угодливой галлюцинации, стараясь совпасть с тобой по тону в ущерб фактической точности.

Короче: профессиональный сленг от нейросети — не признак ума. Если модель общается с тобой на одном культурном коде и сыплет терминами, проверяй факты и расчеты в три раза жестче. Красивая терминология чаще всего просто маскирует дыры в базовых знаниях.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с