TL;DR
Стоит упомянуть в вопросе про финансы слово «шариат», исламское имя или профессию — и модель резко переключается на исламскую систему норм. Но чаще, чем кажется, она даёт фактически неверный ответ, просто одетый в правильную терминологию.
Вот в чём боль: при самом сильном культурном сигнале (простая фраза «хочу вариант, соответствующий шариату») крупные модели выбирают исламский фреймворк в 97% случаев — выглядит как идеальная культурная чуткость. Но при проверке содержания 57-66% этих ответов оказываются ошибочными внутри самого исламского фреймворка, который модель выбрала. Обычная проверка «выбрала ли модель правильную рамку — да/нет» этого просто не видит, потому что не отделяет выбор системы правил от точности внутри неё.
Исследователи предлагают разделять два разных вопроса: какую систему правил модель выбрала и права ли она внутри этой системы. Для этого они строят четырёхвариантную сетку ответов (верный исламский / верный западный / неверный исламский / неверный западный) вместо привычной бинарной оценки — и именно это разделение вскрывает ловушку.
Схема метода (как устроена проверка)
ШАГ 1: В вопрос добавляется культурный сигнал (имя, религия, профессия, юрисдикция) → меняет вероятность выбора фреймворка
ШАГ 2: Модель отвечает на вопрос → ответ классифицируется по 4 категориям:
CI (верно + исламский фрейм) / CW (верно + западный)
II (неверно, но в исламском фрейме) / IW (неверно, но в западном)
ШАГ 3: Считается отдельно — % выбора исламского фрейма И % ошибок внутри него
Это исследовательская методика оценки, не промпт-техника в чистом виде. Но из неё вытекает применимый в чате принцип — ниже.
Пример применения
Задача: Вы живёте в Казани, хотите взять ипотеку без процентов и спрашиваете ChatGPT: «Я мусульманин, хочу халяльный вариант ипотеки — что мне подходит?»
Проблема без техники: Модель услышит слово «мусульманин» и «халяльный», уверенно заговорит терминами (мурабаха, иджара), но может перепутать детали конкретного механизма — например, неправильно описать, кто несёт риск владения активом до продажи. Звучит убедительно, по сути — ошибка.
Промпт с разделением:
Я подбираю ипотечный продукт без банковского процента (шариат-совместимый).
Ответь в два отдельных шага:
1. Назови конкретную нормативную систему/стандарт, на который ты опираешься
(например, конкретный стандарт AAOIFI или норму исламского банкинга),
и почему именно она подходит под мой вопрос.
2. Дай ответ строго в рамках этой системы. Укажи, на какой именно принцип
или документ опирается каждое утверждение. Если не уверен в точности
деталей — прямо скажи об этом, не подстраивай терминологию "для вида".
Результат: Модель явно разделит выбор системы и фактическое содержание. Это не гарантирует отсутствие ошибок, но заставляет её аргументировать выбор отдельно от контента — а не просто «подстроиться под тон» вопроса и выдать красиво звучащий, но неточный ответ.
Почему это работает
LLM хорошо имитирует стиль и лексику — увидев слово «шариат» или исламское имя, она мгновенно достаёт нужную терминологию из памяти. Это не значит, что она проверила факты — это значит, что она распознала паттерн и подстроилась под тон.
Слабость в том, что модель путает узнавание слова с пониманием сути. В исследовании это видно буквально: сигналы, содержащие слово «Islamic» (например, «сотрудник исламского банка»), резко поднимают активацию исламского фрейма. А сигналы без этого слова, но описывающие такую же роль по сути (например, «специалист по торговому финансированию»), почти не работают — хотя должны бы, если модель понимала суть, а не ловила ключевое слово.
Явная просьба разделить выбор системы и проверку контента заставляет модель тратить рассуждение не на подгонку тона, а на аргументацию — это использует её сильную сторону (следование явной структуре запроса) против слабости (поверхностное распознавание паттернов).
Рычаги управления: - Явно просить источник/стандарт для каждого утверждения → повышает проверяемость - Просить сравнить оба фреймворка (исламский и обычный) в одном ответе → сразу видна разница в содержании - Убрать культурные маркеры из вопроса и спросить нейтрально → сравнить, изменился ли фактический контент
Шаблон промпта
У меня вопрос про {тема}, и мне важен ответ с учётом {культурный/религиозный/
профессиональный контекст}.
Ответь в два отдельных шага:
1. Назови, какую систему правил/стандарт ты применяешь для ответа на этот
вопрос, и почему именно эту.
2. Дай ответ строго в рамках выбранной системы. Для каждого ключевого
утверждения укажи, на какой конкретный принцип или документ оно
опирается. Если не уверен в точности деталей — скажи прямо, не
подгоняй терминологию под контекст без проверки фактов.
Подставляйте: {тема} — финансовый, юридический или медицинский вопрос; {контекст} — то, что может заставить модель "подстроиться" под ожидаемый тон (религия, профессия, национальность).
🚀 Быстрый старт — вставь в чат:
Вот принцип разделения выбора системы правил и проверки фактов внутри неё.
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какая у вас тема и какой культурный/профессиональный контекст важен — потому что без этого невозможно понять, где именно возникает риск «красивого, но неточного» ответа.
Ограничения
⚠️ Это не протестированное решение, а вывод из находки. Авторы статьи показывают существование проблемы (stereotype trap), но не проверяли, снижает ли явное разделение шагов реальную частоту ошибок в чате — это моя экстраполяция из их вывода, не прямой результат эксперимента.
⚠️ У топовых моделей разрыв меньше. Проблема выражена сильнее у моделей среднего уровня. На самых мощных моделях (уровня топовых версий Claude, GPT) риск ловушки ниже, хотя не исчезает полностью.
⚠️ Гипотеза, не доказанный механизм. Авторы честно называют объяснение («модель предпочитает фреймворк, где увереннее») гипотезой — они не доказали причинно-следственную связь, только совместное изменение двух показателей.
Как исследовали
Команда взяла корпус из 811 вопросов по исламским финансам (SAHM), очистила его от терминов, которые сразу подсказывают «правильный» фрейм, и построила 304 вопроса с двумя валидными ответами — исламским и западным (например, вопрос про просрочку платежа: по AAOIFI — благотворительный штраф без процентов, по Regulation Z — пеня с накоплением процента). К каждому вопросу добавили два «ложных» варианта ответа — по одному в каждом фрейме, чтобы получить полную сетку из 4 клеток.
Затем в вопросы внедрили 50 культурных сигналов — от прямого упоминания шариата до косвенных намёков (имя, профессия, соблюдение Рамадана) — и прогнали через 12 моделей на двух языках. Каждый ответ модели раскладывали по сетке: выбрала ли она исламский или западный фрейм, и правильно ли ответила внутри него.
Удивил разрыв: простое ключевое слово («хочу шариат-совместимый вариант») поднимало выбор исламского фрейма почти до максимума во всех моделях — то есть знание у моделей есть, оно просто не активируется без явного триггера. А обратный эффект — западные сигналы, отодвигающие модель от исламского фрейма — почти не работал: западная рамка оказалась «дефолтом», который держится, пока его не перебьёт исламский сигнал.
Ресурсы
Right Frame, Wrong Rule: Cultural Cues Expose the Financial Knowledge Gap They Were Meant to Close — Rania Elbadry, Ahmed Heakl, Saeed Almheiri и др., MBZUAI совместно с INSAIT, University of Manchester, Harvard, Georgia Tech. Бенчмарк построен на корпусе SAHM (Elbadry et al., 2026).
