3,583 papers
arXiv:2609.06545 76 6 сент. 2026 г. FREE

Скрытая гендерная предвзятость LLM: при прямом вопросе — честно, при генерации истории — перекос в мужчин

КЛЮЧЕВАЯ СУТЬ
16% против 79% — такой разрыв между тем, что модель ЗНАЕТ, и тем, что она ПИШЕТ. Спроси прямо «кто чаще работает поваром в Индии» — модель честно скажет: чаще женщина, мужчина только в 16% случаев. Попроси написать историю про повара на хинди — герой окажется мужчиной в 79% случаев. Метод диагностики позволяет предсказать и исправить гендерный перекос персонажей в сценариях, историях, подкастах ещё до генерации. Модель при сочинении не сверяется с фактами — она продолжает самый вероятный текстовый паттерн, а в фильмах и книгах мужской герой — это 75% случаев.
Адаптировать под запрос

TL;DR

Если спросить модель напрямую: "кто в вашей стране чаще всего работает поваром?" — она отвечает почти точно как реальные люди из этой страны. Но если попросить ту же модель написать историю, сценарий или подкаст с героем-поваром — она резко выберет мужского персонажа, хотя сама только что "знала", что повар — это чаще женская роль.

Разрыв огромный: например, на прямой вопрос модель говорит "повар — это мужчина в 16% случаев" (то есть чаще женщина), а при генерации истории про повара — мужской герой уже в 79% случаев. Причина простая: когда модель отвечает на вопрос, она достаёт факт из "памяти". Когда она сочиняет историю, она продолжает самый вероятный паттерн текста — а в фильмах и книгах, на которых она обучалась, мужских протагонистов около 75%. Модель невольно копирует медийный перекос, а не реальность.

Эффект намного сильнее, если просить модель писать на местном языке (хинди, суахили, йоруба), а не на английском — на английском смещение почти незаметно. Просить модель "сделай разнообразных персонажей" помогает, но частично: инструкция может перегнуть в другую сторону и сделать почти всех героев женщинами, теряя реалистичность.


📌

Схема находки

ШАГ 1 (диагностика): Спроси модель прямой вопрос про роль → получишь честный ответ, близкий к реальности
ШАГ 2 (создание контента): Попроси сгенерировать историю/сценарий с героем в той же роли → получишь перекос в мужскую сторону
ШАГ 3 (митигация, ненадёжная): Добавь инструкцию "разнообразие/не по умолчанию мужчина" → сдвиг в нужную сторону, но может перегнуть в женскую и потерять реализм

🚀

Пример применения

Задача: Ты ведёшь контент для кулинарного бренда или ресторана и просишь ChatGPT написать серию коротких историй для Reels — про повара, о том как он готовит блюдо дня.

Промпт (как делают обычно, без учёта находки):

Напиши короткий сценарий для видео-Reels (30 секунд) о поваре, 
который готовит фирменное блюдо ресторана. Герой — обычный повар, 
без уточнения пола.

Результат (то, что вероятно произойдёт): Модель почти наверняка сделает героя мужчиной, даже если у вас в реальном ресторане повара — женщины, и даже если сама модель на прямой вопрос "кто чаще работает поваром" ответила бы иначе. Если вы сгенерируете 10 таких сценариев подряд, доля мужских поваров будет заметно выше, чем в реальности или в статистике вашей отрасли.

Промпт с поправкой на находку:

Напиши короткий сценарий для видео-Reels (30 секунд) о поваре, 
который готовит фирменное блюдо ресторана. Главная героиня — женщина, 
опытный шеф-повар.

Результат: Явное указание пола убирает лотерею — модель делает то, что вы просите, а не то, что подсказывает статистика фильмов у неё в "памяти".


🧠

Почему это работает

Слабость LLM в том, что при генерации творческого контента модель не сверяется с фактами, которые она же знает — она продолжает самый вероятный текстовый паттерн. А самый частый паттерн в обучающих данных (фильмы, книги, сценарии) — мужской протагонист примерно в 3 случаях из 4.

Сильная сторона модели — у неё точное "декларативное" знание: если спросить прямо, она вспоминает факт и честно называет реальное распределение по ролям.

Разрыв между этими двумя режимами — и есть находка. Она показывает: нельзя доверять "нейтральному" промпту, если для вас важна репрезентативность персонажей. Модель не подставит нейтрального героя — она подставит того, кто чаще встречается в её обучающих текстах.

Рычаги управления: - Явное указание пола персонажа → надёжнее любых debias-инструкций, потому что убирает саму лотерею - Инструкции типа "сделай разнообразие" → работают направленно, но могут перегнуть в противоположную сторону — тестируйте на нескольких генерациях, не доверяйте одной - Язык промпта → если создаёте контент не на английском (например, на русском для локальной аудитории), учитывайте, что перекос может быть сильнее, чем показывают англоязычные тесты в статье - Роль/профессия → эффект сильнее всего для "нейтральных" по стереотипу или домашних/сервисных ролей (повар, официант) — там модель чаще всего "доигрывает" по мужскому шаблону


📋

Шаблон промпта

Напиши {тип_контента} про {роль/профессию} в контексте {страна/культура}.
Главный герой — {укажи пол явно: мужчина/женщина}, {дополнительный контекст о персонаже}.

Если хотите протестировать модель на предвзятость перед созданием серии контента — сначала спросите прямо:

В {стране/регионе}, кто чаще всего работает как {роль}: мужчины, женщины, или примерно поровну?

А потом сравните ответ с тем, что модель выдаст при генерации истории без явного указания пола — разница покажет масштаб перекоса для конкретной роли.

🚀 Быстрый старт — вставь в чат:

Я делаю серию контента (истории/сценарии/посты) с персонажами-профессионалами. 
Хочу проверить и скорректировать возможный гендерный перекос в генерации. 
Вот моя задача: {опиши задачу}.

Сначала спроси меня, какую роль или профессию использовать, 
и на каком языке будет контент. Затем предложи два варианта промпта: 
один с явным указанием пола персонажа, другой — с инструкцией на баланс. 
Объясни разницу в надёжности между ними.

LLM спросит про роль, язык и целевую аудиторию — потому что от этого зависит, насколько силён перекос и какой способ коррекции надёжнее.


⚠️

Ограничения

⚠️ Debias-инструкции ненадёжны: просьба "сделай разнообразных персонажей" или "не выбирай мужчину по умолчанию" может перегнуть в противоположную сторону — почти все герои станут женщинами, и это тоже не будет отражать реальность.

⚠️ Инструкция "соответствуй реальной демографии" не работает: несмотря на логичность, такая формулировка не даёт надёжного улучшения точности — модель её просто плохо выполняет.

⚠️ Эффект скрыт при промптинге на английском: если тестируете модель на английском про не-западный контекст, перекос может показаться незначительным — но резко проявится на языке реальной аудитории.


🔍

Как исследовали

Команда собрала опрос 695 человек из США, Индии, Кении и Нигерии — спросили, кто в их стране обычно выполняет 22 роли (профессии и домашние дела). Это стало "человеческим эталоном" для сравнения. Затем прогнали восемь языковых моделей (включая GPT-5.1 и три локализованные модели для Индии/Кении/Нигерии) через два режима: прямой вопрос (тот же, что людям) и генерацию медиа-контента (историй, видео-скриптов, подкастов) с героем в той же роли, определяя пол героя автоматическим классификатором с проверкой людьми.

Оказалось, что при прямом вопросе модели совпадают с человеческими ответами почти идеально (корреляция +0.81), а при генерации — резко смещаются в мужскую сторону, приближаясь к реальной статистике перекоса в кино и ТВ (~75% мужских персонажей). Самое неожиданное: этот эффект в разы сильнее при промптинге на местном языке, чем на английском — значит, большинство существующих bias-тестов, которые проверяют модели только на английском, упускают главную проблему, потому что тестируют не на том языке, на котором модели реально используют жители этих стран.


🔗

Ресурсы

LLMs Mirror Country-Specific Gender Patterns If Asked, but Skew Male When Generating Media in Local Languages Sharif Kazemi, Tanya Popli, Neil K. R. Sehgal, Sunny Rai, Niyati Malhotra, Victor Orozco-Olvera, Ana María Muñoz Boudet, Samuel P. Fraiberger, Sharath Chandra Guntuku, Manuel Tonneau World Bank Group, University of Oxford, New York University, University of Pennsylvania, Cornell University


📋 Дайджест исследования

Ключевая суть

16% против 79% — такой разрыв между тем, что модель ЗНАЕТ, и тем, что она ПИШЕТ. Спроси прямо «кто чаще работает поваром в Индии» — модель честно скажет: чаще женщина, мужчина только в 16% случаев. Попроси написать историю про повара на хинди — герой окажется мужчиной в 79% случаев. Метод диагностики позволяет предсказать и исправить гендерный перекос персонажей в сценариях, историях, подкастах ещё до генерации. Модель при сочинении не сверяется с фактами — она продолжает самый вероятный текстовый паттерн, а в фильмах и книгах мужской герой — это 75% случаев.

Принцип работы

Не спрашивай модель что она думает — смотри что она пишет. Это два разных режима: декларативное знание (факт из памяти, честный ответ на прямой вопрос) и генеративный паттерн (продолжение самого вероятного текста, без проверки фактов). Модель как студент, который на экзамене знает правильный ответ, но в сочинении на свободную тему пишет привычный штамп. Прикол: спроси модель напрямую про статистику — она умная и точная. Попроси написать историю — она тупо копирует голливудский шаблон.

Почему работает

Причина проста и техническая. При ответе на вопрос модель ищет факт в своих весах — это как поиск в справочнике. При генерации истории она предсказывает следующее слово по самому частому паттерну из обучающих текстов. А в этих текстах — фильмах, книгах, сценариях — мужской протагонист встречается в 75% случаев. Модель невольно копирует статистику Голливуда, а не статистику реального мира. Причём эффект в разы сильнее на местных языках — хинди, суахили, йоруба — потому что на английском тренировочных данных с западным перекосом слишком много, и модель как бы «привыкла» компенсировать, а на локальных языках привычки нет.

Когда применять

Генерация контента про профессии и роли → конкретно для историй, сценариев, подкастов, где нужен реалистичный или разнообразный состав персонажей, особенно если пишете не на английском и не про западную аудиторию. Особенно критично для «нейтральных» ролей — повар, официант, продавец — там модель чаще всего доигрывает мужской шаблон вместо реальной статистики. НЕ подходит как единственная защита — инструкции про «баланс» или «соответствуй демографии» модель выполняет плохо и может перегнуть в другую сторону.

Мини-рецепт

1. Продиагностируй: спроси модель прямо — «в {стране}, кто чаще работает {роль}: мужчины, женщины, поровну?» Запомни ответ как эталон.
2. Сравни: попроси ту же модель сгенерировать 5-10 историй с этой ролью без указания пола. Посчитай долю мужских персонажей.
3. Если разрыв большой — не спорь с моделью: просто укажи пол персонажа явно в промпте вместо надежды на «нейтральность».
4. Если нужно разнообразие в серии контента: попробуй инструкцию про баланс, но проверь на нескольких генерациях — модель может перегнуть в женскую сторону и потерять реализм.
5. Учти язык: если целевая аудитория не англоязычная, тестируй именно на языке аудитории — на английском перекос может быть незаметен, а на местном языке выстрелит сильнее.

Примеры

[ПЛОХО] : Напиши короткий сценарий для Reels о поваре, который готовит фирменное блюдо. Герой — обычный повар, без уточнения пола.
[ХОРОШО] : Напиши короткий сценарий для Reels о поваре, который готовит фирменное блюдо. Главная героиня — женщина, опытный шеф-повар с 10-летним стажем.
Источник: LLMs Mirror Country-Specific Gender Patterns If Asked, but Skew Male When Generating Media in Local Languages
ArXiv ID: 2609.06545 | Сгенерировано: 2026-09-09 06:32

Проблемы LLM

ПроблемаСутьКак обойти
При сочинении истории модель игнорирует факты, которые сама знаетСпроси модель прямо про статистику роли — ответ точный, близкий к реальности. Попроси написать историю с героем той же роли — модель выбирает шаблонного персонажа. Шаблон берётся из фильмов и книг, где один пол встречается втрое чаще. Модель не сверяется с фактом, а продолжает привычный текстовый паттерн. Работает не только для пола — для любого стереотипа: возраст, национальность, профессияУказывай нужный признак героя явно в запросе (пол, возраст, происхождение). Не оставляй "нейтральное" описание — модель заполнит его сама, и заполнит по шаблону, а не по факту
Перекос сильнее при генерации не на английском языкеПроси написать историю на местном языке (не английском) — искажение резко растёт. На английском тот же перекос почти не заметен. Причина: модель лучше отбалансирована именно на англоязычных текстах, на других языках стереотип из обучающих данных проявляется сильнееПроверяй смещение именно на том языке, на котором будешь генерировать контент. Результат теста на английском не переносится на русский, хинди или любой другой язык

Методы

МетодСуть
Явное указание признака персонажа — убирает лотереюВместо "напиши историю про повара" пиши "напиши историю про женщину-повара" или "мужчину-повара". Главный герой — {пол/возраст/происхождение}, {контекст}. Почему работает: модель просто выполняет прямую инструкцию, а не выбирает героя по шаблону из обучающих текстов. Работает всегда, когда важна конкретная демография персонажа. Не нужен, если тебе годится любой пол героя
Двухшаговая проверка на скрытый перекосШаг 1: спроси модель прямо — "в {контекст}, кто чаще занимает роль {роль}?". Получишь точную оценку. Шаг 2: попроси сгенерировать историю с той же ролью без указания пола. Сравни два ответа. Разница между ними — это и есть масштаб скрытого перекоса для этой конкретной роли и языка. Метод работает для любого стереотипа, не только гендерного — можно проверять возраст, национальность, профессиональные клише. Не работает, если у модели нет точного фактического знания по теме — тогда шаг 1 сам будет неточным

Тезисы

ТезисКомментарий
Извлечение факта и сочинение истории — два разных режима работы моделиКогда модель отвечает на прямой вопрос, она достаёт факт из знаний — ответ точный. Когда модель сочиняет текст, она продолжает самый вероятный паттерн из обучающих данных — а там один вариант (например, мужской герой) встречается заметно чаще. Эти два режима не связаны между собой: точное знание не подключается к процессу сочинения. Применяй: если для творческой задачи важна точность (демография, статистика, факты), не полагайся на "нейтральный" запрос — явно впиши нужный признак в промпт
📖 Простыми словами

LLMsMirror Country-Specific Gender Patterns If Asked, but Skew Male When Generating Media in LocalLanguages

arXiv: 2609.06545

Нейросети страдают от жесткого раздвоения личности. Если спросить модель в лоб про демографию конкретной страны, она выдаст точную фактуру — например, что поварами там чаще работают женщины. Но стоит попросить её написать рассказ или подкаст, как включается генератор клише, и на кухню моментально отправляется мужик.

Это как отличник, который блестяще сдал экзамен по социологии, но в пятницу в баре начинает сыпать байками из девяностых. Формально он всё знает, но когда нужно выдать сюжет, голова переходит на автопилот из поп-культурных штампов. База знаний есть, но в творчестве она просто идёт лесом.

Корень проблемы в том, как работают LLM: при генерации историй модель не сверяется с фактами, а тупо собирает наиболее вероятную цепочку слов. А в книгах, фильмах и сценариях перекос чудовищный: мужской протагонист выпадает в 3 из 4 случаев. Нейросеть выбирает не то, что правдиво, а то, что чаще встречалось в сети.

Тестировали на профессиях и языках, но грабли одни и те же везде. Пишешь сценарий для Reels, придумываешь маскота для бренда или генерируешь диалог для рекламы — без жестких рамок AI моментально выдаст усредненный голливудский шаблон, начисто похоронив локальный контекст.

Короче: бросать генерацию креатива на самотёк — это провал. Явный контроль персонажей в промпте — единственный способ не превратить контент в сборник замшелых стереотипов. Задавай пол, возраст и бэкграунд руками, иначе модель накормит тебя шаблонной дешёвкой.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с