3,583 papers
arXiv:2608.11002 71 11 авг. 2026 г. FREE

LingT2I: язык промпта для генерации картинок меняет культуру, расу персонажей и качество текста на изображении

КЛЮЧЕВАЯ СУТЬ
Пишешь промпт на хинди без единого слова про стиль — и получаешь картинку в традиционной индийской эстетике вместо нейтральной сцены. Бенчмарк из 33 тысяч промптов на 10 языках прогнали через 17 моделей — Nano Banana, Z-Image, Qwen-Image — чтобы понять, насколько честно модели работают с разными языками. Метод даёт возможность управлять культурным стилем картинки только через выбор языка промпта, без явных стилевых слов. Язык оказался скрытым переключателем культуры, зашитым в модель через данные обучения — но заодно тянет за собой расовые и гендерные стереотипы персонажей.
Адаптировать под запрос

TL;DR

Если генерируешь картинку через Gemini, ChatGPT или Midjourney, язык, на котором ты пишешь промпт, незаметно меняет результат — не только смысл, но и культурный стиль, расу персонажей и надёжность текста на изображении. Исследователи собрали бенчмарк из 33 тысяч промптов на 10 языках и прогнали через 17 современных моделей генерации изображений (Nano Banana, Z-Image, Qwen-Image и другие), чтобы понять — насколько справедливо и предсказуемо модели работают с разными языками.

Главная боль: одна и та же сцена на разных языках выглядит по-разному, и это не всегда очевидно из промпта. Например, промпт "женщина со статуей морских коньков" на японском выдаёт картинку в восточноазиатской эстетике с карпом, на хинди — в традиционном индийском скульптурном стиле, хотя ни слова про "стиль" в промпте нет. А если нужно, чтобы на картинке была надпись — арабский, деванагари, кириллица или иероглифы часто рендерятся с искажёнными, нечитаемыми буквами, тогда как латиница (английский, испанский, французский) — почти всегда чисто.

Метод исследования — не техника, а находка: язык промпта — это скрытый переключатель культурного стиля, зашитый в модель через данные обучения. Но это работает как обоюдоострый рычаг: выигрываешь в аутентичности стиля, теряешь в надёжности рендеринга текста и рискуешь получить стереотипную демографию персонажей.


📌

Схема находки

Промпт на языке X (без явных слов о стиле) → модель добавляет культурные маркеры языка X:
   → архитектура, одежда, орнаменты, типаж лиц персонажей

Текст для рендеринга на картинке:
   → Латиница (EN/ES/FR/PT) — рендерится надёжно
   → Нелатиница (AR/HI/ZH/JA/KO/RU) — часто ломается: искажённые буквы, нечитаемый текст

🚀

Пример применения

Задача: Российский бренд специй хочет сделать рекламные карточки для маркетплейса в аутентичном "индийском" визуальном стиле — без клишированных фраз типа "в индийском стиле, сари, орнамент", которые часто дают штампованный результат.

Промпт (сначала попроси LLM перевести, потом вставь перевод в генератор картинок):

Переведи на хинди, сохраняя все детали сцены:

"Женщина стоит на рынке с корзиной ароматных специй, 
тёплый вечерний свет, реалистичное фото, глубина резкости"

Полученный перевод на хинди вставляешь как промпт в Gemini (Nano Banana), DALL-E или другой генератор.

Результат: Модель с высокой вероятностью добавит культурно узнаваемые детали — характерную одежду, архитектуру рынка, освещение — без единого явного упоминания стиля в промпте. Эффект достигается только за счёт смены языка.

Отдельно про текст на картинке: если нужна надпись "Скидка 50%" прямо на банере — не пытайся рендерить кириллицу через T2I-модель. Вероятность искажённых букв высокая. Лучше сгенерировать фон отдельно (промпт на английском описании сцены, без текста) и добавить надпись вручную в Canva или другом редакторе.


🧠

Почему это работает

Модели генерации изображений обучены в основном на англоязычных датасетах (LAION, COCO Captions). Из-за этого у них сильнее развиты ассоциации именно для английского и близких языков — испанского, французского, португальского. Для хинди, арабского, корейского таких прочных связей "слово → визуальный образ" меньше.

Но при этом модель всё-таки улавливает языковые корреляции: если промпт написан на хинди, она "включает" накопленные в обучающих данных ассоциации языка с индийской культурой — даже если ты явно не просил "индийский стиль". Это происходит потому, что язык и культурный контекст в данных обучения идут парой.

Рычаги, которые можно крутить: - Язык промпта → переключает культурный стиль результата без явных стилевых слов - Латиница vs нелатиница в тексте для рендера → латиница надёжна, остальное — риск - Смена языка → меняет не только стиль, но и расу/пол персонажей на картинке (это стоит держать в голове, если делаешь инклюзивный контент)


📋

Шаблон промпта

Переведи следующее описание сцены на {язык нужной культуры}, 
сохраняя все детали и стиль:

"{описание сцены на русском}"

Не добавляй явных упоминаний стиля или культуры — 
только перевод исходного текста.

Плейсхолдеры: {язык нужной культуры} — хинди, японский, арабский и т.д.; {описание сцены} — твой обычный промпт для генерации картинки.

🚀 Быстрый старт — вставь в чат:

Мне нужно сгенерировать изображение в аутентичном культурном стиле 
через язык промпта, а не явные слова о стиле. Вот моя задача: {твоя задача}.
Переведи промпт на нужный язык культуры и объясни, что подставить.

[вставить шаблон выше]

LLM спросит про целевую культуру и детали сцены — потому что без точного языка перевода эффект не сработает, а без деталей сцены перевод может потерять смысл.


⚠️

Ограничения

⚠️ Рендеринг текста ненадёжен: если нужна надпись на кириллице, арабском, деванагари, хангыле или иероглифах прямо на картинке — велик риск искажённых, нечитаемых букв, независимо от модели.

⚠️ Эффект непредсказуем: смена языка может улучшить культурную аутентичность, но одновременно снизить общее качество и реализм картинки — это компромисс, не гарантированный выигрыш.

⚠️ Стереотипы усиливаются: смена языка промпта тянет за собой демографические предубеждения из обучающих данных — можно получить клишированную расу или пол персонажей вместо нейтрального результата.


🔍

Как исследовали

Команда собрала бенчмарк LingT2I — 33 тысячи промптов на 10 языках (английский, китайский, хинди, испанский, арабский, французский, португальский, русский, японский, корейский), покрывающих разные системы письма — от латиницы до иероглифов. Прогнали через 17 современных моделей генерации изображений, включая Nano Banana, Z-Image, Qwen-Image, EasyText — по двум задачам: генерация сцены по описанию и рендеринг текста на картинке.

Качество измеряли мультиязычной версией CLIPScore и оценщиками на базе других языковых моделей (Qwen-VL, Gemini), а точность текста — посимвольным сравнением. Результат: модели общего назначения показывают сильный разрыв — хинди и арабский заметно хуже английского и испанского, а специализированные мультиязычные модели (Qwen-Image) справляются равномернее.

Самое неожиданное — вопреки распространённому мнению о повсеместной "вестернизации" в генерации изображений, 79,6% картинок с явными культурными признаками совпадали по культуре с языком промпта. То есть модель не тянет всё к западной эстетике по умолчанию — она честно отражает культурные ассоциации языка, на котором её попросили.


🔗

Ресурсы

LingT2I benchmark, GitHub, HuggingFace dataset. Авторы: Sicheng Zhang и коллеги, Khalifa University, Queen Mary University of London, CUHK, University of Western Australia, University of Melbourne, University of Central Florida.


📋 Дайджест исследования

Ключевая суть

Пишешь промпт на хинди без единого слова про стиль — и получаешь картинку в традиционной индийской эстетике вместо нейтральной сцены. Бенчмарк из 33 тысяч промптов на 10 языках прогнали через 17 моделей — Nano Banana, Z-Image, Qwen-Image — чтобы понять, насколько честно модели работают с разными языками. Метод даёт возможность управлять культурным стилем картинки только через выбор языка промпта, без явных стилевых слов. Язык оказался скрытым переключателем культуры, зашитым в модель через данные обучения — но заодно тянет за собой расовые и гендерные стереотипы персонажей.

Принцип работы

Правило простое: латиница в тексте на картинке рендерится чисто почти всегда — английский, испанский, французский, португальский. Нелатиница — кириллица, арабский, деванагари, иероглифы — часто превращается в нечитаемые кракозябры. Смена языка промпта включает культурные ассоциации этого языка — архитектуру, одежду, орнаменты, типаж лиц — без единого слова о стиле в тексте промпта.

Почему работает

Модели обучены в основном на англоязычных датасетах — LAION, COCO Captions. Связка 'слово → картинка' у английского и близких языков прочная, у хинди и арабского — слабее. Язык и культура в обучающих данных идут парой — модель включает накопленные ассоциации, даже если ты не просил 'индийский стиль'. Отсюда и рендеринг текста: латиница встречается в обучении в разы чаще, поэтому буквы получаются чистыми, а иероглифы и деванагари — искажёнными.

Когда применять

Дизайн и маркетинг → генерация картинок в аутентичном культурном стиле без клишированных фраз типа 'в индийском стиле, сари, орнамент', особенно для локализованной рекламы под конкретный рынок. НЕ подходит, если на картинке нужна надпись на кириллице, арабском или иероглифах — там высокий риск искажённого нечитаемого текста.

Мини-рецепт

1. Опиши сцену: обычный промпт на русском, без слов о стиле и культуре
2. Переведи через LLM: попроси перевести на язык нужной культуры, сохраняя все детали сцены
3. Вставь перевод в генератор: Gemini (Nano Banana), DALL-E, Midjourney — переведённый текст как промпт
4. Текст на картинке — отдельно: если нужна надпись, генерируй фон без текста, а буквы добавляй вручную в редакторе типа Canva

Примеры

[ПЛОХО] : Сгенерируй женщину с корзиной специй на рынке, в индийском стиле, сари, орнамент
[ХОРОШО] : Переведи на хинди без упоминаний стиля: "Женщина стоит на рынке с корзиной ароматных специй, тёплый вечерний свет, реалистичное фото" — вставь готовый перевод как промпт в Nano Banana или другой генератор
Источник: On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation
ArXiv ID: 2608.11002 | Сгенерировано: 2026-08-12 06:24

Проблемы LLM

ПроблемаСутьКак обойти
Текст на картинке ломается при нелатинском алфавитеПросишь модель нарисовать надпись кириллицей, арабским письмом, деванагари, иероглифами или хангылем. Буквы получаются искажённые, нечитаемые. Латиница (английский, испанский, французский) рендерится почти всегда чисто. Проблема не зависит от конкретной модели генерации картинокНе рендери нелатинский текст напрямую через генератор изображений. Сгенерируй фон без текста (промпт на английском описании сцены), а надпись добавь вручную в графическом редакторе
Смена языка промпта незаметно тянет за собой стереотипыПросишь картинку на другом языке — модель может подставить клишированную расу, пол или типаж персонажей из этой культуры. Ты не просил "азиатское лицо" или "индийская одежда", но получил именно это. Риск для любой задачи где нужен нейтральный или инклюзивный результатЯвно пропиши в промпте демографию персонажей, если она важна. Не полагайся на язык промпта как единственный источник контекста о людях на картинке

Методы

МетодСуть
Перевод промпта на язык культуры — получить аутентичный стиль без стилевых словВозьми обычный промпт для генерации картинки (описание сцены, без слов про стиль). Переведи его на язык нужной культуры (хинди, японский, арабский). Вставь перевод как промпт в генератор изображений. Переведи на {язык}, сохраняя детали сцены, без явных упоминаний стиля модель сама добавит культурные маркеры — архитектуру, одежду, освещение, типаж лиц. Почему работает: язык и культурный контекст в обучающих данных модели идут парой. Модель "включает" накопленные визуальные ассоциации языка, даже без прямой команды про стиль. Когда да: нужен неклишированный этнический/культурный стиль, не хочешь писать штампованные фразы типа "в индийском стиле, сари". Когда нет: на картинке нужен читаемый текст на языке этой культуры (тогда рендеринг может сломаться)
📖 Простыми словами

On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation

arXiv: 2608.11002

Нейросети для генерации картинок — это не просто кисти и краски, а предвзятые переводчики, которые смотрят на мир через призму английского языка. Когда ты скармливаешь модели промпт, она не просто рисует объекты, она подтягивает целый пласт культурных стереотипов, зашитых в её обучающую выборку. Проблема в том, что визуальный код в голове у AI жестко привязан к конкретным словам: напиши запрос на английском — получишь один результат, переведи его на хинди или арабский — и картинка мутирует, меняя расу персонажей, стиль одежды и даже логику пространства.

Это похоже на ситуацию, когда ты просишь трех разных людей нарисовать «уютный завтрак». Британец изобразит тосты и чай, француз — круассан, а китаец — миску лапши. Но в случае с нейросетями этот «выбор» происходит бесконтрольно: модель просто лажает с культурным контекстом, потому что её учили на гигантских свалках англоязычных данных. В итоге, если твой язык не входит в «элитный клуб» западноевропейских наречий, нейросеть начинает либо выдавать дикую дичь, либо лепить нелепые клише, превращая генерацию в лотерею с плохими шансами.

Исследователи прогнали 33 тысячи промптов через 17 топовых моделей вроде Qwen-Image и Z-Image, и цифры подтверждают: кросс-языковая согласованность находится на дне. Что реально работает: если хочешь предсказуемый результат, приходится использовать английский как костыль, даже если модель якобы понимает твой родной язык. Но есть и обратный хак — языковое позиционирование. Если тебе нужен аутентичный индийский колорит без пошлых спецэффектов, запрос на хинди может сработать лучше, чем попытка описать «индийскость» на английском, потому что модель цепляется за редкие, но точные ассоциации в своих нейронных связях.

Тестировали всё это на генераторах картинок, но принцип универсален для любого мультимодального AI. Это касается и видео, и дизайна, и даже генерации кода. Везде, где есть перевод из текста в визуал, возникает языковой барьер, который искажает финальный продукт. SEO для картинок теперь упирается не в ключевые слова, а в понимание того, на каком языке «думает» конкретная модель. Если ты не учитываешь этот перекос, твой контент будет выглядеть либо как дешевая подделка, либо как случайный набор пикселей.

Короче: не надейся, что нейросеть одинаково понимает «собаку» и «dog» — для неё это разные визуальные сущности. Главный вывод исследования в том, что мультиязычность в AI — это миф, прикрывающий глубокий перекос в сторону англоязычной культуры. Либо ты адаптируешь свои промпты под «мозги» модели, используя английский для базы и национальные языки для тонкого тюнинга, либо получаешь визуальный мусор. Кто научится жонглировать языками для управления эстетикой, тот и получит самый сочный контент, пока остальные будут жаловаться на «глупый AI».

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с