TL;DR
Если генерируешь картинку через Gemini, ChatGPT или Midjourney, язык, на котором ты пишешь промпт, незаметно меняет результат — не только смысл, но и культурный стиль, расу персонажей и надёжность текста на изображении. Исследователи собрали бенчмарк из 33 тысяч промптов на 10 языках и прогнали через 17 современных моделей генерации изображений (Nano Banana, Z-Image, Qwen-Image и другие), чтобы понять — насколько справедливо и предсказуемо модели работают с разными языками.
Главная боль: одна и та же сцена на разных языках выглядит по-разному, и это не всегда очевидно из промпта. Например, промпт "женщина со статуей морских коньков" на японском выдаёт картинку в восточноазиатской эстетике с карпом, на хинди — в традиционном индийском скульптурном стиле, хотя ни слова про "стиль" в промпте нет. А если нужно, чтобы на картинке была надпись — арабский, деванагари, кириллица или иероглифы часто рендерятся с искажёнными, нечитаемыми буквами, тогда как латиница (английский, испанский, французский) — почти всегда чисто.
Метод исследования — не техника, а находка: язык промпта — это скрытый переключатель культурного стиля, зашитый в модель через данные обучения. Но это работает как обоюдоострый рычаг: выигрываешь в аутентичности стиля, теряешь в надёжности рендеринга текста и рискуешь получить стереотипную демографию персонажей.
Схема находки
Промпт на языке X (без явных слов о стиле) → модель добавляет культурные маркеры языка X:
→ архитектура, одежда, орнаменты, типаж лиц персонажей
Текст для рендеринга на картинке:
→ Латиница (EN/ES/FR/PT) — рендерится надёжно
→ Нелатиница (AR/HI/ZH/JA/KO/RU) — часто ломается: искажённые буквы, нечитаемый текст
Пример применения
Задача: Российский бренд специй хочет сделать рекламные карточки для маркетплейса в аутентичном "индийском" визуальном стиле — без клишированных фраз типа "в индийском стиле, сари, орнамент", которые часто дают штампованный результат.
Промпт (сначала попроси LLM перевести, потом вставь перевод в генератор картинок):
Переведи на хинди, сохраняя все детали сцены:
"Женщина стоит на рынке с корзиной ароматных специй,
тёплый вечерний свет, реалистичное фото, глубина резкости"
Полученный перевод на хинди вставляешь как промпт в Gemini (Nano Banana), DALL-E или другой генератор.
Результат: Модель с высокой вероятностью добавит культурно узнаваемые детали — характерную одежду, архитектуру рынка, освещение — без единого явного упоминания стиля в промпте. Эффект достигается только за счёт смены языка.
Отдельно про текст на картинке: если нужна надпись "Скидка 50%" прямо на банере — не пытайся рендерить кириллицу через T2I-модель. Вероятность искажённых букв высокая. Лучше сгенерировать фон отдельно (промпт на английском описании сцены, без текста) и добавить надпись вручную в Canva или другом редакторе.
Почему это работает
Модели генерации изображений обучены в основном на англоязычных датасетах (LAION, COCO Captions). Из-за этого у них сильнее развиты ассоциации именно для английского и близких языков — испанского, французского, португальского. Для хинди, арабского, корейского таких прочных связей "слово → визуальный образ" меньше.
Но при этом модель всё-таки улавливает языковые корреляции: если промпт написан на хинди, она "включает" накопленные в обучающих данных ассоциации языка с индийской культурой — даже если ты явно не просил "индийский стиль". Это происходит потому, что язык и культурный контекст в данных обучения идут парой.
Рычаги, которые можно крутить: - Язык промпта → переключает культурный стиль результата без явных стилевых слов - Латиница vs нелатиница в тексте для рендера → латиница надёжна, остальное — риск - Смена языка → меняет не только стиль, но и расу/пол персонажей на картинке (это стоит держать в голове, если делаешь инклюзивный контент)
Шаблон промпта
Переведи следующее описание сцены на {язык нужной культуры},
сохраняя все детали и стиль:
"{описание сцены на русском}"
Не добавляй явных упоминаний стиля или культуры —
только перевод исходного текста.
Плейсхолдеры: {язык нужной культуры} — хинди, японский, арабский и т.д.; {описание сцены} — твой обычный промпт для генерации картинки.
🚀 Быстрый старт — вставь в чат:
Мне нужно сгенерировать изображение в аутентичном культурном стиле
через язык промпта, а не явные слова о стиле. Вот моя задача: {твоя задача}.
Переведи промпт на нужный язык культуры и объясни, что подставить.
[вставить шаблон выше]
LLM спросит про целевую культуру и детали сцены — потому что без точного языка перевода эффект не сработает, а без деталей сцены перевод может потерять смысл.
Ограничения
⚠️ Рендеринг текста ненадёжен: если нужна надпись на кириллице, арабском, деванагари, хангыле или иероглифах прямо на картинке — велик риск искажённых, нечитаемых букв, независимо от модели.
⚠️ Эффект непредсказуем: смена языка может улучшить культурную аутентичность, но одновременно снизить общее качество и реализм картинки — это компромисс, не гарантированный выигрыш.
⚠️ Стереотипы усиливаются: смена языка промпта тянет за собой демографические предубеждения из обучающих данных — можно получить клишированную расу или пол персонажей вместо нейтрального результата.
Как исследовали
Команда собрала бенчмарк LingT2I — 33 тысячи промптов на 10 языках (английский, китайский, хинди, испанский, арабский, французский, португальский, русский, японский, корейский), покрывающих разные системы письма — от латиницы до иероглифов. Прогнали через 17 современных моделей генерации изображений, включая Nano Banana, Z-Image, Qwen-Image, EasyText — по двум задачам: генерация сцены по описанию и рендеринг текста на картинке.
Качество измеряли мультиязычной версией CLIPScore и оценщиками на базе других языковых моделей (Qwen-VL, Gemini), а точность текста — посимвольным сравнением. Результат: модели общего назначения показывают сильный разрыв — хинди и арабский заметно хуже английского и испанского, а специализированные мультиязычные модели (Qwen-Image) справляются равномернее.
Самое неожиданное — вопреки распространённому мнению о повсеместной "вестернизации" в генерации изображений, 79,6% картинок с явными культурными признаками совпадали по культуре с языком промпта. То есть модель не тянет всё к западной эстетике по умолчанию — она честно отражает культурные ассоциации языка, на котором её попросили.
Ресурсы
LingT2I benchmark, GitHub, HuggingFace dataset. Авторы: Sicheng Zhang и коллеги, Khalifa University, Queen Mary University of London, CUHK, University of Western Australia, University of Melbourne, University of Central Florida.
