3,583 papers
arXiv:2609.02255 71 2 сент. 2026 г. FREE

Семантическая утечка: почему правильный текст на картинке не спасает от испорченной сцены

КЛЮЧЕВАЯ СУТЬ
Обнаружено: генератор картинок бракует не текст, а сцену вокруг него — напиши «яблочный сок» на бутылке ополаскивателя, и на фоне сами появятся яблоки, хоть ты об этом не просил. Метод из T2LSC-Bench позволяет держать текст строго локальным, не давая модели «дофантазировать» сцену под его смысл. Пара анти-leakage фраз в промпте режет утечку смысла почти вдвое — с 16.6% до 8.4%, а точность самого текста при этом не проседает: 91% против 91%.
Адаптировать под запрос

Когда просишь генератор картинок написать текст в конкретном месте — на этикетке, вывеске, упаковке — модель может "растащить" смысл этого текста по всей картинке. Просишь написать «ЯБЛОЧНЫЙ СОК» на бутылке для полоскания рта — текст отрендерится идеально, но на фоне вдруг появятся яблоки, хотя ты об этом не просил.

Главная находка: точный текст на картинке не гарантирует, что остальная сцена не поменяется. Когда смысл текста конфликтует с объектом (пишешь про сок на бутылке ополаскивателя), частота такой "утечки" смысла в фон подскакивает с 1% до 18%, а точность самого текста почти не падает — 91% против 91%. Модель хорошо справляется с рендерингом букв, но при этом "додумывает" сцену, чтобы текст выглядел логично, даже если её не просили.

Решение простое: явные анти-leakage инструкции в промпте («не меняй интерпретацию сцены», «не добавляй объекты, связанные по смыслу с текстом») снижают утечку почти вдвое — с 16.6% до 8.4% — без потери точности рендеринга текста.

🔬

Схема метода

БАЗОВЫЙ ПРОМПТ: субъект + сцена + текст + место рендеринга
   → риск: модель "довообразит" сцену под смысл текста

+ АНТИ-LEAKAGE КОНСТРЕЙНТЫ → текст остаётся локальным, сцена не меняется
   → "не меняй интерпретацию субъекта/сцены под влиянием текста"
   → "не добавляй объекты/детали, связанные по смыслу с текстом"

Всё выполняется в одном промпте, без отдельных шагов и запросов.


🚀

Пример применения

Задача: Дизайнер делает рекламный мокап для распродажи техники — нужна фотография кофемашины на кухне с наклейкой «TECH SALE» на корпусе. Смысл текста не связан с кофемашиной или кухней — риск, что модель добавит на фон ноутбуки, гаджеты, провода.

Промпт:

Сгенерируй фотореалистичное изображение кофемашины на кухонном столе.
На передней панели машины — наклейка с текстом "TECH SALE", 
крупным чётким шрифтом, легко читаемая.

Не меняй интерпретацию кухни или кофемашины под влиянием 
смысла текста на наклейке.
Не добавляй никаких дополнительных объектов, символов или деталей 
интерьера, семантически связанных с текстом на наклейке.
Сохрани кухню в нейтральном повседневном виде, 
без тематического оформления вокруг наклейки.

Результат: Модель точно рендерит текст «TECH SALE» на наклейке. Кухня и кофемашина остаются нейтральными — без непрошенных гаджетов, техники или других предметов, которые модель могла бы добавить, «отработав» смысл слова «TECH» визуально.


🧠

Почему это работает

Генератор картинок стремится сделать сцену целостной и правдоподобной. Если текст на объекте семантически не совпадает с контекстом — модель считает это сигналом, что сцену нужно "подправить", чтобы текст выглядел логичным элементом картины, а не случайной надписью.

При этом модель хорошо реагирует на прямые негативные инструкции — явный запрет что-то менять или добавлять работает как жёсткий барьер, который перекрывает эту "тягу к правдоподобию".

Явно прописывая границы («меняй только это, не трогай остальное»), мы не даём модели домысливать логичную картину вокруг текста. Она рендерит текст локально и оставляет всё остальное как в исходном описании.

Рычаги управления: - Фраза "не меняй интерпретацию сцены/субъекта под влиянием текста" — прямой блок против переосмысления сцены. - Фраза "не добавляй объекты/детали, связанные по смыслу с текстом" — блок против добавления "поддерживающих" предметов. - Закрытая композиция (мало объектов в кадре, крупный план) снижает риск утечки сильнее, чем открытая сцена с кучей деталей — меньше "носителей" для чужого смысла. - Если текст семантически совпадает с объектом — утечка почти исчезает сама, без констрейнтов.


📋

Шаблон промпта

{Описание сцены и объекта}. На {место/анкер} размещён текст: 
"{целевой текст}", чётко читаемый и правильно написанный.

Не меняй интерпретацию {субъекта} или сцены под влиянием 
смысла этого текста.
Не добавляй дополнительные объекты, символы или детали, 
семантически связанные с текстом, за пределами указанного места.
Сохрани {субъект} и окружение в исходном, нейтральном виде.

Подставь: {субъект} — что изображено (бутылка, вывеска, упаковка), {место/анкер} — где именно должен быть текст (этикетка, табличка, наклейка), {целевой текст} — сам текст, который нужно отрендерить.

🚀 Быстрый старт — вставь в чат:

Вот шаблон промпта против "утечки смысла" при генерации картинок с текстом. 
Адаптируй под мою задачу: [твоя задача]. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит, что за объект, где должен быть текст и что нельзя менять на фоне — потому что именно эти детали определяют, будет ли модель "довообразить" сцену вместо того, чтобы держать текст локальным.


⚠️

Ограничения

⚠️ Эффект модельно-зависимый: анти-leakage констрейнты снижают утечку, но не убирают её полностью — разные модели реагируют по-разному.

⚠️ Сильный конфликт смысла — сильный риск: если текст радикально противоречит объекту (не просто "не совпадает", а прямо конфликтует), даже явные запреты не всегда спасают.

⚠️ Открытая сцена — больше риска: чем больше предметов в кадре, тем выше шанс, что модель "пристроит" смысл текста куда-то на фон, даже с констрейнтами в промпте.


🔍

Как исследовали

Исследователи собрали 50 "объектов-сидов" — вывеска, машина, упаковка, стенд — каждому дали естественное место для текста. К каждому объекту привязали три варианта текста: один соответствует объекту, два конфликтуют по смыслу. Дальше скомбинировали это с открытой/закрытой сценой, обычным/анти-leakage промптом и языком (английский/китайский) — получилось 1200 промптов на каждую из шести моделей (Doubao, две версии Gemini, GPT-image, Wan, Qwen) — всего 7200 генераций.

Оценивали через связку OCR (распознавание текста) и VLM-судью (модель, которая смотрит на картинку и оценивает смысл) — отдельно мерили точность текста и отдельно "утечку" смысла в остальную сцену. На 420 изображениях проверили автоматическую оценку живыми людьми — совпадение оказалось высоким.

Самое удивительное: точность текста в стрессовых условиях почти не падает (91.4% → 90.9%), а утечка смысла взлетает почти в 15 раз (1.2% → 18.1%). Это значит — правильный текст и целостность сцены — это две разные вещи, и хорошее выполнение одной задачи не говорит ничего о другой.


🔗

Ресурсы

T2LSC-Bench (Text-to-Image Localized Semantic Control Benchmark). Код и данные: github.com/LLMSecResearch/T2LSC-Bench. Авторы: Yan Wang, Xinyi Hou, Weiguo Lin, Junjun Si, Siwei Ma — Communication University of China, Huazhong University of Science and Technology, Peking University.


📋 Дайджест исследования

Ключевая суть

Обнаружено: генератор картинок бракует не текст, а сцену вокруг него — напиши «яблочный сок» на бутылке ополаскивателя, и на фоне сами появятся яблоки, хоть ты об этом не просил. Метод из T2LSC-Bench позволяет держать текст строго локальным, не давая модели «дофантазировать» сцену под его смысл. Пара анти-leakage фраз в промпте режет утечку смысла почти вдвое — с 16.6% до 8.4%, а точность самого текста при этом не проседает: 91% против 91%.

Принцип работы

Не проси только точный текст — проси текст, который ничего не меняет вокруг себя. Модель по умолчанию тянется к правдоподобности сцены целиком, а не только к точности надписи. Правило: явно запрещай, а не рассчитывай на здравый смысл модели — фразы «не меняй интерпретацию сцены» и «не добавляй связанные по смыслу объекты» работают как жёсткий барьер против привычки модели дорисовывать логичную картинку вокруг слов.

Почему работает

Причина конкретная: модель видит конфликт смысла — сок на бутылке для полоскания рта — как сигнал: сцену надо «подправить», чтобы текст выглядел уместным, а не случайной наклейкой. Без запретов утечка смысла подскакивает с 1% до 18% именно в таких конфликтных парах. Жесть — закрытая композиция с парой предметов в кадре снижает утечку сильнее любых текстовых запретов: просто потому что у смысла текста меньше «носителей» на фоне, куда он мог бы перетечь.

Когда применять

Генерация изображений с текстом → для рекламных мокапов, упаковки, вывесок, наклеек, где смысл надписи может не совпадать с объектом (напиток на спортивном инвентаре, «TECH SALE» на кофемашине). Особенно важно, когда текст семантически конфликтует с предметом — иначе модель пририсует тематический декор на фоне сама. Не подходит для сцен с прямым сильным противоречием текста и объекта — здесь даже явные запреты не всегда спасают.

Мини-рецепт

1. Опиши сцену и объект: субъект, окружение, стиль — без текста пока.
2. Укажи анкер под текст: этикетка, наклейка, табличка — и сам текст, который нужно отрендерить.
3. Добавь два запрета: «не меняй интерпретацию сцены под влиянием текста» и «не добавляй объекты, связанные по смыслу с текстом».
4. Держи композицию закрытой: меньше предметов в кадре — меньше шансов, что смысл текста «просочится» куда-то ещё.

Примеры

[ПЛОХО] : Сгенерируй бутылку ополаскивателя для рта с текстом "ЯБЛОЧНЫЙ СОК" на этикетке
[ХОРОШО] : Сгенерируй бутылку ополаскивателя для рта с текстом "ЯБЛОЧНЫЙ СОК" на этикетке, чётким читаемым шрифтом. Не меняй интерпретацию бутылки или её содержимого под влиянием текста на этикетке. Не добавляй яблоки, фрукты или любые детали, семантически связанные с текстом, за пределами этикетки. Сохрани бутылку и фон в нейтральном виде.
Источник: T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image Generation
ArXiv ID: 2609.02255 | Сгенерировано: 2026-09-03 07:22

Проблемы LLM

ПроблемаСутьКак обойти
Точный текст на картинке не защищает сцену от искаженияПросишь написать текст в конкретном месте (на этикетке, вывеске, упаковке). Текст рендерится идеально. Но если смысл текста не совпадает с объектом — модель добавляет на фон предметы, связанные по смыслу с текстом, хотя ты об этом не просилДобавь в промпт прямой запрет: "не меняй интерпретацию сцены/объекта под влиянием текста" и "не добавляй объекты, связанные по смыслу с текстом"

Методы

МетодСуть
Анти-утечка инструкции — держат текст локальнымДобавь в промпт две явные негативные инструкции: (1) "не меняй интерпретацию субъекта или сцены под влиянием смысла текста", (2) "не добавляй объекты/детали, семантически связанные с текстом, за пределами места рендеринга". Почему работает: модель стремится сделать сцену логичной и обычно "подтягивает" фон под смысл текста. Прямой запрет перекрывает эту тягу. Когда да: текст на объекте семантически не связан с объектом (реклама техники на кофемашине, "яблочный сок" на бутылке ополаскивателя). Когда нет: текст сильно и прямо противоречит объекту — тогда запреты помогают слабее

Тезисы

ТезисКомментарий
Генератор изображений домысливает сцену, чтобы текст выглядел логичнымМодель стремится к целостной, правдоподобной картинке. Если текст на объекте не совпадает по смыслу с самим объектом — модель воспринимает это как сигнал "поправить" сцену: добавить предметы, которые объясняют текст. Это происходит даже когда сам текст отрендерен без ошибок. Применяй: если в задаче текст семантически конфликтует с объектом (слово "сок" на бутылке для рта, "техника" на кухонной вывеске) — заранее закладывай в промпт запрет на изменение сцены
📖 Простыми словами

T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image Generation

arXiv: 2609.02255

Нейросети для генерации картинок страдают синдромом семантической утечки. Когда ты просишь нарисовать кофемашину с маленькой наклейкой "TECH SALE", модель не изолирует надпись. Она цепляется за слово TECH, считает его главной темой всей сцены и начинает пихать на фон ноутбуки, микросхемы и провода. Для диффузионки глобальная связность важнее твоих точечных указаний — и это полный провал для точной работы.

Это как попросить декоратора прикрепить ценник на торт, а он перекрашивает всю кондитерскую в цвета банка, потому что увидел на бирке значок доллара. Формально надпись на месте, но результат полностью запорот из-за тупого стремления связать всё совсем подряд в единый логичный сюжет.

Чтобы системно ловить этот баг, выкатили T2LSC-Bench. Бенчмарк тестирует локализованный семантический контроль — способность генератора держать смысл надписи строго в заданных границах объекта. Модель обязана выдавать локальный элемент без заражения фона, даже если текст на наклейке прямо противоречит окружению.

Тестировали на текстах, но проблема гораздо шире: генерация мерча, реклама, мокапы упаковки и любой брендинг. Везде, где нужно поместить семантически чужеродный объект в нейтральную среду, обычные пайплайны лажают. Вместо строгого следования ТЗ ты получаешь кашу из ассоциаций, сгенерированную на основе одного случайного слова.

Короче: пока нейросети пытаются додумать контекст за тебя, коммерческий дизайн на чистом промптинге не построишь. Либо допиливай генераторы под строгую семантическую изоляцию, либо готовься часами вычищать фон в фотошопе. Архитектуры, которые не тянут T2LSC-Bench, для реального продакшена просто профнепригодны.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с