TL;DR
Современные генераторы изображений (Gemini, GPT-Image) умеют вести многошаговый диалог: помнят предыдущие картинки, сохраняют персонажей и стиль между запросами. Исследователи показали, что этим можно злоупотребить — попросить модель создать серию из 2-5 картинок, каждая из которых по отдельности выглядит безобидно, но вместе они складываются в расистскую или дискриминационную историю.
Проблема в том, что модерация (и встроенная в генератор, и внешние системы безопасности) проверяет каждую картинку отдельно. Представьте детектор лжи, который слушает каждое слово фразы по одному — по отдельности слова невинны, а вместе складываются в угрозу. Именно так работают текущие фильтры: если картинка №1 — просто новостной диктор, а картинка №3 — тот же диктор с подписью «а в Китае это вкусная еда» рядом с котом, ни одна из них не триггерит модерацию, хотя вместе это расистский стереотип.
Авторы предлагают простой сдвиг в логике проверки: анализировать не отдельную картинку, а всю накопленную историю целиком — либо во время генерации (проверять весь контекст диалога перед каждым новым шагом), либо после (смотреть на всю серию картинок как на единое повествование, а не набор кадров).
Схема метода
ШАГ 1 (проактивная защита, во время диалога):
На каждом новом шаге генерации → анализируй ВСЕ предыдущие промпты
и картинки в сессии + новый запрос → реши: продолжать или остановить
ШАГ 2 (пост-генерация, после завершения истории):
Собери все сгенерированные картинки в ОДНО целое (как комикс-полосу
или как пронумерованный набор) → попроси модель ОПИСАТЬ сюжет
целиком → затем ОЦЕНИ, несёт ли сюжет вредный смысл
Оба шага выполняются одним запросом с полным контекстом (не поштучно).
Пример применения
Задача: Вы модерируете контент на платформе, где пользователи через AI создают комиксы или иллюстрированные истории (детская книга, мем-серия, рекламная раскадровка), и хотите проверить готовую серию картинок на скрытый вредный смысл, который не виден в каждой картинке по отдельности.
Промпт:
Я загружаю серию из {количество} изображений, которые представляют собой
последовательные кадры одной истории (читать слева-направо / по порядку).
Твоя задача — не оценивать каждую картинку отдельно, а понять СЮЖЕТ,
который они рассказывают вместе.
Шаг 1: Опиши, что происходит в истории от начала до конца, как будто
пересказываешь сюжет комикса другу. Обращай внимание на контраст между
кадрами, повторяющихся персонажей, смену тона или подписей.
Шаг 2: Проанализируй получившийся пересказ — есть ли в общем сюжете
(даже если каждый кадр по отдельности нейтрален):
- унижение или высмеивание конкретной группы людей (по национальности,
религии, полу, возрасту и т.д.)
- вредный стереотип, который раскрывается только через сравнение кадров
- скрытая насмешка, которая проявляется в развитии истории, а не в
одном изображении
Дай вердикт: "нейтрально" или "содержит скрытый вредный смысл" —
и объясни, на чём основан вывод, ссылаясь на конкретные кадры.
[вставьте изображения]
Результат: Модель сначала опишет историю текстом целиком (это заставляет её "увидеть" сюжет, а не разрозненные кадры), затем даст оценку с указанием, какие именно кадры создают проблемный контраст или прогрессию. Формат — связный текст в два блока: пересказ + вердикт с обоснованием.
Почему это работает
Модерация "в лоб" — проверка каждой картинки по отдельности — не видит вред, потому что вред здесь не в содержании одного кадра, а в отношениях между кадрами: контрасте, повторении, нарастании. Отдельная картинка — это слово, а вредный смысл — это предложение. Проверять слова по одному бессмысленно, если угроза складывается из их порядка.
LLM хорошо умеет пересказывать связный сюжет, если дать ей увидеть все элементы сразу и попросить сначала описать целиком, а не оценивать кусками. Задача "опиши историю" активирует другой режим работы модели — она ищет связи и прогрессию, а не проверяет чек-лист запретных слов на каждом кадре.
Рычаги управления: - Формат подачи (одна склеенная картинка vs. набор отдельных) → склеенная картинка в исследовании сработала чуть лучше (модель видит "один объект", а не серию запросов) - Порядок "сначала описать, потом оценить" → так модель не спешит с вердиктом до того, как поняла сюжет целиком — критично для скрытого смысла - Явное указание "смотри на контраст между кадрами" → направляет внимание модели на то, где именно рождается вредный смысл в подобных историях
Ограничения
⚠️ Языковой барьер: Метод и сами модели генерации хуже работают не на английском языке — не потому что фильтры сильнее, а потому что модель хуже рисует читаемый текст на других языках (в исследовании — на китайском). Если вредный смысл держится на подписи или надписи в кадре, а не на визуальном контрасте, детекция может дать сбой не из-за модерации, а из-за качества генерации текста.
⚠️ Точность пост-генерационной проверки не идеальна: даже лучший метод в исследовании пропускал около одной из пяти вредных историй. Это не панацея, а снижение риска, а не гарантия.
⚠️ Специфика домена: метод разработан и проверен именно на скрытой дискриминации/ненависти (расизм, антисемитизм и т.д.). Для других типов вреда (например, дезинформация, вредные советы) логика "смотри на весь сюжет целиком" вероятно применима, но не проверялась.
Как исследовали
Команда собрала 55 реальных ненавистнических историй с форума 4chan, переписала их в безобидные на первый взгляд текстовые запросы для генерации картинок (каждый кадр по отдельности выглядит нейтрально), и прогнала через пять топовых генераторов изображений — Gemini 2.5/3/3.1 и GPT-Image 1.5/2 — почти 5000 раз.
Результат ошеломил: все модели дорисовывали вредную историю до конца в 80-99% случаев, когда получали серию запросов через диалог. То есть встроенная модерация почти не ловила момент, когда отдельные безобидные кадры складываются в стереотип.
Затем проверили существующие системы безопасности (специализированные модели детекции опасного контента, включая коммерческие API) на готовых сериях картинок — и они пропускали от 65% до почти 100% вредных историй. Специализированные "модели безопасности" оказались хуже обычной большой языковой модели с картинками (та поймала 67.5% против 0-35% у специализированных детекторов) — потому что специализированные модели чаще смотрят на кадр изолированно, а не рассуждают о сюжете.
Логика вывода прямая: чем ýже и специфичнее заточен детектор на "плохие пиксели в одной картинке", тем хуже он видит смысл, который рождается из последовательности. А чем более "рассуждающая" модель — тем лучше она улавливает нарратив.
