3,583 papers
arXiv:2608.05210 76 5 авг. 2026 г. FREE

Hateful Visual Story Detection: как модерация упускает вред, который складывается из безобидных картинок

КЛЮЧЕВАЯ СУТЬ
Парадокс: пять картинок в серии проходят любую модерацию по отдельности — а вместе складываются в расистский стереотип. Метод позволяет находить вред, который прячется не в одном кадре, а в переходах между ними. Модель сначала пересказывает всю историю целиком, а потом уже выносит вердикт — это заставляет её увидеть прогрессию и контраст кадров. Даже лучший вариант метода пропускает каждую пятую вредную историю, но это всё равно в разы лучше проверки картинок по одной.
Адаптировать под запрос

TL;DR

Современные генераторы изображений (Gemini, GPT-Image) умеют вести многошаговый диалог: помнят предыдущие картинки, сохраняют персонажей и стиль между запросами. Исследователи показали, что этим можно злоупотребить — попросить модель создать серию из 2-5 картинок, каждая из которых по отдельности выглядит безобидно, но вместе они складываются в расистскую или дискриминационную историю.

Проблема в том, что модерация (и встроенная в генератор, и внешние системы безопасности) проверяет каждую картинку отдельно. Представьте детектор лжи, который слушает каждое слово фразы по одному — по отдельности слова невинны, а вместе складываются в угрозу. Именно так работают текущие фильтры: если картинка №1 — просто новостной диктор, а картинка №3 — тот же диктор с подписью «а в Китае это вкусная еда» рядом с котом, ни одна из них не триггерит модерацию, хотя вместе это расистский стереотип.

Авторы предлагают простой сдвиг в логике проверки: анализировать не отдельную картинку, а всю накопленную историю целиком — либо во время генерации (проверять весь контекст диалога перед каждым новым шагом), либо после (смотреть на всю серию картинок как на единое повествование, а не набор кадров).


🔬

Схема метода

ШАГ 1 (проактивная защита, во время диалога):
На каждом новом шаге генерации → анализируй ВСЕ предыдущие промпты
и картинки в сессии + новый запрос → реши: продолжать или остановить

ШАГ 2 (пост-генерация, после завершения истории):
Собери все сгенерированные картинки в ОДНО целое (как комикс-полосу
или как пронумерованный набор) → попроси модель ОПИСАТЬ сюжет
целиком → затем ОЦЕНИ, несёт ли сюжет вредный смысл

Оба шага выполняются одним запросом с полным контекстом (не поштучно).


🚀

Пример применения

Задача: Вы модерируете контент на платформе, где пользователи через AI создают комиксы или иллюстрированные истории (детская книга, мем-серия, рекламная раскадровка), и хотите проверить готовую серию картинок на скрытый вредный смысл, который не виден в каждой картинке по отдельности.

Промпт:

Я загружаю серию из {количество} изображений, которые представляют собой 
последовательные кадры одной истории (читать слева-направо / по порядку).

Твоя задача — не оценивать каждую картинку отдельно, а понять СЮЖЕТ,
который они рассказывают вместе.

Шаг 1: Опиши, что происходит в истории от начала до конца, как будто 
пересказываешь сюжет комикса другу. Обращай внимание на контраст между 
кадрами, повторяющихся персонажей, смену тона или подписей.

Шаг 2: Проанализируй получившийся пересказ — есть ли в общем сюжете 
(даже если каждый кадр по отдельности нейтрален):
- унижение или высмеивание конкретной группы людей (по национальности, 
  религии, полу, возрасту и т.д.)
- вредный стереотип, который раскрывается только через сравнение кадров
- скрытая насмешка, которая проявляется в развитии истории, а не в 
  одном изображении

Дай вердикт: "нейтрально" или "содержит скрытый вредный смысл" — 
и объясни, на чём основан вывод, ссылаясь на конкретные кадры.

[вставьте изображения]

Результат: Модель сначала опишет историю текстом целиком (это заставляет её "увидеть" сюжет, а не разрозненные кадры), затем даст оценку с указанием, какие именно кадры создают проблемный контраст или прогрессию. Формат — связный текст в два блока: пересказ + вердикт с обоснованием.


🧠

Почему это работает

Модерация "в лоб" — проверка каждой картинки по отдельности — не видит вред, потому что вред здесь не в содержании одного кадра, а в отношениях между кадрами: контрасте, повторении, нарастании. Отдельная картинка — это слово, а вредный смысл — это предложение. Проверять слова по одному бессмысленно, если угроза складывается из их порядка.

LLM хорошо умеет пересказывать связный сюжет, если дать ей увидеть все элементы сразу и попросить сначала описать целиком, а не оценивать кусками. Задача "опиши историю" активирует другой режим работы модели — она ищет связи и прогрессию, а не проверяет чек-лист запретных слов на каждом кадре.

Рычаги управления: - Формат подачи (одна склеенная картинка vs. набор отдельных) → склеенная картинка в исследовании сработала чуть лучше (модель видит "один объект", а не серию запросов) - Порядок "сначала описать, потом оценить" → так модель не спешит с вердиктом до того, как поняла сюжет целиком — критично для скрытого смысла - Явное указание "смотри на контраст между кадрами" → направляет внимание модели на то, где именно рождается вредный смысл в подобных историях


⚠️

Ограничения

⚠️ Языковой барьер: Метод и сами модели генерации хуже работают не на английском языке — не потому что фильтры сильнее, а потому что модель хуже рисует читаемый текст на других языках (в исследовании — на китайском). Если вредный смысл держится на подписи или надписи в кадре, а не на визуальном контрасте, детекция может дать сбой не из-за модерации, а из-за качества генерации текста.

⚠️ Точность пост-генерационной проверки не идеальна: даже лучший метод в исследовании пропускал около одной из пяти вредных историй. Это не панацея, а снижение риска, а не гарантия.

⚠️ Специфика домена: метод разработан и проверен именно на скрытой дискриминации/ненависти (расизм, антисемитизм и т.д.). Для других типов вреда (например, дезинформация, вредные советы) логика "смотри на весь сюжет целиком" вероятно применима, но не проверялась.


🔍

Как исследовали

Команда собрала 55 реальных ненавистнических историй с форума 4chan, переписала их в безобидные на первый взгляд текстовые запросы для генерации картинок (каждый кадр по отдельности выглядит нейтрально), и прогнала через пять топовых генераторов изображений — Gemini 2.5/3/3.1 и GPT-Image 1.5/2 — почти 5000 раз.

Результат ошеломил: все модели дорисовывали вредную историю до конца в 80-99% случаев, когда получали серию запросов через диалог. То есть встроенная модерация почти не ловила момент, когда отдельные безобидные кадры складываются в стереотип.

Затем проверили существующие системы безопасности (специализированные модели детекции опасного контента, включая коммерческие API) на готовых сериях картинок — и они пропускали от 65% до почти 100% вредных историй. Специализированные "модели безопасности" оказались хуже обычной большой языковой модели с картинками (та поймала 67.5% против 0-35% у специализированных детекторов) — потому что специализированные модели чаще смотрят на кадр изолированно, а не рассуждают о сюжете.

Логика вывода прямая: чем ýже и специфичнее заточен детектор на "плохие пиксели в одной картинке", тем хуже он видит смысл, который рождается из последовательности. А чем более "рассуждающая" модель — тем лучше она улавливает нарратив.


📋 Дайджест исследования

Ключевая суть

Парадокс: пять картинок в серии проходят любую модерацию по отдельности — а вместе складываются в расистский стереотип. Метод позволяет находить вред, который прячется не в одном кадре, а в переходах между ними. Модель сначала пересказывает всю историю целиком, а потом уже выносит вердикт — это заставляет её увидеть прогрессию и контраст кадров. Даже лучший вариант метода пропускает каждую пятую вредную историю, но это всё равно в разы лучше проверки картинок по одной.

Принцип работы

Принцип простой: не оценивай кадр — оценивай сюжет. Склей все картинки в одну, как раскадровку комикса. Попроси модель сначала пересказать историю от начала до конца. И только потом спроси: есть ли в этом пересказе скрытый вредный смысл. Порядок «сначала расскажи, потом суди» — и есть весь трюк. Модель не спешит с выводом, пока не увидела картину целиком.

Почему работает

Вред тут не в содержании одного кадра, а в отношениях между кадрами — контрасте, повторении, нарастании тона. Один кадр — это слово. Вредный смысл — это предложение. Проверять слова по одному бессмысленно, если угроза складывается из их порядка. Склеенная в одну картинку серия сработала лучше набора отдельных снимков — модель видит один объект с сюжетом, а не пачку файлов на проверку.

Когда применять

Модерация AI-контента на платформах → конкретно для комиксов, детских книг, рекламных раскадровок и мем-серий, где пользователь генерирует несколько картинок подряд с одним персонажем. Особенно важно, когда сюжет держится на визуальном контрасте между кадрами, а не на одной провокационной картинке. Не подходит как единственная защита, если вред зашит в подпись на неанглийском языке — там подводит качество генерации текста, а не логика метода.

Мини-рецепт

1. Склей серию в одно изображение: собери кадры в раскадровку слева-направо, как страницу комикса — так модель видит единый сюжет, а не пачку файлов.
2. Сначала попроси пересказ: Опиши сюжет от начала до конца, обращая внимание на контраст между кадрами и повторяющихся персонажей.
3. Только потом вердикт: Есть ли в этом пересказе скрытый вредный стереотип или насмешка над конкретной группой людей? Укажи конкретные кадры.
4. Не доверяй одному ответу: точность даже у лучшего метода около 80% — спорные случаи отправляй на ручную проверку.

Примеры

[ПЛОХО] : Проверь эту картинку на наличие расистских стереотипов (запускается отдельно на каждый кадр серии)
[ХОРОШО] : Вот 4 кадра одной истории по порядку. Опиши сюжет целиком, потом скажи — есть ли в нём скрытый вредный смысл, который не виден в одном кадре, а раскрывается через контраст между ними
Источник: Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation
ArXiv ID: 2608.05210 | Сгенерировано: 2026-08-07 04:27

Проблемы LLM

ПроблемаСутьКак обойти
Проверка по частям упускает вред, который рождается из их сочетанияМодерация оценивает каждый элемент серии отдельно — картинку, шаг диалога, реплику. Каждый элемент по отдельности безобиден. Вред появляется только из контраста, повтора или нарастания между элементами. Отдельная проверка это не видит. Проблема актуальна для любых многошаговых генераций: серии картинок, длинных диалогов, цепочек запросовПроверяй не отдельный элемент, а всю накопленную последовательность целиком. Дай модели все шаги сразу и попроси сначала пересказать что происходит "от начала до конца", а потом оценить вред

Методы

МетодСуть
Пересказ перед вердиктом — раскрывает скрытый вред в последовательностиСобери всю серию (картинки, реплики, шаги) в один запрос. Сначала попроси модель описать связный сюжет целиком: "Опиши, что происходит от начала до конца". Только потом — вынести вердикт про вред, ссылаясь на конкретные части. Явно проси искать контраст и повторы между элементами. Почему работает: просьба "оценить вредность" сразу включает режим чек-листа — модель ищет запретные слова в каждом кусочке. Просьба "перескажи сюжет" включает другой режим — поиск связей и прогрессии. Вред, спрятанный в отношениях между частями, виден только во втором режиме. Когда применять: любая проверка многошагового или многочастного контента на скрытый смысл (серии картинок, длинные диалоги, цепочки инструкций). Когда не работает: вред целиком содержится в одном элементе — тогда обычная поштучная проверка справится и без пересказа
📖 Простыми словами

Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation

arXiv: 2608.05210

Проблема в том, что современные нейронки научились в контекст и последовательность, а системы безопасности до сих пор работают как близорукий охранник. Когда ты просишь Gemini или GPT создать серию картинок, они помнят персонажей и стиль, выстраивая цельную историю. Но именно здесь зарыта собака: исследователи доказали, что можно скормить модели цепочку запросов, где каждый отдельный кадр — кристально чист, но вся серия целиком превращается в расистский или дискриминационный трэш. Модель не видит подвоха, потому что ее фильтры настроены на поиск «запрещенки» в моменте, а не в сюжете.

Это как если бы хулиган решил написать оскорбление на заборе, но вместо одного слова крупными буквами, он написал бы по одной безобидной букве на каждом доме в квартале. Формально придраться не к чему: буква «Х» — это просто буква, буква «У» — тоже. Но если ты проедешь по улице на машине, картинка сложится в четкое послание. В этом и заключается скрытый вредоносный умысел: вред здесь не в пикселях конкретного изображения, а в монтажной склейке между ними.

В исследовании это называют многошаговой генерацией визуальных историй. Суть метода в том, что злоумышленник использует «безобидные панели» (Innocent Panels), чтобы обойти цензуру. Например, на первой картинке — один персонаж, на второй — другой, на третьей — их взаимодействие, которое в контексте стереотипов превращается в ненавистнический контент. Стандартная модерация «в лоб» тут пасует, потому что она проверяет слова, а не предложения. Чтобы поймать такой контент, нужно анализировать динамику и контраст между кадрами, а не просто искать голых людей или оружие на отдельном фото.

Этот принцип универсален и касается любого контента, который создается итерациями. Сегодня это комиксы и детские книжки, завтра — рекламные раскадровки или целые AI-фильмы. Если вы модерируете платформу, где пользователь может «докручивать» результат в диалоге с моделью, проверять только последний результат — бессмысленно. Нужно смотреть на всю цепочку, потому что GEO и модерация будущего должны понимать контекст, а не просто сканировать картинку на наличие запрещенных объектов.

Короче: фильтры безопасности сейчас напоминают сито, которое задерживает крупные камни, но пропускает песок, из которого потом строят замок ненависти. Контекстуальный вред — это новая реальность, и проверять картинки по отдельности теперь — полный провал. Нужно либо обучать модераторы видеть «сюжетную линию», либо смириться с тем, что AI будут использовать для создания тонкого, завуалированного хейта, который формально чист, но по факту — токсичен. Кто первым научит нейронки читать между кадров, тот и выживет в эпоху генеративного контента.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с