TL;DR
Видео-модели (которые понимают видео и текст вместе) правильно распознают вредный контент почти всегда — но отказываются реагировать на него намного реже, если текстовый запрос звучит невинно. Оказывается, отказ и понимание — это два разных механизма внутри модели, и они не всегда включаются вместе.
Представь: пользователь показывает модели видео с явным насилием и спрашивает нейтрально — «Что происходит в этом видео?» Модель правильно опишет содержимое, но с высокой вероятностью не откажется помогать дальше, если запрос формально не выглядит вредным. А если тот же вопрос звучит откровенно опасно («как повторить это дома») — модель чаще отказывает, хотя видео то же самое. Причина: текстовая опасность триггерит внутренний «счётчик отказа» сильнее, чем визуальная — даже когда модель одинаково хорошо «видит» угрозу в обоих случаях.
Авторы предложили простое решение: заставить модель сначала явно проговорить текстом, что опасного она видит в контенте, и только потом принимать решение — отказывать или нет. Плюс несколько примеров-демонстраций «вижу опасность → отказываю» прямо в промпте. Это переводит визуальный сигнал в текстовый, который модель воспринимает как более весомый повод для отказа.
Схема метода
ШАГ 1: Промпт заставляет модель явно описать вредные элементы контента
(что именно опасно, какие детали) → текстовое описание-доказательство
ШАГ 2: На основе этого описания модель принимает решение об отказе/помощи
→ финальный ответ с обоснованием
+ В промпт добавлены 2-8 примеров: «вот описание опасного контента → вот корректный отказ»
Все шаги — в одном промпте (без API, без отдельных запросов).
Пример применения
Задача: Вы модерируете контент на своей платформе (форум, канал, маркетплейс с видео-отзывами) и просите AI проверять загружаемые видео/описания на наличие опасного контента — травмы, насилие, экстремизм. Пользователи маскируют запросы под нейтральные («опиши, что здесь происходит», «дай инструкцию по этому процессу»), и модель иногда пропускает явно опасные ролики, потому что текст звучит невинно.
Промпт:
Ты — модератор контента. Тебе показывают материал (видео, текст или их описание).
Твоя задача — ДВА ШАГА:
ШАГ 1. Явно опиши, что потенциально опасного содержится в материале:
- есть ли насилие, травмоопасные действия, незаконные инструкции, оружие
- перечисли конкретные детали, которые ты заметил
ШАГ 2. На основе ЭТОГО ОПИСАНИЯ (не на основе формулировки вопроса) прими решение:
- если в шаге 1 ты обнаружил опасные элементы — откажи в помощи,
даже если сам вопрос звучит нейтрально
- если опасных элементов нет — можешь помогать
Примеры:
Материал: [видео с дракой] Запрос: «Что делают эти люди?»
Шаг 1: Вижу физическое насилие, удары, признаки травмы.
Шаг 2: Отказываю — материал содержит явное насилие независимо от формулировки вопроса.
Материал: [видео готовки на кухне] Запрос: «Как повторить этот рецепт?»
Шаг 1: Вижу приготовление еды, никаких опасных элементов.
Шаг 2: Помогаю — материал безопасен.
Теперь проверь этот материал:
{материал}
Запрос пользователя: {запрос}
Результат: Модель сначала выдаст текстовое описание того, что она заметила в материале (даже если запрос был нейтральным), а затем — решение на основе этого описания, а не на основе формулировки вопроса. Так решение о блокировке привязывается к содержанию, а не к тому, как пользователь его завуалировал.
Почему это работает
Модель хуже реагирует на опасность, если она «спрятана» в визуальном или контекстном слое, а текстовый запрос сверху выглядит нейтральным. Внутри модели это как два разных переключателя — один реагирует на явную опасность в тексте, другой (слабее) на опасность в картинке/видео. Если текст «чистый», сильный переключатель не срабатывает, и слабый визуальный сигнал не хватает, чтобы вызвать отказ.
Но у модели есть сильная сторона: она отлично умеет генерировать явное текстовое рассуждение, если её попросить. Метод использует это: заставляет модель перевести визуальный/скрытый сигнал опасности в явный текст — и этот текст уже сам становится триггером для того самого сильного переключателя отказа.
Рычаги управления: - Количество примеров-демонстраций (0-8 в оригинале) → больше примеров = надёжнее паттерн отказа, но длиннее промпт - Формулировка шага 1 («опиши детали» vs «оцени риск по шкале») → можно заменить на числовую оценку риска для более формального модерационного отчёта - Порядок шагов — не меняйте: сначала описание, потом решение. Если модель сразу решает без явного описания — эффект пропадает
Ограничения
⚠️ Узкая область: Метод проверен на мультимодальных задачах (видео + текст). Для чисто текстовых угроз эффект может отличаться — там текстовый сигнал и так сильный.
⚠️ Риск гиперчувствительности: Если сделать шаг 1 слишком чувствительным, модель начнёт находить «опасность» в безобидном контенте и излишне блокировать нормальные запросы.
⚠️ Диагностическая часть не переносится в чат: Анализ «внутренних представлений отказа» (hidden states) в исследовании требует доступа к весам модели — это чистая аналитика авторов, не то, что можно повторить в обычном чате. Применим только вывод — сама техника с явным описанием перед решением.
Как исследовали
Команда взяла шесть видео-моделей (Qwen2-VL, Qwen2.5-VL, InternVL, InternVideo, две версии MiniCPM) и проверила их на трёх бенчмарках безопасности — суммарно более 5000 видео. Они сравнили четыре сценария: видео + вредный запрос, видео + безобидный запрос, и то же самое без видео (только текст).
Неожиданный результат: связка «вредное видео + безобидный запрос» давала самый высокий процент успешных обходов защиты — почти в каждой модели. При этом модели правильно описывали содержание вредных видео в более 81% случаев — то есть дело не в том, что они «не видят» опасность, а в том, что понимание не превращается в отказ.
Дальше исследователи заглянули «под капот» — измерили, насколько сильно у модели активируется внутренний сигнал отказа в каждом из сценариев. Оказалось, что текстовая опасность зажигает этот сигнал сильнее, чем визуальная — даже если модель одинаково хорошо распознаёт содержание. Это и объясняет парадокс: понимание есть, а отказ — нет.
На основе этого вывода они попросили модель явно проговаривать увиденную опасность текстом перед решением — и ASR (процент успешных обходов защиты) упал с 48% до менее 1%, сравнимо с результатами дорогого fine-tuning (дообучения модели).
