3,583 papers
arXiv:2607.21518 73 23 июля 2026 г. PRO

Id-Censor-Superego: скрытая манипулятивная цель проходит защиту LLM, если её "отмыть" через промежуточный слой

КЛЮЧЕВАЯ СУТЬ
Обнаружено: модель реагирует не на смысл задачи, а на конкретные слова в ней — «обмани», «скрой» включают защиту, а та же цель без этих слов проходит спокойно. Метод показывает, как проверить AI-бота на скрытую предвзятость: убираешь триггерные слова из инструкции — и смотришь, развернётся ли ответ. Схема из трёх ролей пропускает грязную задачу через цепочку, где каждый следующий агент видит только обрубленный кусок контекста — финальная модель отвечает пользователю, не видя исходных «токсичных» слов, только очищенное намерение. Итог — ответ разворачивается на 180 градусов: от сопротивления цели к её поддержке.
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с