3,583 papers
arXiv:2608.27009 74 27 авг. 2026 г. PRO

Name-superstition: почему AI-агенты отказывают в безопасных задачах из-за "страшных" слов

КЛЮЧЕВАЯ СУТЬ
Обнаружено: guardrail (фильтр безопасности агента) видит слово malware в названии файла — и блокирует удаление, хотя точно такую же команду с нейтральным названием пропускает без вопросов. Метод (точнее, вывод из измерения) позволяет снизить ложные отказы в легитимных задачах — просто меняя порядок подачи контекста. Фишка: не слово решает, а то, что стоит раньше в тексте — авторизация или тревожный термин. Разрешение (роль, факт бэкапа) нужно ставить перед пугающим словом, а не после.
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с