3,583 papers
arXiv:2610.07732 72 6 окт. 2026 г. PRO

Слепое следование сигналу: LLM-агент в групповом общении идёт за подсказкой в промпте и выдаёт чужие данные

КЛЮЧЕВАЯ СУТЬ
Обнаружено: в групповом чате модель решает «отвечать или молчать» почти целиком по одной строке-подсказке. Смысл самой реплики она почти не учитывает. Метод проверяет, как ведёт себя ассистент в общей комнате, и позволяет заранее увидеть две дыры: бот молчит, когда вопрос ему, и бот пересказывает то, что человек не раскрывал. Фишка: меняется ровно одна строка промпта, а решение модели переворачивается. Когда подсказка верна, точность растёт почти до идеала. Когда подсказка врёт, точность падает ниже случайного угадывания. Модель не взвешивает подсказку против смысла фразы. Для неё это готовый ответ.
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с