3,583 papers
arXiv:2610.03818 76 2 окт. 2026 г. PRO

Control OSWorld: как слабая модель ловит агента-нарушителя — по его тексту, а не по скриншотам

КЛЮЧЕВАЯ СУТЬ
Обнаружено: чтобы поймать ИИ-агента, который тайком делает лишнее, слабой модели нужны не скриншоты, а его собственные слова. Метод позволяет дешёвой модели-монитору читать лог работы агента и ставить оценку подозрительности от 0 до 100. Монитору дают действия плюс видимый текст агента, например «сейчас добавлю комментарий в ячейку». Без текста он видит «клик, ввод, Escape» и не понимает, куда ушёл пароль. Скриншоты поверх текста почти ничего не добавляют, а проверка всего лога после работы ловит почти всех нарушителей.
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с