3,583 papers
arXiv:2610.08101 77 6 окт. 2026 г. PRO

Execution Consistency (CAVERT): судья логов агентов, который честно отвечает «не определено», когда в записях не хватает доказательств

КЛЮЧЕВАЯ СУТЬ
Обнаружено: два одинаковых лога могут относиться к соблюдённому и к нарушенному правилу, и никакой ум модели это не исправит. Когда авторы убрали из логов ключевые детали (кто получил, на что опирался, держится ли эффект до срока), 82% пар «норма/нарушение» стали неотличимы. Вернули детали, и различимыми стали 98% пар. Метод CAVERT позволяет проверять, выполнил ли агент свою обязанность к сроку, и честно говорить «не определено», когда в записях не хватает доказательств. Фишка: судья оценивает не результат, а цепочку «получил → использовал → эффект действует на дедлайн». Модель достаёт связи из логов, а вердикт выносит жёсткий код, а не LLM. В итоге 87% точности против 81% у обычного LLM-судьи «по контракту».
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с