3,583 papers
arXiv:2609.05036 72 4 сент. 2026 г. PRO

Тест на моральную устойчивость: 4 проверки, которые ловят AI-агента на решениях "по настроению", а не по смыслу

КЛЮЧЕВАЯ СУТЬ
Перепиши один и тот же моральный кейс другими словами, не трогая ни одного факта — и решение AI-агента может развернуться на 99 процентных пунктов. Метод позволяет протестировать любого агента, который принимает решения «одобрить/отказать» или «действовать/ждать», ещё до того как он встретится с реальными людьми. Фишка — заставить модель саму сгенерировать 5 перефразировок и 5 уровней серьёзности, а потом смотреть, ломается ли решение под этим разнообразием. Итог: агент либо держит одну линию, либо решает по формулировке, а не по смыслу.
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с