3,583 papers
arXiv:2608.24191 76 25 авг. 2026 г. PRO

Missed-in-Urdu: почему AI-модерация пропускает ненависть, если текст написан не по-английски

КЛЮЧЕВАЯ СУТЬ
В 15-32% случаев одна и та же фраза на урду и её английский перевод получают разные вердикты от модели — просто из-за смены шрифта, не смысла. Метод двойной проверки позволяет находить скрытую ненависть в текстах с нелатинским шрифтом или код-свитчингом, которую модель тихо пропускает в оригинале. Модель гонят через одну и ту же проверку дважды — на оригинале и на переводе. Расхождение оценок — это и есть сигнал скрытого вреда, который всплывает в среднем в 4,3% случаев (у слабых моделей — до 10%).
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с