3,583 papers
arXiv:2607.24898 78 27 июля 2026 г. PRO

Community-Specific Toxicity Detection: почему текстовые правила не учат ИИ видеть "свой" вред

КЛЮЧЕВАЯ СУТЬ
35% картинок, которые детектор токсичности назвал безопасными — на деле пропитаны стереотипами о людях с инвалидностью (слепого рисуют с повязкой на глазах во время готовки, будто это норма). Когда GPT-5 дали текстовое описание правил — точность оказалась хуже случайного тыка пальцем в небо. Метод заменяет абстрактное правило на 3-5 конкретных примеров: картинка — вердикт — почему. Результат: F1 у GPT-4o подскочил с почти нуля до 0.5–0.78. Позволяет настроить ИИ на оценку контента по узким, нестандартным критериям — там, где обычные фильтры мата и NSFW просто не видят проблему.
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с