3,583 papers
arXiv:2609.07117 73 7 сент. 2026 г. PRO

Persona Steering: почему промпт "будь непредвзятым" не убирает предвзятость LLM, а просто её прячет

КЛЮЧЕВАЯ СУТЬ
Попроси модель быть 'менее доброжелательной' для ролевой игры — стереотипные ошибки взлетают до 100% в оценках внешности и статуса. Исследование проверяет частый приём: системный промпт 'будь непредвзятым HR-экспертом' — и выясняет, что он не убирает разницу в оценке между группами людей, а просто делает тон добрее для всех сразу. Персона красит словарь, а не решения — общий тон теплеет, но разрыв между группами кандидатов остаётся тем же. Проверили на трёх уровнях глубины: самоотчёт модели, открытый текст, чистые ассоциации слов без контекста.
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с