3,583 papers
arXiv:2608.14161 76 14 авг. 2026 г. PRO

BiasTrace: зависание в сомнениях — сильнейший предсказатель предвзятого ответа LLM, сильнее явно стереотипных фраз

КЛЮЧЕВАЯ СУТЬ
Обнаружено: явные стереотипные фразы в рассуждениях модели — не главный признак предвзятости. Настоящий виновник прячется в поведении: когда LLM больше трёх раз пересматривает один вопрос и не может остановиться, она хватается за стереотип просто чтобы закончить раздумья. Метод BiasTrace позволяет ловить эту скрытую предвзятость ещё до финального ответа — даже если в тексте рассуждения нет ни одного стереотипного слова. Работает в два слоя: в промпт добавляется требование опираться только на контекст, а после ответа модель проверяет себя по чек-листу поведенческих маркеров — зависание, домысливание о группе, привлечение знаний со стороны. Самопроверка по конкретным признакам точнее, чем просьба «оцени предвзятость от 0 до 5».
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с