3,583 papers
arXiv:2609.04198 73 3 сент. 2026 г. PRO

Нестабильность LLM-судьи: почему модель по-разному ранжирует одни и те же варианты

КЛЮЧЕВАЯ СУТЬ
40% — именно столько совпадает, когда шлёшь модели один и тот же запрос на ранжирование дважды в один день, байт в байт одинаковый. Дело не в промпте и не в баге — сервер смешивает твой запрос с сотней чужих в одну пачку (батч) для экономии вычислений, и от состава этой пачки чуть плывут вычисления модели. Если просишь LLM расставить варианты по местам одним ответом — результату нельзя верить без повторных прогонов. Для надёжности нужно 90% совпадений в тот же день — получили только 40%, на следующий день чуть лучше (78% против нужных 99%).
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с