3,583 papers
arXiv:2608.02758 79 3 авг. 2026 г. PRO

Мнимое согласие: LLM-агенты в ролевых симуляциях дружно врут о своём мнении

КЛЮЧЕВАЯ СУТЬ
Обнаружено: посади LLM разыгрывать пятерых спорщиков — и через 2-3 реплики все дружно согласятся. Даже если каждому персонажу прописали противоположное мнение. Метод диагностики мнимого согласия (pluralistic ignorance) позволяет найти, где симуляция врёт о консенсусе, и вытащить реальные позиции персонажей. Секрет — спросить каждого персонажа отдельно, до общего чата. Модель не хранит мнение персонажа как факт — она предсказывает следующую фразу по тексту диалога. Три реплики согласия в чате — и она продолжает паттерн, даже если персонажу назначили обратную позицию.
Адаптировать под запрос
📋 Дайджест исследования

Контент доступен только для PRO подписчиков

Чтобы получить доступ к дайджесту этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Контент доступен только для PRO подписчиков

Чтобы получить доступ к концептам этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO
📖 Простыми словами

Контент доступен только для PRO подписчиков

Чтобы получить доступ к упрощённому объяснению этого исследования, оформите PRO подписку

💳 Оплатить через Геткурс
YandexPay • SberPay • СБП • Карты РФ
⚡ Оплатить через Tribute
Telegram Stars • Моментальный доступ
Узнать о PRO

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с