TL;DR
Если вы просите LLM изобразить "типичного покупателя" или "среднего избирателя" и предсказать как он изменит мнение после прочтения текста — модель почти наверняка ошибётся. Исследователи сравнили как реальные люди и как LLM меняют мнение после чтения одних и тех же комментариев на одну тему, и нашли три системные ошибки моделей.
Главная проблема: LLM тянет к нейтральной позиции. Реальные люди часто держатся крайних мнений ("категорически за", "категорически против"), а модель сглаживает всё до "ну, наверное, немного согласен". Плюс модель меняет мнение чаще, чем человек, но слабее — то есть вместо одного сильного сдвига делает много мелких шевелений. И самое неожиданное: модели вообще не улавливают, какой аргумент реально убедителен для человека — их ранжирование "убедительности" комментариев не совпадает с человеческим почти никак (корреляция около нуля).
Метод простой: если дать модели настоящую начальную позицию человека (а не заставлять её угадывать), некоторые модели (Qwen3-32B, GPT-5-Mini) неплохо предсказывают, куда сдвинется мнение. Но если модель сама придумывает начальную позицию персонажа — вся симуляция разваливается, ошибки накапливаются на каждом следующем шаге.
Схема метода
ШАГ 1 (человек): Замер начального мнения по теме → шкала "полностью против — полностью за"
ШАГ 2 (человек): Чтение 3 комментариев с разными позициями → без прямого запроса к LLM
ШАГ 3 (человек): Повторный замер мнения + ранжирование комментариев по убедительности
ШАГ 4 (LLM, отдельный запрос): Модель получает персону человека (демография + характер)
+ его РЕАЛЬНУЮ начальную позицию + те же 3 комментария
→ выдаёт "новое мнение" + ранжирование комментариев
ШАГ 5: Сравнение LLM-ответа с ответом настоящего человека
Если ШАГ 4 делать без реальной начальной позиции (то есть просить модель самой угадать, как думает "типичный такой-то человек") — точность рушится полностью.
Пример применения
Задача: Вы готовите текст для email-рассылки, убеждающий подписчиков перейти на платную подписку, и хотите заранее прогнать его через "виртуальных читателей" с разными взглядами.
Промпт:
Ты симулируешь читателя со следующим профилем:
— Возраст: 34, работает full-time в маркетинге
— Текущее мнение по теме "стоит ли платить за подписку на сервис Х":
4 из 5 (скорее согласен, что стоит)
— Уровень знакомства с темой: средний
Вот три фрагмента текста, которые этот человек прочитает подряд:
1. {фрагмент письма с эмоциональным аргументом}
2. {фрагмент письма с рациональным аргументом — цифры и выгода}
3. {фрагмент письма с социальным доказательством — отзывы}
После чтения:
1. Оцени новое мнение этого человека по той же шкале 1-5
2. Ранжируй три фрагмента по убедительности ДЛЯ ЭТОГО ЧЕЛОВЕКА (1 = самый убедительный)
3. Объясни, почему именно этот фрагмент сработал сильнее других
Результат: Модель выдаст новую оценку мнения и ранжирование текстов. Но помните: исследование показало, что ранжирование убедительности у LLM почти случайное относительно реальных людей. Используйте это как черновую гипотезу, не как финальный вердикт. Указывайте реальную начальную позицию (не просите модель угадывать "какой типичный человек с такими взглядами") — это единственное, что реально повышает точность.
Почему это работает
LLM обучена находить "средний", наиболее вероятный ответ по паттернам текста в интернете — а средний ответ почти всегда звучит взвешенно и нейтрально. Люди в реальности гораздо более полярны: у них есть эмоции, идентичность, упорство в мнении. Модель этого не воспроизводит, она регрессирует к центру.
Сильная сторона модели — она хорошо считает "логичное следствие" из данных условий: если сказать "человек изначально на позиции 2 из 5", модель правильно понимает, что итоговая позиция не может стать 5 после трёх комментариев. Это чисто арифметическая логика, и здесь модель не ошибается.
Метод использует эту сильную сторону: не просите модель угадывать точку старта — дайте её как факт. Тогда модель работает как калькулятор сдвига от известной точки, а не как предсказатель личности с нуля. Как только вы просите модель "вообрази человека X и его исходное мнение" — она обращается к своим усреднённым представлениям о demographic-группе, а не к реальной вариативности людей, и ошибка взлетает.
Рычаг управления: если вам важна точность симуляции — всегда фиксируйте начальную позицию явно, а не полагайтесь на персону (возраст, профессия, характер) для её "вычисления". Демографические детали персоны почти не влияют на точность симуляции мнения — можно их вообще убрать без потери качества.
Шаблон промпта
Ты симулируешь человека со следующими характеристиками:
{демографические и личностные черты — опционально, минимально влияют на точность}
Его текущая позиция по теме "{тема}": {начальная_позиция} из {шкала}
Уровень знакомости с темой: {familiarity}
Вот {количество} сообщений/комментариев, которые он прочитает по порядку:
1. {текст_1}
2. {текст_2}
3. {текст_3}
После прочтения:
1. Оцени НОВУЮ позицию человека по той же шкале {шкала}
2. Ранжируй прочитанные тексты по убедительности лично для этого человека
3. Кратко объясни логику изменения (или отсутствия изменения) мнения
Что подставлять:
- {начальная_позиция} — обязательно РЕАЛЬНАЯ или заданная точка отсчёта, не просьба "угадай сам"
- {тема} — конкретная спорная тема
- {текст_1/2/3} — реальные тексты, которые будет "читать" симулируемый человек
- Демографию и черты характера можно оставить пустыми — исследование показало, что они не повышают точность
🚀 Быстрый старт — вставь в чат:
Вот шаблон для симуляции изменения мнения человека после чтения текстов.
Адаптируй под мою задачу: [твоя задача — например, тестирование рекламного текста,
прогноз реакции на новость, проверку убедительности аргумента].
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит про начальную позицию симулируемого человека и про сами тексты для прочтения — потому что без точной точки отсчёта симуляция становится ненадёжной (это главный вывод исследования).
Ограничения
⚠️ Не спрашивайте модель угадать чужую точку зрения "с нуля": если вы просите LLM самой придумать, как думает "типичный человек X", модель систематически ошибается — и в стартовой позиции, и в итоговом сдвиге мнения. Работает только когда точку отсчёта задаёте вы.
⚠️ Не доверяйте ранжированию "что убедительнее": модель почти случайно угадывает, какой из нескольких аргументов реально сработает на человека. Если ваша цель — понять, какой из вариантов текста сильнее убеждает, LLM здесь плохой советчик.
⚠️ Модель прячет крайние мнения: если вам важно смоделировать поляризацию (например, "как аудитория расколется на до и против"), LLM будет сглаживать результат к середине шкалы — реальная картина будет более полярной.
⚠️ Больше "жизни" в персоне не помогает: добавление возраста, характера, профессии в описание персонажа не делает симуляцию точнее. Не тратьте на это токены и время — фокус должен быть на реальных фактах (начальная позиция, знакомство с темой), не на портрете личности.
Как исследовали
Исследователи собрали данные от 391 живого человека на платформе Prolific: каждый оценил своё мнение по трём темам (безусловный базовый доход, пенальти в футболе, препараты для похудения типа Оземпика), прочитал три реальных комментария с Reddit по каждой теме, потом снова оценил своё мнение и ранжировал комментарии по убедительности.
Затем для каждого живого человека сделали "цифрового двойника" — шесть разных LLM (включая GPT, Claude, Gemini, Qwen, Llama) получали персону этого человека (демография, черты характера) и его настоящую стартовую позицию, а потом должны были предсказать, как изменится его мнение после тех же комментариев. Это дало парное сравнение "человек vs его LLM-копия" — редкость для таких исследований, обычно сравнивают только средние показатели по группе, а не пары.
Ключевая находка пришла из эксперимента, где модели заставили самим угадывать начальную позицию персонажа (а не давали её готовой) — точность симуляции рухнула полностью, хотя с заданной начальной позицией некоторые модели работали неплохо. Это и стало главным практическим выводом: точность симуляции критично зависит от того, насколько точна отправная точка, а не от того, насколько подробная персона.
Удивительно, что более новые и мощные модели (например, GPT-5.2 показал значимое отклонение) не всегда точнее старых — то есть "умнее" модель не значит "точнее имитирует человека". Это намекает, что способность имитировать людей — отдельный навык, не связанный напрямую с общими способностями модели к рассуждению.
