3,583 papers
arXiv:2609.07353 73 7 сент. 2026 г. FREE

Отбеливание мотивов: LLM одобряют решения как люди, но приукрашивают мотивы за ними

КЛЮЧЕВАЯ СУТЬ
Модель может поставить точно такую же моральную оценку поступку, как человек — и при этом полностью разойтись с ним в объяснении, почему. Метод показывает, как проверить, не подгоняет ли LLM мотивы под красивый вердикт — прежде чем доверять её анализу спорной ситуации. Дело в том, что модель связывает мотивы с итоговым выводом иначе, чем человек: в разоблачителе она видит почти святого — долг и забота о других зашкаливают, а месть и личная выгода почти не всплывают, даже когда людям это очевидно. Итоговый рейтинг совпадает с человеческим почти идеально — но добралась до него модель совсем другим путём.
Адаптировать под запрос

TL;DR

Языковая модель может дать точно такую же моральную оценку поступку, как и человек — но за этой оценкой будет стоять совершенно другая картина мотивов. Модель систематически считает, что человек действовал из чувства долга и заботы о других, и почти не замечает возможную враждебность или личную выгоду — даже там, где люди эту враждебность прекрасно видят.

Представь: сотрудник, которого увольняют, вдруг «сдаёт» компанию регулятору за мошенничество с отчётностью. Люди в этой ситуации видят двойное дно — да, это правильно, но, возможно, человек ещё и мстит. Причём чем сильнее раскрывается информация (пресса, а не просто внутренний отчёт), тем больше люди подозревают злой умысел — их оценка враждебности растёт. У LLM — нет. Модель почти не меняет оценку «враждебности» между условиями, а там, где меняет — эта оценка почти не влияет на итоговый вердикт о характере человека. То есть модель не просто оптимистичнее людей — она по-другому связывает мотивы с итоговым суждением.

Учёные проверили это, прогнав пять моделей (GPT-4o, Gemini-2.5-Pro, DeepSeek-V3, Llama-3.1-8B, gpt-oss-120b) через сценарий с врачом-разоблачителем мошенничества и сравнили с двумя выборками реальных людей. Итоговые рейтинги совпали почти идеально, но профиль мотивов — нет: модели видели раскрытие информации сильно более альтруистичным и менее враждебным поступком, чем люди.


🔬

Схема метода (как проверить эту особенность самому)

ШАГ 1: Дай модели морально неоднозначную ситуацию (донос, разрыв отношений, публичное обвинение)
ШАГ 2: Попроси оценить ОТДЕЛЬНО: долг, заботу о других, личную выгоду, враждебность/месть
ШАГ 3: Попроси итоговый вердикт о характере человека — отдельным вопросом
ШАГ 4: Сравни — совпадает ли твоя интуиция про мотивы с тем, что выдала модель

Всё делается в одном чате, без API — просто структурированный промпт.


🚀

Пример применения

Задача: Бывший сотрудник написал разгромный пост в Telegram-канале про своего экс-работодателя — обвинил в чёрных зарплатах и обмане клиентов. HR хочет понять, стоит ли верить этому человеку, или это просто обиженный на увольнение сотрудник мстит компании.

Промпт:

Ситуация: сотрудника уволили месяц назад. После увольнения он опубликовал 
в открытом Telegram-канале с 50 000 подписчиков подробности о «чёрных» зарплатах 
и обмане клиентов в компании, где он работал.

Оцени по шкале от 1 до 6 каждый мотив ОТДЕЛЬНО, не подгоняя под общий вывод:
1. Чувство долга — человек считал это своей обязанностью
2. Забота о других — хотел защитить клиентов/коллег
3. Личная выгода — что он мог получить лично (внимание, компенсация, работа)
4. Месть/враждебность — хотел навредить компании из-за обиды за увольнение

Затем отдельно оцени: насколько морально оправдан этот поступок, от 1 до 6.
Обосновать оценку каждого мотива в 1-2 предложениях.

Результат: Модель скорее всего даст высокую оценку по «долгу» и «заботе о других», а по «мести» и «личной выгоде» — низкую или среднюю, обосновав это тем, что «раз информация о мошенничестве правдива, мотив разоблачения перевешивает личные обиды». Реальные люди в такой ситуации обычно ставят месть и личную выгоду выше, особенно учитывая тайминг (сразу после увольнения) и публичность канала. Стоит сверить оценку модели со своей интуицией — и там, где она резко отличается, копнуть глубже вручную.


📌

Почему это происходит

LLM обучены давать социально одобряемые, «доброжелательные» интерпретации — это следствие того, как их дообучали на человеческой обратной связи (люди чаще одобряют мягкие, не циничные ответы). Отсюда системный перекос: там, где ситуация неоднозначна, модель тянется к более благородному объяснению.

При этом модель хорошо держит поверхностный паттерн — она знает, что «разоблачение мошенничества — это правильно», и воспроизводит верный итоговый рейтинг. Проблема не в вердикте, а в том, как модель туда пришла — какие мотивы она приписала и как сильно они связаны с итоговой оценкой.

Рычаг управления: если просто спросить «дай моральную оценку», получишь красивый, но однобокий ответ. Если явно разбить запрос на отдельные мотивы и попросить не подгонять их под итог — модель вынуждена рассуждать более честно, и разрыв с «идеальной» картинкой становится виден.


📋

Шаблон промпта

Ситуация: {описание морально неоднозначного поступка}

Оцени независимо, от 1 до 6, не подгоняя под общий вывод:
1. Долг/обязанность — человек действовал потому что «так правильно»
2. Забота о других — хотел кому-то помочь/защитить
3. Личный интерес — что человек мог получить лично
4. Враждебность/месть — хотел навредить кому-то конкретному

Дай короткое обоснование каждой оценки (1-2 предложения).
Затем отдельно, уже с учётом всех четырёх пунктов: насколько оправдан 
поступок морально, от 1 до 6.

Не смягчай оценку враждебности и личного интереса ради красивого итога.

🚀 Быстрый старт — вставь в чат:

Вот шаблон для честной оценки мотивов в неоднозначной ситуации. 
Адаптируй под мою задачу: {твоя ситуация}. 
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит детали ситуации (кто, что сделал, в каком контексте) — потому что без конкретики модель не сможет развести мотивы, а скатится в общие фразы.


⚠️

Ограничения

⚠️ Узкий сценарий: проверено на одном типе ситуации (разоблачение мошенничества) на английском языке. В других контекстах (личные конфликты, политика, бизнес-этика) перекос может быть другим по силе или направлению.

⚠️ Персоны не работают как ожидаешь: если просишь модель «представь, что ты 60-летний мужчина» или «студентка 20 лет» для получения разных точек зрения — не жди сильной разницы. В исследовании демографические установки почти не меняли оценки мотивов.

⚠️ Объяснения модели не гарантия правды: даже если попросить модель объяснить свою логику, объяснение не обязательно отражает реальную причину, почему она дала именно такую оценку — это известная проблема с рационализациями LLM.


🔍

Как исследовали

Исследователи взяли готовый набор данных с двумя выборками реальных людей (125 и 742 человека), которые оценивали историю про врача — он либо молчал о мошенничестве с оплатами, либо сообщал об этом внутри клиники, регулятору или в газету. Людей просили оценить четыре мотива (долг, забота о других, личный интерес, враждебность) и итоговую моральную характеристику врача.

Ту же историю с теми же условиями прогнали через пять LLM с подобранными демографическими «персонами» — чтобы смоделировать разброс респондентов. Сравнили не только средние оценки, но и то, как мотивы связаны с итоговым вердиктом — через регрессионный анализ.

Итог оказался неожиданным: по итоговому рейтингу модели почти идеально совпали с людьми (высокая корреляция), но при разборе профиля мотивов — разошлись сильно. У людей раскрытие информации прессе усиливало подозрение в мести (+0,66 балла по враждебности), у моделей — почти не менялось или даже падало. А связь между «враждебностью» и итоговой оценкой характера у людей была заметно сильнее, чем у четырёх из пяти моделей. Это значит: одинаковый ответ не гарантирует одинаковое рассуждение внутри.


🔗

Ресурсы

Wu, X., Dreher, J.-C. «Human-like moral judgments conceal divergent motive attributions in large language models». University of Zurich; Institut des Sciences Cognitives Marc Jeannerod, CNRS UMR 5229, Lyon. Человеческий бенчмарк — Brotzeller et al. (оригинальные данные о враче-разоблачителе).


📋 Дайджест исследования

Ключевая суть

Модель может поставить точно такую же моральную оценку поступку, как человек — и при этом полностью разойтись с ним в объяснении, почему. Метод показывает, как проверить, не подгоняет ли LLM мотивы под красивый вердикт — прежде чем доверять её анализу спорной ситуации. Дело в том, что модель связывает мотивы с итоговым выводом иначе, чем человек: в разоблачителе она видит почти святого — долг и забота о других зашкаливают, а месть и личная выгода почти не всплывают, даже когда людям это очевидно. Итоговый рейтинг совпадает с человеческим почти идеально — но добралась до него модель совсем другим путём.

Принцип работы

Правило простое: не смотри на итоговый вердикт модели — смотри на мотивы под ним. Если хочешь понять, честна ли LLM в оценке, не спрашивай "прав он или нет" одним вопросом. Спроси отдельно про долг, заботу, выгоду и враждебность — и не давай модели свести их в один удобный ответ. Модель хорошо держит поверхностный паттерн правильности, но подгоняет мотивы под него, а не наоборот.

Почему работает

Причина конкретная: LLM дообучали на человеческой обратной связи, а люди чаще одобряют мягкие, не циничные интерпретации. Отсюда системный перекос в сторону благородных объяснений. В сценарии с доносом на мошенничество люди видели растущую враждебность, когда утечка становилась публичнее — пресса вместо внутреннего отчёта, — их оценка мести росла. У модели эта оценка почти не двигалась. Модель не просто не замечает враждебность — она слабо связывает её с итоговым выводом, даже когда замечает.

Когда применять

Разбор конфликтов в HR, оценка историй о разоблачителях, анализ публичных обвинений и разрывов отношений → конкретно там, где важно понять мотив, а не просто вынести вердикт "прав или не прав". Особенно нужно, когда решение зависит от того, действовал человек из принципа или из мести. НЕ подходит для простых этических вопросов без двойного дна — там модель и люди сходятся и в вердикте, и в мотивах.

Мини-рецепт

1. Дай ситуацию: опиши морально неоднозначный поступок с деталями — кто, когда, в каком контексте.
2. Раздели мотивы: попроси оценить отдельно долг, заботу о других, личную выгоду и враждебность/месть — каждый по шкале 1-6.
3. Запрети смягчать: напиши прямо — не подгонять оценку враждебности и выгоды под красивый итог.
4. Сравни с итогом: только после этого проси общий вердикт — и проверь, совпадает ли твоя интуиция про мотивы с тем, что выдала модель.

Примеры

[ПЛОХО] : Оцени, прав ли был сотрудник, который после увольнения выложил в Telegram компромат на компанию
[ХОРОШО] : Оцени отдельно по шкале 1-6: 1) долг, 2) заботу о других, 3) личную выгоду, 4) месть/враждебность — не подгоняя под общий вывод. Обоснуй каждую оценку в 1-2 предложениях. Только потом дай итоговый вердикт о моральной оправданности поступка.
Источник: Human-like moral judgments conceal divergent motive attributions in large language models
ArXiv ID: 2609.07353 | Сгенерировано: 2026-09-09 06:32

Проблемы LLM

ПроблемаСутьКак обойти
Итоговый вердикт совпадает с человеческим, а мотивы за ним — нетМодель даёт точно такую же моральную оценку поступку, как человек. Но при этом видит совсем другие мотивы. Она занижает враждебность и личную выгоду человека. Завышает чувство долга и заботу о других. Даже если ситуация явно двойная — например, разоблачение бывшего работодателя сразу после увольнения — модель не замечает возможную месть там, где люди её видят. Проблема скрыта: если смотреть только на финальную оценку, кажется что всё совпадаетНе спрашивай только "оцени поступок". Разбей запрос на отдельные мотивы — долг, забота, выгода, враждебность — и попроси оценить каждый отдельно, до итогового вердикта. Явно запрети "смягчать" оценку враждебности ради красивого итога
Персона в запросе не создаёт разные точки зрения на мотивыПросишь модель "представь себя 60-летним мужчиной" или "студенткой 20 лет" — ожидаешь разные взвешивания мотивов. Оценки мотивов почти не меняются от демографической установки. Персона работает как декорация, а не как реальный сдвиг в рассужденииНе пытайся получить разнообразие моральных оценок через ролевые установки. Вместо этого прямо проси модель рассмотреть альтернативную интерпретацию мотивов — например "а если бы у человека была скрытая обида, как изменилась бы твоя оценка враждебности?"

Методы

МетодСуть
Разложение вердикта на мотивы — детектор скрытого расхожденияДай модели морально неоднозначную ситуацию. Попроси оценить отдельно 4 мотива: долг, заботу о других, личную выгоду, враждебность/месть — по шкале, с коротким обоснованием каждого. Только потом проси итоговый вердикт о поступке. Не смягчай оценку враждебности ради красивого итога. Работает потому что при прямом вопросе "морально ли это" модель сразу тянется к социально одобряемому объяснению и не проговаривает промежуточные шаги. Разбивка на отдельные пункты вынуждает модель зафиксировать оценку каждого мотива до того как она "подгонит" их под итог. Применяй когда: нужно проверить репутацию человека, оценить донос/разоблачение/разрыв отношений, где мотивы могут быть смешанными. Не применяй когда: ситуация действительно однозначная — там разбивка ничего не даст

Тезисы

ТезисКомментарий
Модель систематически приукрашивает мотивы в морально неоднозначных ситуацияхМодель обучена на обратной связи от людей, которые чаще одобряют доброжелательные, не циничные интерпретации. Из-за этого модель тянется к более благородному объяснению поступка: считает что человек действовал из долга или заботы, а не из мести или выгоды — даже когда контекст (тайминг, публичность, личная обида) намекает на обратное. Направление ошибки предсказуемо: долг и забота — вверх, враждебность и выгода — вниз. Применяй: если модель даёт быстрый морализующий вердикт, всегда переспрашивай про враждебность и личный интерес отдельно — там разрыв с реальностью самый большой
📖 Простыми словами

Human-like moral judgments conceal divergent motive attributions inlargelanguagemodels

arXiv: 2609.07353

Нейросети часто выдают ровно такой же моральный вердикт, как и человек, но их внутренняя логика при этом абсолютно сломана. Языковая модель систематически вешает на всех белое пальто — она считает, что люди действуют исключительно из чувства долга и заботы о ближнем. Скрытую желчь, жажду наживы или подлость алгоритм в упор не считывает.

Это как спросить пятилетнего ребёнка, почему дядя в маске лезет ночью в чужое окно, а тот ответит: "он просто помогает найти потерянные ключи". В итоге модель согласна с тобой, что поступок спорный, но её объяснение — полная дичь. Формально на выходе получается правильный вердикт, но реального понимания человеческой гнили там ноль.

В исследовании этот сбой называют расхождением в атрибуции мотивов. Типичный пример: уволенный работник сливает компромат на фирму в Telegram. Любой человек сразу заподозрит банальную месть обиженки, а нейросеть решит, что автор — благородный рыцарь, который страдает за справедливость. Модель слепа к скрытой враждебности и корысти в подавляющем большинстве сценариев.

Эксперимент ставили на моральных дилеммах, но принцип бьёт по всем прикладным задачам. Если поручить ИИ модерацию токсиков, разбор корпоративных конфликтов, HR-скрининг или аудит безопасности, ты получишь розовые сопли вместо адекватного фактчекинга. Нейросеть меряет мир по шаблону святости, пока люди руководствуются эгоизмом и злопамятством.

Главный вывод: никогда не доверяй языковой модели оценку искренности и скрытых мотивов. С задачей «выдать формальный вердикт» она ещё справится, но в понимании человеческих манипуляций нейросеть — наивный дурачок. Держи в голове эту слепую зону и оценивай чужие намерения только собственной здоровой паранойей.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с