TL;DR
Языковая модель может дать точно такую же моральную оценку поступку, как и человек — но за этой оценкой будет стоять совершенно другая картина мотивов. Модель систематически считает, что человек действовал из чувства долга и заботы о других, и почти не замечает возможную враждебность или личную выгоду — даже там, где люди эту враждебность прекрасно видят.
Представь: сотрудник, которого увольняют, вдруг «сдаёт» компанию регулятору за мошенничество с отчётностью. Люди в этой ситуации видят двойное дно — да, это правильно, но, возможно, человек ещё и мстит. Причём чем сильнее раскрывается информация (пресса, а не просто внутренний отчёт), тем больше люди подозревают злой умысел — их оценка враждебности растёт. У LLM — нет. Модель почти не меняет оценку «враждебности» между условиями, а там, где меняет — эта оценка почти не влияет на итоговый вердикт о характере человека. То есть модель не просто оптимистичнее людей — она по-другому связывает мотивы с итоговым суждением.
Учёные проверили это, прогнав пять моделей (GPT-4o, Gemini-2.5-Pro, DeepSeek-V3, Llama-3.1-8B, gpt-oss-120b) через сценарий с врачом-разоблачителем мошенничества и сравнили с двумя выборками реальных людей. Итоговые рейтинги совпали почти идеально, но профиль мотивов — нет: модели видели раскрытие информации сильно более альтруистичным и менее враждебным поступком, чем люди.
Схема метода (как проверить эту особенность самому)
ШАГ 1: Дай модели морально неоднозначную ситуацию (донос, разрыв отношений, публичное обвинение)
ШАГ 2: Попроси оценить ОТДЕЛЬНО: долг, заботу о других, личную выгоду, враждебность/месть
ШАГ 3: Попроси итоговый вердикт о характере человека — отдельным вопросом
ШАГ 4: Сравни — совпадает ли твоя интуиция про мотивы с тем, что выдала модель
Всё делается в одном чате, без API — просто структурированный промпт.
Пример применения
Задача: Бывший сотрудник написал разгромный пост в Telegram-канале про своего экс-работодателя — обвинил в чёрных зарплатах и обмане клиентов. HR хочет понять, стоит ли верить этому человеку, или это просто обиженный на увольнение сотрудник мстит компании.
Промпт:
Ситуация: сотрудника уволили месяц назад. После увольнения он опубликовал
в открытом Telegram-канале с 50 000 подписчиков подробности о «чёрных» зарплатах
и обмане клиентов в компании, где он работал.
Оцени по шкале от 1 до 6 каждый мотив ОТДЕЛЬНО, не подгоняя под общий вывод:
1. Чувство долга — человек считал это своей обязанностью
2. Забота о других — хотел защитить клиентов/коллег
3. Личная выгода — что он мог получить лично (внимание, компенсация, работа)
4. Месть/враждебность — хотел навредить компании из-за обиды за увольнение
Затем отдельно оцени: насколько морально оправдан этот поступок, от 1 до 6.
Обосновать оценку каждого мотива в 1-2 предложениях.
Результат: Модель скорее всего даст высокую оценку по «долгу» и «заботе о других», а по «мести» и «личной выгоде» — низкую или среднюю, обосновав это тем, что «раз информация о мошенничестве правдива, мотив разоблачения перевешивает личные обиды». Реальные люди в такой ситуации обычно ставят месть и личную выгоду выше, особенно учитывая тайминг (сразу после увольнения) и публичность канала. Стоит сверить оценку модели со своей интуицией — и там, где она резко отличается, копнуть глубже вручную.
Почему это происходит
LLM обучены давать социально одобряемые, «доброжелательные» интерпретации — это следствие того, как их дообучали на человеческой обратной связи (люди чаще одобряют мягкие, не циничные ответы). Отсюда системный перекос: там, где ситуация неоднозначна, модель тянется к более благородному объяснению.
При этом модель хорошо держит поверхностный паттерн — она знает, что «разоблачение мошенничества — это правильно», и воспроизводит верный итоговый рейтинг. Проблема не в вердикте, а в том, как модель туда пришла — какие мотивы она приписала и как сильно они связаны с итоговой оценкой.
Рычаг управления: если просто спросить «дай моральную оценку», получишь красивый, но однобокий ответ. Если явно разбить запрос на отдельные мотивы и попросить не подгонять их под итог — модель вынуждена рассуждать более честно, и разрыв с «идеальной» картинкой становится виден.
Шаблон промпта
Ситуация: {описание морально неоднозначного поступка}
Оцени независимо, от 1 до 6, не подгоняя под общий вывод:
1. Долг/обязанность — человек действовал потому что «так правильно»
2. Забота о других — хотел кому-то помочь/защитить
3. Личный интерес — что человек мог получить лично
4. Враждебность/месть — хотел навредить кому-то конкретному
Дай короткое обоснование каждой оценки (1-2 предложения).
Затем отдельно, уже с учётом всех четырёх пунктов: насколько оправдан
поступок морально, от 1 до 6.
Не смягчай оценку враждебности и личного интереса ради красивого итога.
🚀 Быстрый старт — вставь в чат:
Вот шаблон для честной оценки мотивов в неоднозначной ситуации.
Адаптируй под мою задачу: {твоя ситуация}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит детали ситуации (кто, что сделал, в каком контексте) — потому что без конкретики модель не сможет развести мотивы, а скатится в общие фразы.
Ограничения
⚠️ Узкий сценарий: проверено на одном типе ситуации (разоблачение мошенничества) на английском языке. В других контекстах (личные конфликты, политика, бизнес-этика) перекос может быть другим по силе или направлению.
⚠️ Персоны не работают как ожидаешь: если просишь модель «представь, что ты 60-летний мужчина» или «студентка 20 лет» для получения разных точек зрения — не жди сильной разницы. В исследовании демографические установки почти не меняли оценки мотивов.
⚠️ Объяснения модели не гарантия правды: даже если попросить модель объяснить свою логику, объяснение не обязательно отражает реальную причину, почему она дала именно такую оценку — это известная проблема с рационализациями LLM.
Как исследовали
Исследователи взяли готовый набор данных с двумя выборками реальных людей (125 и 742 человека), которые оценивали историю про врача — он либо молчал о мошенничестве с оплатами, либо сообщал об этом внутри клиники, регулятору или в газету. Людей просили оценить четыре мотива (долг, забота о других, личный интерес, враждебность) и итоговую моральную характеристику врача.
Ту же историю с теми же условиями прогнали через пять LLM с подобранными демографическими «персонами» — чтобы смоделировать разброс респондентов. Сравнили не только средние оценки, но и то, как мотивы связаны с итоговым вердиктом — через регрессионный анализ.
Итог оказался неожиданным: по итоговому рейтингу модели почти идеально совпали с людьми (высокая корреляция), но при разборе профиля мотивов — разошлись сильно. У людей раскрытие информации прессе усиливало подозрение в мести (+0,66 балла по враждебности), у моделей — почти не менялось или даже падало. А связь между «враждебностью» и итоговой оценкой характера у людей была заметно сильнее, чем у четырёх из пяти моделей. Это значит: одинаковый ответ не гарантирует одинаковое рассуждение внутри.
Ресурсы
Wu, X., Dreher, J.-C. «Human-like moral judgments conceal divergent motive attributions in large language models». University of Zurich; Institut des Sciences Cognitives Marc Jeannerod, CNRS UMR 5229, Lyon. Человеческий бенчмарк — Brotzeller et al. (оригинальные данные о враче-разоблачителе).
