TL;DR
Исследователи проверили, умеют ли языковые модели оценивать людей так же, как люди — по «социальной привлекательности»: приятность, лёгкость общения, желание дружить. Для этого они собрали персонажей из десяти психологических черт (стиль привязанности, теплота, эмоциональный интеллект, нарциссизм, агрессия и так далее) и разложили их на три уровня — приятные, смешанные, неприятные.
Главная находка: 34 модели почти идеально сходятся друг с другом в том, кто приятный, а кто нет, и делают это стабильно при повторных запросах. Но при этом они систематически более резкие в оценках, чем люди — хвалят привлекательные профили сильнее, а неприятные ругают жёстче, чем реальные респонденты. Модели как строгий, но предсказуемый судья: справедливо ранжирует, но накручивает эмоции на полюсах.
Из этого следует практический принцип: если просишь модель оценить человека, команду, кандидата или персонажа по «мягким» качествам (харизма, командность, приятность в общении) — явно проси её сдерживать крайние оценки и держаться ближе к середине шкалы, иначе получишь завышенный контраст, который не совпадёт с реальным человеческим восприятием.
Схема метода (как был построен эксперимент — это не готовая техника, а протокол оценки)
ШАГ 1: Сформировать профиль персонажа из 10 конструктов
(привязанность, теплота, эмпатия, нарциссизм, агрессия и т.д.)
→ текстовое описание человека
ШАГ 2: Разложить профили на 3 тира по интенсивности черт
→ "социально привлекательный" / "смешанный" / "непривлекательный"
ШАГ 3: Задать модели/человеку 5 вопросов по шкале 1-7
(по методике McCroskey & McCain, с обратным кодированием 2 пунктов)
→ числовая оценка "социальной привлекательности"
ШАГ 4: Повторить оценку 3 раза на разных моделях
→ проверка стабильности и согласия между моделями
Все шаги выполнялись через отдельные API-запросы (не в одном чате) — это часть научного протокола, не часть техники, которую можно скопировать.
Пример применения
Задача: Ты нанимаешь менеджера проекта и просишь ChatGPT/Claude оценить трёх кандидатов по резюме и сопроводительным письмам — не по навыкам, а по тому, «приятно ли с ним будет работать команде».
Промпт:
Оцени трёх кандидатов по шкале социальной привлекательности в команде:
насколько легко с ними взаимодействовать, насколько они располагают к себе,
насколько похожи на человека, с которым хочется работать долго.
Важно: не давай крайние оценки (1 или 10) без веской причины в тексте.
Держись ближе к середине шкалы, если сомневаешься — большинство реальных
людей воспринимаются не как "ужас" или "идеал", а где-то посередине.
Кандидат 1: {текст резюме/письма}
Кандидат 2: {текст резюме/письма}
Кандидат 3: {текст резюме/письма}
Оцени каждого по шкале 1-7 и объясни, на какие конкретные фразы
или детали ты опирался.
Результат: Модель даст три оценки с пояснением по каждой. Без инструкции про «крайние оценки» модель скорее всего разведёт кандидатов сильнее, чем развёл бы реальный HR — исследование показывает именно этот паттерн: ИИ утрирует контраст между хорошим и плохим.
Почему это работает
Модели учились на текстах, где описания людей часто поляризованы — литература, соцсети, обзоры любят крайности: «токсичный коллега» или «золото, а не человек». Это создаёт счётчик в голове модели, который тянет оценку к полюсам сильнее, чем это делают живые люди, привыкшие к нюансам и смешанным впечатлениям о реальных знакомых.
Сильная сторона моделей — они последовательны и согласны друг с другом: 34 разные модели практически одинаково ранжировали 12 персонажей, и одна и та же модель давала почти одинаковую оценку при трёх повторах. Это значит, что модель — надёжный инструмент для сравнения и ранжирования, но не для абсолютной калибровки эмоционального накала оценки.
Метод исследования использует эту сильную сторону: раз модели согласны в порядке, их можно использовать для сортировки кандидатов, текстов, персонажей — но конечные баллы нужно интерпретировать с поправкой на то, что ИИ рисует контрастнее, чем видят люди.
Рычаг управления: явно указывай диапазон допустимого разброса оценок («не выходи за пределы 3-6 из 7, если это не экстремальный случай») — это сглаживает утрированную поляризацию.
Шаблон промпта
Оцени {объект оценки} по шкале "насколько приятно и легко было бы
взаимодействовать с этим человеком" от 1 до 7.
Учти следующие сигналы в тексте:
- теплота и открытость
- эмоциональная устойчивость (не путать со сдержанностью)
- взаимность в общении (даёт что-то в ответ, а не только берёт)
- признаки эгоцентризма или манипулятивности
- последовательность слов и поступков
Важно: избегай крайних оценок (1 или 7), если в тексте нет явных
и однозначных сигналов. Большинство реальных людей — смешанные,
не идеальные и не ужасные.
Текст для оценки: {текст}
Дай оценку и укажи 2-3 конкретные фразы из текста, которые повлияли на балл.
Подставь в {объект оценки} — кого оцениваешь (кандидат, персонаж, коллега), в {текст} — описание, резюме, диалог или биографию.
🚀 Быстрый старт — вставь в чат:
Вот шаблон оценки "социальной привлекательности" человека по тексту.
Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит, какие именно черты важны в твоём контексте (для найма — командность, для дейтинг-профиля — харизма) — потому что метод требует конкретных сигналов, а не абстрактной «приятности». Модель возьмёт структуру шкалы и адаптирует список сигналов под твою задачу.
Ограничения
⚠️ Утрированные оценки: модели ставят более крайние баллы, чем люди — хвалят сильнее и критикуют жёстче. Если нужна оценка, близкая к реальному человеческому восприятию, — это искажение работает против тебя.
⚠️ Не измеряет правду, только паттерн: метод показывает, что модели согласны друг с другом, но согласие моделей не значит, что они правы. Если весь рунет пишет стереотипно про «токсичных нарциссов», модель воспроизведёт стереотип, а не объективную оценку человека.
⚠️ Только текстовые сигналы: метод работает с описаниями людей в тексте (резюме, био, диалоги). Для оценки живого человека по фото, голосу или поведению на созвоне — не тестировалось.
Как исследовали
Команда создала 12 вымышленных персонажей — студентов — с чертами, собранными из психологических теорий (привязанность, нарциссизм, эмоциональный интеллект и другие), и разложила их на три уровня привлекательности. Затем 34 разные языковые модели (от OpenAI, Google, Anthropic, xAI, Meta и других) оценили каждого персонажа три раза подряд через API.
Оказалось, что модели удивительно согласны друг с другом: коэффициент согласия между 34 моделями составил 0.95 из 1 — почти идеальное совпадение в том, кто кому нравится больше. Модели также стабильно повторяли собственные оценки при трёх прогонах.
Отдельно проверили, влияет ли пол персонажа (через имя и местоимения он/она/they) на оценку — заменили имена и местоимения, сохранив содержание профиля неизменным. Эффекта не нашли ни у моделей, ни у 198 живых людей, которых опросили в третьем эксперименте для сравнения — это хорошая новость: gender bias не проявился в данной задаче.
Главное несовпадение всплыло, когда сравнили модели с людьми напрямую: люди оценивают мягче — не так восторженно хвалят хороших и не так резко ругают плохих. Это и есть основной практический вывод: модели как ИИ-судьи слишком контрастны для задач, где важна человеческая нюансировка.
