TL;DR
Когда ты просишь ChatGPT или Claude оценить, насколько креативна идея — бизнес-план, дизайн, продукт — модель смотрит почти исключительно на новизну и оригинальность самой идеи. Люди же, оценивая креативность, всегда добавляют контекст: подходит ли идея под текущий рынок, кто за ней стоит, модно ли это сейчас, вызовет ли она социальное одобрение. LLM использует только 17 из 26 критериев, которыми пользуются люди при оценке креативности — и почти полностью игнорирует контекстуальные критерии: бренд, рыночную нишу, модность, репутацию.
Вот конкретная боль: если ты дашь человеку описание продукта и добавишь одно предложение "это делает известный бренд X" или "это будет мейнстримом среди молодёжи" — его оценка креативности заметно вырастет. Дашь то же самое ChatGPT — оценка почти не изменится. Модель судит идею "в вакууме", будто вырезала её из контекста, в котором реально живут продукты и решения.
Из этого следует практический вывод: если тебе важна оценка, близкая к тому, как оценил бы человек (инвестор, клиент, коллега) — не жди, что модель сама учтёт контекст. Нужно явно прописать в промпте, чтобы она оценивала идею не только по новизне, но и по тому, как она вписывается в рынок, бренд, моду и репутацию.
Схема находки
ЧТО ОЦЕНИВАЕТ ЧЕЛОВЕК → 26 критериев, включая контекст (бренд, рынок, мода, соцодобрение, репутация)
ЧТО ОЦЕНИВАЕТ LLM (в среднем) → 17 критериев, в основном новизна + немного "приятность/увлекательность"
РАЗНИЦА → контекстуальные критерии почти полностью выпадают у LLM
СЛЕДСТВИЕ:
Добавляешь контекст в описание идеи → человек меняет оценку креативности заметно
Добавляешь тот же контекст → LLM почти не меняет оценку
Пример применения
Задача: Ты запускаешь линию эко-упаковки под брендом, который уже известен на Ozon и Wildberries как экологичный. Хочешь понять, насколько идея креативна — спрашиваешь ChatGPT.
Промпт (обычный, как делают все):
Оцени, насколько креативна эта идея: упаковка из переработанного картона с QR-кодом,
который ведёт на страницу с историей материала.
Результат обычного промпта: Модель оценит идею по новизне и практической пользе — скорее всего, средне-высоко, но без учёта, что бренд уже ассоциируется с экологичностью, а тема экоупаковки сейчас "в моде" на маркетплейсах. Инвестор или клиент оценил бы идею выше именно из-за этого контекста — а модель этот плюс не увидит.
Промпт с учётом контекста:
Оцени креативность этой идеи: упаковка из переработанного картона с QR-кодом,
который ведёт на страницу с историей материала.
Бренд: уже известен на Ozon и Wildberries как экологичный, есть лояльная аудитория.
Рынок: экоупаковка — растущий трендовый сегмент на маркетплейсах в 2024-2025.
Оцени отдельно:
1. Новизну и оригинальность самой идеи
2. Насколько идея усиливает репутацию бренда
3. Насколько она попадает в текущий тренд рынка
4. Итоговую оценку креативности с учётом всех факторов
Результат: Модель даст более полную оценку — раздельно по новизне и по контекстным факторам. Итоговая оценка будет ближе к тому, что сказал бы живой человек, знакомый с рынком.
Почему это работает
LLM обучена на текстах, но при оценке креативности по умолчанию сужает фокус до самой идеи — как будто оценивает эссе в вакууме, без учёта того, кто его написал и когда. Это происходит потому, что новизна — самый "текстовый" критерий: легко сравнить формулировку идеи с тем, что модель уже видела в обучающих данных. А бренд, рынок, мода — это оценка вне текста самой идеи, она требует привязки к внешнему миру, которую модель делает неохотно, если её не попросить явно.
Сильная сторона LLM — она отлично следует явным инструкциям по критериям оценки. Если прописать контекстуальные критерии текстом в промпте, модель их учтёт — просто сама она не догадывается добавить их без подсказки.
Рычаг управления: сам список контекстуальных критериев можно менять под задачу. Для стартапа — бренд и рынок. Для творческого проекта — мода и социальное одобрение. Для научной идеи — репутация и авторитет источника.
Шаблон промпта
Оцени креативность этой идеи: {описание идеи}.
Контекст:
- Бренд/автор: {кто стоит за идеей, есть ли репутация}
- Рынок: {насколько идея попадает в текущий трендовый сегмент}
- Аудитория: {насколько идея будет воспринята как модная/актуальная и социально одобряемая}
Оцени отдельно:
1. Новизну — насколько идея нестандартна сама по себе
2. Полезность — решает ли она реальную проблему
3. Контекстную ценность — усиливает ли бренд, попадает ли в тренд, вызовет ли одобрение аудитории
4. Итоговую оценку креативности с учётом всех трёх пунктов
Подставь: {описание идеи} — сама идея/продукт/текст. {кто стоит за идеей}, {рынок}, {аудитория} — контекстные факты, которые ты знаешь, но модель не увидит сама, если не скажешь.
🚀 Быстрый старт — вставь в чат:
Вот шаблон оценки креативности с учётом контекста. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит про бренд, рынок и аудиторию вокруг твоей идеи — потому что без этих данных она оценит только "голую" новизну и упустит контекст, который важен для реального решения.
Ограничения
⚠️ Не универсально для всех типов контекста: исследование показало, что LLM особенно слепы к бренду, рыночной нише и модности — но почти нормально реагируют на "социальное одобрение" и "авторитетность источника". Если твой контекст касается именно этих двух категорий, разница с человеческой оценкой будет меньше.
⚠️ Разные модели — разная широта: одни модели (более "широкие" по критериям) ближе к человеческой оценке креативности в принципе, другие — более узкие и жёстко зациклены на новизне. Если оценка критична, стоит попробовать несколько моделей и сверить результат.
⚠️ Это не значит, что модель "неправа": LLM просто оценивает по-другому — более "чисто", без шума в виде бренд-хайпа. Для честной оценки самой идеи (без влияния репутации) это иногда даже плюс.
Как исследовали
Команда прогнала шесть популярных моделей (GPT, Grok, DeepSeek, Claude, Gemini и ERNIE) через тест с 26 критериями оценки креативности, которые ранее установили для людей. Модели оценивали важность каждого критерия — так учёные поняли, какими "линзами" смотрит каждая модель. Дальше 293 живых человека сгенерировали больше тысячи идей на бизнес-задачах, и три обученных эксперта плюс все шесть моделей оценили креативность каждой идеи — сравнили, насколько оценки моделей совпадают с человеческими.
Самое интересное — третий эксперимент: 15 реальных продуктов с Kickstarter показывали людям и моделям в двух версиях — просто описание и описание плюс одна фраза о контексте (бренд, рынок, мода). У людей оценка креативности заметно менялась от этой одной фразы, у моделей — почти нет, и это подтвердилось на каждой из шести моделей отдельно. Результат совпал с предсказанием из первого эксперимента: модели изначально показали, что не считают контекст важным критерием, и на практике это подтвердилось — они реально его игнорируют, даже когда он прямо перед ними.
Ресурсы
Lyu, Kim, Xiao, Luan — Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity. University of Cambridge, University of Manchester, University of Queensland.
