3,583 papers
arXiv:2607.22218 79 24 июля 2026 г. FREE

LLM-оценщики креативности слепы к контексту: бренду, рынку, моде

КЛЮЧЕВАЯ СУТЬ
Обнаружено: ChatGPT оценивает креативность идеи почти в вакууме — как эссе без автора и без даты публикации. Люди используют 26 критериев оценки, LLM в среднем — только 17, и почти полностью пропускает бренд, рыночную нишу и моду. Метод с явным указанием контекста в промпте позволяет получить оценку креативности, близкую к человеческой — иначе идея от известного эко-бренда на Ozon получит ту же оценку, что и точно такая же идея от no-name. Фишка: новизну легко сравнить с текстом из обучающих данных, а бренд и тренды — это оценка вне самого текста идеи, и модель её добавляет только если попросить прямо.
Адаптировать под запрос

TL;DR

Когда ты просишь ChatGPT или Claude оценить, насколько креативна идея — бизнес-план, дизайн, продукт — модель смотрит почти исключительно на новизну и оригинальность самой идеи. Люди же, оценивая креативность, всегда добавляют контекст: подходит ли идея под текущий рынок, кто за ней стоит, модно ли это сейчас, вызовет ли она социальное одобрение. LLM использует только 17 из 26 критериев, которыми пользуются люди при оценке креативности — и почти полностью игнорирует контекстуальные критерии: бренд, рыночную нишу, модность, репутацию.

Вот конкретная боль: если ты дашь человеку описание продукта и добавишь одно предложение "это делает известный бренд X" или "это будет мейнстримом среди молодёжи" — его оценка креативности заметно вырастет. Дашь то же самое ChatGPT — оценка почти не изменится. Модель судит идею "в вакууме", будто вырезала её из контекста, в котором реально живут продукты и решения.

Из этого следует практический вывод: если тебе важна оценка, близкая к тому, как оценил бы человек (инвестор, клиент, коллега) — не жди, что модель сама учтёт контекст. Нужно явно прописать в промпте, чтобы она оценивала идею не только по новизне, но и по тому, как она вписывается в рынок, бренд, моду и репутацию.


📌

Схема находки

ЧТО ОЦЕНИВАЕТ ЧЕЛОВЕК → 26 критериев, включая контекст (бренд, рынок, мода, соцодобрение, репутация)
ЧТО ОЦЕНИВАЕТ LLM (в среднем) → 17 критериев, в основном новизна + немного "приятность/увлекательность"
РАЗНИЦА → контекстуальные критерии почти полностью выпадают у LLM

СЛЕДСТВИЕ:
Добавляешь контекст в описание идеи → человек меняет оценку креативности заметно
Добавляешь тот же контекст → LLM почти не меняет оценку

🚀

Пример применения

Задача: Ты запускаешь линию эко-упаковки под брендом, который уже известен на Ozon и Wildberries как экологичный. Хочешь понять, насколько идея креативна — спрашиваешь ChatGPT.

Промпт (обычный, как делают все):

Оцени, насколько креативна эта идея: упаковка из переработанного картона с QR-кодом, 
который ведёт на страницу с историей материала.

Результат обычного промпта: Модель оценит идею по новизне и практической пользе — скорее всего, средне-высоко, но без учёта, что бренд уже ассоциируется с экологичностью, а тема экоупаковки сейчас "в моде" на маркетплейсах. Инвестор или клиент оценил бы идею выше именно из-за этого контекста — а модель этот плюс не увидит.

Промпт с учётом контекста:

Оцени креативность этой идеи: упаковка из переработанного картона с QR-кодом, 
который ведёт на страницу с историей материала.

Бренд: уже известен на Ozon и Wildberries как экологичный, есть лояльная аудитория.
Рынок: экоупаковка — растущий трендовый сегмент на маркетплейсах в 2024-2025.

Оцени отдельно:
1. Новизну и оригинальность самой идеи
2. Насколько идея усиливает репутацию бренда
3. Насколько она попадает в текущий тренд рынка
4. Итоговую оценку креативности с учётом всех факторов

Результат: Модель даст более полную оценку — раздельно по новизне и по контекстным факторам. Итоговая оценка будет ближе к тому, что сказал бы живой человек, знакомый с рынком.


🧠

Почему это работает

LLM обучена на текстах, но при оценке креативности по умолчанию сужает фокус до самой идеи — как будто оценивает эссе в вакууме, без учёта того, кто его написал и когда. Это происходит потому, что новизна — самый "текстовый" критерий: легко сравнить формулировку идеи с тем, что модель уже видела в обучающих данных. А бренд, рынок, мода — это оценка вне текста самой идеи, она требует привязки к внешнему миру, которую модель делает неохотно, если её не попросить явно.

Сильная сторона LLM — она отлично следует явным инструкциям по критериям оценки. Если прописать контекстуальные критерии текстом в промпте, модель их учтёт — просто сама она не догадывается добавить их без подсказки.

Рычаг управления: сам список контекстуальных критериев можно менять под задачу. Для стартапа — бренд и рынок. Для творческого проекта — мода и социальное одобрение. Для научной идеи — репутация и авторитет источника.


📋

Шаблон промпта

Оцени креативность этой идеи: {описание идеи}.

Контекст:
- Бренд/автор: {кто стоит за идеей, есть ли репутация}
- Рынок: {насколько идея попадает в текущий трендовый сегмент}
- Аудитория: {насколько идея будет воспринята как модная/актуальная и социально одобряемая}

Оцени отдельно:
1. Новизну — насколько идея нестандартна сама по себе
2. Полезность — решает ли она реальную проблему
3. Контекстную ценность — усиливает ли бренд, попадает ли в тренд, вызовет ли одобрение аудитории
4. Итоговую оценку креативности с учётом всех трёх пунктов

Подставь: {описание идеи} — сама идея/продукт/текст. {кто стоит за идеей}, {рынок}, {аудитория} — контекстные факты, которые ты знаешь, но модель не увидит сама, если не скажешь.

🚀 Быстрый старт — вставь в чат:

Вот шаблон оценки креативности с учётом контекста. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про бренд, рынок и аудиторию вокруг твоей идеи — потому что без этих данных она оценит только "голую" новизну и упустит контекст, который важен для реального решения.


⚠️

Ограничения

⚠️ Не универсально для всех типов контекста: исследование показало, что LLM особенно слепы к бренду, рыночной нише и модности — но почти нормально реагируют на "социальное одобрение" и "авторитетность источника". Если твой контекст касается именно этих двух категорий, разница с человеческой оценкой будет меньше.

⚠️ Разные модели — разная широта: одни модели (более "широкие" по критериям) ближе к человеческой оценке креативности в принципе, другие — более узкие и жёстко зациклены на новизне. Если оценка критична, стоит попробовать несколько моделей и сверить результат.

⚠️ Это не значит, что модель "неправа": LLM просто оценивает по-другому — более "чисто", без шума в виде бренд-хайпа. Для честной оценки самой идеи (без влияния репутации) это иногда даже плюс.


🔍

Как исследовали

Команда прогнала шесть популярных моделей (GPT, Grok, DeepSeek, Claude, Gemini и ERNIE) через тест с 26 критериями оценки креативности, которые ранее установили для людей. Модели оценивали важность каждого критерия — так учёные поняли, какими "линзами" смотрит каждая модель. Дальше 293 живых человека сгенерировали больше тысячи идей на бизнес-задачах, и три обученных эксперта плюс все шесть моделей оценили креативность каждой идеи — сравнили, насколько оценки моделей совпадают с человеческими.

Самое интересное — третий эксперимент: 15 реальных продуктов с Kickstarter показывали людям и моделям в двух версиях — просто описание и описание плюс одна фраза о контексте (бренд, рынок, мода). У людей оценка креативности заметно менялась от этой одной фразы, у моделей — почти нет, и это подтвердилось на каждой из шести моделей отдельно. Результат совпал с предсказанием из первого эксперимента: модели изначально показали, что не считают контекст важным критерием, и на практике это подтвердилось — они реально его игнорируют, даже когда он прямо перед ними.


🔗

Ресурсы

Lyu, Kim, Xiao, Luan — Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity. University of Cambridge, University of Manchester, University of Queensland.


📋 Дайджест исследования

Ключевая суть

Обнаружено: ChatGPT оценивает креативность идеи почти в вакууме — как эссе без автора и без даты публикации. Люди используют 26 критериев оценки, LLM в среднем — только 17, и почти полностью пропускает бренд, рыночную нишу и моду. Метод с явным указанием контекста в промпте позволяет получить оценку креативности, близкую к человеческой — иначе идея от известного эко-бренда на Ozon получит ту же оценку, что и точно такая же идея от no-name. Фишка: новизну легко сравнить с текстом из обучающих данных, а бренд и тренды — это оценка вне самого текста идеи, и модель её добавляет только если попросить прямо.

Принцип работы

Люди, оценивая креативность, всегда добавляют контекст — подходит ли идея под рынок, кто за ней стоит, модно ли это сейчас. LLM судит идею изолированно, будто вырезал её из реального мира. Правило простое: без явного запроса модель разницу между «идея от бренда X» и «та же идея от никого» в упор не видит.

Почему работает

Новизна — самый «текстовый» критерий: легко сопоставить формулировку идеи с тем, что модель уже видела при обучении. Бренд, рынок, мода — это не про сам текст идеи, а про её место в реальном мире, а такую привязку модель делает только по прямому указанию. Из 26 критериев, которыми пользуются люди, LLM в среднем берёт только 17 — и почти все контекстные выпадают первыми.

Когда применять

Оценка идей → бизнес-планы, дизайн, продукты, стартапы — особенно когда важно учесть репутацию бренда или попадание в текущий тренд рынка. Не подходит, если нужна оценка идеи именно «в чистом виде», без влияния хайпа бренда — тут слепота LLM к контексту скорее плюс, чем минус.

Мини-рецепт

1. Опиши идею: как обычно, без контекста — просто суть продукта или решения.
2. Добавь контекст: бренд/автор (есть репутация?), рынок (попадает в трендовый сегмент?), аудитория (модно и социально одобряемо?).
3. Раздели оценку: попроси модель отдельно оценить новизну и отдельно — контекстную ценность.
4. Собери итог: попроси финальную оценку креативности с учётом обоих пунктов, а не только новизны.

Примеры

[ПЛОХО] : Оцени, насколько креативна эта идея: упаковка из переработанного картона с QR-кодом на историю материала
[ХОРОШО] : Оцени креативность идеи: упаковка из переработанного картона с QR-кодом. Бренд: уже известен на Ozon и Wildberries как экологичный, лояльная аудитория. Рынок: экоупаковка — трендовый сегмент в 2024-2025. Оцени отдельно: 1) новизну идеи, 2) насколько она усиливает репутацию бренда, 3) попадание в тренд, 4) итоговую оценку с учётом всех трёх факторов
Источник: Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity
ArXiv ID: 2607.22218 | Сгенерировано: 2026-07-27 08:22

Проблемы LLM

ПроблемаСутьКак обойти
Оценка креативности игнорирует контекст идеиПросишь оценить креативность продукта, текста, дизайна. Модель смотрит только на новизну самой идеи. Бренд, рыночный тренд, модность у аудитории — не учитывает вообще. Человек в той же ситуации сильно поднимает оценку, если идея вписана в тренд или связана с известным брендом. Модель — почти не меняет оценку от таких добавокЯвно пропиши контекстуальные критерии в запросе: бренд/автора, рыночную нишу, модность у целевой аудитории. Попроси оценить новизну и контекст раздельно, потом свести в итоговую оценку

Методы

МетодСуть
Явные контекстные критерии в запросе на оценку креативностиДобавь в промпт блок с фактами: кто автор/бренд, какой рынок, насколько тема модна у аудитории сейчас. Попроси оценить отдельно новизну, полезность и контекстную ценность, а затем дать общий вывод. Работает, потому что модель отлично следует прямым инструкциям по критериям — она просто не добавляет их сама. Применяй когда нужна оценка, близкая к человеческой (инвестор, клиент, коллега). Не нужен, если важна "чистая" оценка идеи без влияния бренд-хайпа

Тезисы

ТезисКомментарий
Модель оценивает креативность по тому, что легко сравнить с текстом, и упускает то, что требует знаний о внешнем миреНовизна идеи — это сравнение формулировки с тем, что модель уже видела в обучении. Бренд, рынок, мода — это факты вне текста самой идеи, их нужно явно подать. Поэтому без контекста в запросе модель по умолчанию сужает оценку до новизны. Применяй: если критерий оценки лежит "снаружи" текста (репутация, тренд, узнаваемость) — всегда прописывай его фактами в запросе, а не надейся, что модель сама подтянет контекст
📖 Простыми словами

WhyLargeLanguageModelsand Humans Converge and Diverge in Evaluating Creativity

arXiv: 2607.22218

Нейросети оценивают креативность как сухари-математики: для них крутая идея — это просто статистическая редкость. Если ты принесешь модели концепт летающего чемодана, она поставит высший балл, потому что в ее базе данных таких описаний мало. Но проблема в том, что LLM живет в вакууме и оценивает только текстовую новизну, полностью игнорируя реальный мир. Пока человек мучительно соображает, впишется ли этот чемодан в нормы авиаперевозок и не засмеют ли его друзья, модель просто чекает уникальность слов.

Это как если бы ты пришел на кулинарное шоу с десертом из селедки и шоколада. Судья-человек сразу скажет, что это полная херня, потому что понимает контекст: вкусовые привычки, традиции и здравый смысл. А робот-дегустатор, настроенный на креатив, придет в восторг: «Ого, такого сочетания в моей базе еще не было, это 10 из 10 по шкале оригинальности!». Модель видит буквы, но не видит жизни, которая стоит за этими буквами.

Исследователи выяснили, что из 26 критериев, по которым мы судим о крутизне идей, нейронки используют только 17 штук. В мусорную корзину летят самые важные «человеческие» вещи: репутация бренда, рыночная ниша и социальное одобрение. Если ты спросишь ChatGPT, взлетит ли твоя новая линейка эко-упаковки, она оценит саму концепцию картона, но в упор не заметит, что твой бренд уже пять лет качает эту тему на маркетплейсах и имеет лояльную базу. Для модели идея существует отдельно, а твой бэкграунд — отдельно.

Этот принцип универсален для любого контента: от нейминга стартапов до дизайна интерьеров. Тестировали это на оценке продуктов, но облом ждет везде, где важен внешний контекст. Если ты просишь AI оценить стратегию продвижения, он выдаст тебе «оригинальный» бред, который невозможно реализовать в текущих реалиях рынка, просто потому что это звучит свежо. SEO-логика здесь не работает: модель не понимает, что модно в этом сезоне, она понимает только, что встречается редко.

Короче: никогда не принимай оценку нейросети за истину в последней инстанции, если твоя идея завязана на людях и рынках. Модель всегда будет топить за голую оригинальность, пропуская мимо ушей вопрос «а купят ли это?». Чтобы получить адекватный фидбэк, нужно буквально впихивать контекст ей в глотку, прописывая в промпте и бренд, и целевую аудиторию, и текущие тренды. Иначе ты получишь одобрение самой инновационной фигни, которая в реальности нафиг никому не нужна.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с