TL;DR
Модель просят выдать визуальную идею в двух отдельных полях: Концепция (метафора, носитель, механизм) и Визуальное описание (что конкретно видно в одном статичном кадре — детали, композиция, цвет). Новизну идеи не оценивают "в вакууме" — её сравнивают с ответами других моделей на тот же бриф и находят повторяющиеся образы (граф типовых идей), а затем смотрят, повторяет ли модель эти клише, трансформирует их или избегает вовсе.
Главная находка — "иллюзия новизны": модель может написать красиво и убедительно про уникальную визуальную идею, а на деле выдать самый частый образ для этого брифа. Про нехватку времени — почти все модели рисуют песочные часы и бегущего человека. Текст читается как творческий, но воображение — тонкое: полезность и новизна вообще не связаны друг с другом. Модель может дать полезный, но банальный план, или оригинальный, но рискованный — не связанный с задачей.
Метод разделяет оценку на три несвязанных измерения — Полезность, Выразительность, Новизна — вместо одной общей "креативности". Новизну считают не абстрактно, а относительно конкретных клише, которые модель-судья предварительно вычисляет из ответов ДРУГИХ моделей на тот же бриф.
Схема метода
ШАГ 1: Дать модели бриф → она выдаёт Концепцию + Визуальное описание (один запрос)
ШАГ 2: Собрать ответы многих моделей на этот бриф → построить граф типовых образов,
найти повторяющиеся клише (отдельный процесс анализа)
ШАГ 3: Судья сравнивает пары ответов по трём чек-листам (Полезность, Выразительность,
Новизна) → для новизны отмечает REPEATS / TRANSFORMS / AVOIDS относительно
найденных клише (отдельные запросы)
ШАГ 4: Агрегация результатов в рейтинг моделей (расчёт, не промпт)
Для вашей практики важен ШАГ 1 + принцип из ШАГА 3 — их легко перенести в обычный диалог с LLM.
Пример применения
Задача: Вы придумываете визуальную метафору для рекламной кампании HR-сервиса про профессиональное выгорание — нужен бриф для дизайнера/иллюстратора, не банальный "человек тонет в бумагах".
Промпт:
Задача: придумать визуальную метафору для рекламной кампании HR-стартапа
на тему "профессиональное выгорание".
Шаг 1: Перечисли 6 самых очевидных, клишированных визуальных решений,
которые обычно приходят в голову для такой темы (даже банальные — это нормально).
Шаг 2: Создай новую визуальную идею. Она должна либо полностью избегать
всех перечисленных клише, либо взять одно из них и неожиданно его вывернуть.
Для финальной идеи дай два отдельных поля:
- Концепция: носитель/метафора и что именно происходит
- Визуальное описание: что конкретно видно в одном статичном кадре
(объекты, композиция, цвет, детали)
Результат: Модель сначала выдаст список из 6 пунктов (свеча, тающий лёд, погасшая лампочка, человек под грудой бумаг и т.п.) — это её "внутренний хит-парад" самых вероятных ассоциаций. Потом — финальную идею с чётким разделением на метафору и конкретную картинку, которую можно сразу передать иллюстратору или вставить в Midjourney.
Почему это работает
Модель обучена на текстах, где самые частые ассоциации — самые вероятные продолжения. Когда её просят "придумай креативно" без уточнений, она чаще всего выдаёт самый статистически вероятный образ, а не самый нестандартный — просто потому что он был чаще в обучающих данных.
Но у модели есть и сильная сторона: она отлично умеет перечислять известные паттерны, если явно попросить об этом — то есть может сама назвать свои клише.
Метод берёт эту сильную сторону и разворачивает против слабости: сначала выгружаем "стандартный набор" через прямой вопрос, а потом явно просим уйти от него. Это сдвигает генерацию в сторону менее вероятных, но осмысленных вариантов — модель не угадывает, что "оригинально", а осознанно избегает уже названного.
Рычаги управления: - Число клише для перечисления (5–7) → больше пунктов = шире охват банальностей, но дольше ответ - "Избегай полностью" vs "трансформируй одно из клише" → первое рискованнее (может уйти в нерелевантность), второе безопаснее и часто даёт более сильный результат - Разделение на Концепция / Визуальное описание → заставляет модель конкретизировать образ, а не растекаться в общих фразах
Шаблон промпта
Задача: {бриф — что нужно визуализировать}
Шаг 1: Перечисли {5-7} самых очевидных, клишированных визуальных решений
для этой задачи.
Шаг 2: Создай новую визуальную идею, которая либо избегает всех
перечисленных клише, либо трансформирует одно из них неожиданным образом.
Для финальной идеи дай два поля:
- Концепция: метафора/механизм и что происходит
- Визуальное описание: что конкретно видно в одном статичном кадре
Подставляй в {бриф} конкретную задачу — рекламная метафора, обложка книги, иллюстрация для статьи, слайд презентации. {5-7} можно уменьшить до 3, если нужен быстрый результат без глубокого анализа.
🚀 Быстрый старт — вставь в чат:
Вот шаблон анти-клише брейншторма для визуальных идей. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.
[вставить шаблон выше]
LLM спросит про целевую аудиторию, формат (реклама/иллюстрация/обложка) и ограничения (стиль, цвет, бренд-гайд) — потому что от этого зависит, какие клише релевантны именно вашей задаче.
Ограничения
⚠️ Субъективность анализа: новизна оценивается относительно набора клише, который вы (или модель) сами формируете. Если модель плохо знает контекст вашей ниши, список клише может быть неполным.
⚠️ Новизна не гарантирует пользу: избегание клише может дать оригинальную, но нерелевантную идею — исследование прямо показывает квадрант "новое, но рискованное". Всегда проверяйте финальную идею на соответствие задаче отдельно.
⚠️ Не для быстрых задач: если нужен просто рабочий референс без требования к оригинальности, шаг с перечислением клише — лишняя трата времени и токенов.
Как исследовали
Команда создала 400 задач-брифов в четырёх категориях: Abstraction (превратить абстрактное понятие в образ), Combination (слить два понятия в единый механизм, а не поставить рядом), Transformation (переделать объект под условия, сохранив узнаваемость) и Adaptation (выбрать визуальную стратегию под реальный коммерческий контекст). 14 языковых моделей выдавали планы из двух полей — Концепция и Визуальное описание.
Дальше анонимные пары ответов сравнивал ИИ-судья по чек-листам, откалиброванный на человеческих оценках, по трём отдельным измерениям — Полезность, Выразительность, Новизна. Для новизны исследователи строили граф типовых образов из ответов других моделей (не тех, что сравниваются прямо сейчас) — это исключало ситуацию, когда модель сама формирует эталон, по которому её же судят.
Самое интересное: когда текстовые планы превратили в реальные картинки и попросили людей сравнить их без текста, порядок моделей в основном сохранился. Это значит, что текстовый сигнал реально отражает визуальную идею, а не просто красоту прозы — метод не просто ловит "хорошо пишет", а ловит "хорошо придумывает".
Неожиданный вывод: топ-модели показывают разные профили силы — одна лучше в полезности, другая в новизне, третья в выразительности. "Лучшая" модель зависит от того, что вам важнее в задаче.
Ресурсы
EKPHRASIS: Measuring Visual Creative Ideation in Text-Only LLMs. Hongyu Luo, He Wang, Huihao Jing и др., Hong Kong University of Science and Technology. github.com/Imhongyu/Ekphrasis
