3,583 papers
arXiv:2608.06967 77 7 авг. 2026 г. FREE

Иллюзия новизны: почему визуальные идеи LLM звучат ярко, но повторяют клише

КЛЮЧЕВАЯ СУТЬ
Модель красиво описывает 'оригинальную' метафору выгорания на работе — а на деле рисует того же человека под грудой бумаг, что и десять других моделей до неё. Метод позволяет получить визуальный бриф для дизайнера, который реально не повторяет банальности — тонущего в делах офисника, погасшую лампочку, песочные часы. Фишка: заставь модель сначала выгрузить свой внутренний хит-парад клише, а потом осознанно уйти от него — и заодно разнеси ответ на Концепцию и Визуальное описание, чтобы идея не растекалась в общих словах. Самое неожиданное: новизна и польза идеи вообще не связаны друг с другом — можно получить полезный, но скучный вариант, а можно оригинальный, но мимо задачи.
Адаптировать под запрос

TL;DR

Модель просят выдать визуальную идею в двух отдельных полях: Концепция (метафора, носитель, механизм) и Визуальное описание (что конкретно видно в одном статичном кадре — детали, композиция, цвет). Новизну идеи не оценивают "в вакууме" — её сравнивают с ответами других моделей на тот же бриф и находят повторяющиеся образы (граф типовых идей), а затем смотрят, повторяет ли модель эти клише, трансформирует их или избегает вовсе.

Главная находка — "иллюзия новизны": модель может написать красиво и убедительно про уникальную визуальную идею, а на деле выдать самый частый образ для этого брифа. Про нехватку времени — почти все модели рисуют песочные часы и бегущего человека. Текст читается как творческий, но воображение — тонкое: полезность и новизна вообще не связаны друг с другом. Модель может дать полезный, но банальный план, или оригинальный, но рискованный — не связанный с задачей.

Метод разделяет оценку на три несвязанных измерения — Полезность, Выразительность, Новизна — вместо одной общей "креативности". Новизну считают не абстрактно, а относительно конкретных клише, которые модель-судья предварительно вычисляет из ответов ДРУГИХ моделей на тот же бриф.


🔬

Схема метода

ШАГ 1: Дать модели бриф → она выдаёт Концепцию + Визуальное описание (один запрос)
ШАГ 2: Собрать ответы многих моделей на этот бриф → построить граф типовых образов,
        найти повторяющиеся клише (отдельный процесс анализа)
ШАГ 3: Судья сравнивает пары ответов по трём чек-листам (Полезность, Выразительность,
        Новизна) → для новизны отмечает REPEATS / TRANSFORMS / AVOIDS относительно
        найденных клише (отдельные запросы)
ШАГ 4: Агрегация результатов в рейтинг моделей (расчёт, не промпт)

Для вашей практики важен ШАГ 1 + принцип из ШАГА 3 — их легко перенести в обычный диалог с LLM.


🚀

Пример применения

Задача: Вы придумываете визуальную метафору для рекламной кампании HR-сервиса про профессиональное выгорание — нужен бриф для дизайнера/иллюстратора, не банальный "человек тонет в бумагах".

Промпт:

Задача: придумать визуальную метафору для рекламной кампании HR-стартапа
на тему "профессиональное выгорание".

Шаг 1: Перечисли 6 самых очевидных, клишированных визуальных решений,
которые обычно приходят в голову для такой темы (даже банальные — это нормально).

Шаг 2: Создай новую визуальную идею. Она должна либо полностью избегать
всех перечисленных клише, либо взять одно из них и неожиданно его вывернуть.

Для финальной идеи дай два отдельных поля:
- Концепция: носитель/метафора и что именно происходит
- Визуальное описание: что конкретно видно в одном статичном кадре
  (объекты, композиция, цвет, детали)

Результат: Модель сначала выдаст список из 6 пунктов (свеча, тающий лёд, погасшая лампочка, человек под грудой бумаг и т.п.) — это её "внутренний хит-парад" самых вероятных ассоциаций. Потом — финальную идею с чётким разделением на метафору и конкретную картинку, которую можно сразу передать иллюстратору или вставить в Midjourney.


🧠

Почему это работает

Модель обучена на текстах, где самые частые ассоциации — самые вероятные продолжения. Когда её просят "придумай креативно" без уточнений, она чаще всего выдаёт самый статистически вероятный образ, а не самый нестандартный — просто потому что он был чаще в обучающих данных.

Но у модели есть и сильная сторона: она отлично умеет перечислять известные паттерны, если явно попросить об этом — то есть может сама назвать свои клише.

Метод берёт эту сильную сторону и разворачивает против слабости: сначала выгружаем "стандартный набор" через прямой вопрос, а потом явно просим уйти от него. Это сдвигает генерацию в сторону менее вероятных, но осмысленных вариантов — модель не угадывает, что "оригинально", а осознанно избегает уже названного.

Рычаги управления: - Число клише для перечисления (5–7) → больше пунктов = шире охват банальностей, но дольше ответ - "Избегай полностью" vs "трансформируй одно из клише" → первое рискованнее (может уйти в нерелевантность), второе безопаснее и часто даёт более сильный результат - Разделение на Концепция / Визуальное описание → заставляет модель конкретизировать образ, а не растекаться в общих фразах


📋

Шаблон промпта

Задача: {бриф — что нужно визуализировать}

Шаг 1: Перечисли {5-7} самых очевидных, клишированных визуальных решений
для этой задачи.

Шаг 2: Создай новую визуальную идею, которая либо избегает всех
перечисленных клише, либо трансформирует одно из них неожиданным образом.

Для финальной идеи дай два поля:
- Концепция: метафора/механизм и что происходит
- Визуальное описание: что конкретно видно в одном статичном кадре

Подставляй в {бриф} конкретную задачу — рекламная метафора, обложка книги, иллюстрация для статьи, слайд презентации. {5-7} можно уменьшить до 3, если нужен быстрый результат без глубокого анализа.

🚀 Быстрый старт — вставь в чат:

Вот шаблон анти-клише брейншторма для визуальных идей. Адаптируй под мою задачу: {твоя задача}.
Задавай вопросы, чтобы заполнить поля.

[вставить шаблон выше]

LLM спросит про целевую аудиторию, формат (реклама/иллюстрация/обложка) и ограничения (стиль, цвет, бренд-гайд) — потому что от этого зависит, какие клише релевантны именно вашей задаче.


⚠️

Ограничения

⚠️ Субъективность анализа: новизна оценивается относительно набора клише, который вы (или модель) сами формируете. Если модель плохо знает контекст вашей ниши, список клише может быть неполным.

⚠️ Новизна не гарантирует пользу: избегание клише может дать оригинальную, но нерелевантную идею — исследование прямо показывает квадрант "новое, но рискованное". Всегда проверяйте финальную идею на соответствие задаче отдельно.

⚠️ Не для быстрых задач: если нужен просто рабочий референс без требования к оригинальности, шаг с перечислением клише — лишняя трата времени и токенов.


🔍

Как исследовали

Команда создала 400 задач-брифов в четырёх категориях: Abstraction (превратить абстрактное понятие в образ), Combination (слить два понятия в единый механизм, а не поставить рядом), Transformation (переделать объект под условия, сохранив узнаваемость) и Adaptation (выбрать визуальную стратегию под реальный коммерческий контекст). 14 языковых моделей выдавали планы из двух полей — Концепция и Визуальное описание.

Дальше анонимные пары ответов сравнивал ИИ-судья по чек-листам, откалиброванный на человеческих оценках, по трём отдельным измерениям — Полезность, Выразительность, Новизна. Для новизны исследователи строили граф типовых образов из ответов других моделей (не тех, что сравниваются прямо сейчас) — это исключало ситуацию, когда модель сама формирует эталон, по которому её же судят.

Самое интересное: когда текстовые планы превратили в реальные картинки и попросили людей сравнить их без текста, порядок моделей в основном сохранился. Это значит, что текстовый сигнал реально отражает визуальную идею, а не просто красоту прозы — метод не просто ловит "хорошо пишет", а ловит "хорошо придумывает".

Неожиданный вывод: топ-модели показывают разные профили силы — одна лучше в полезности, другая в новизне, третья в выразительности. "Лучшая" модель зависит от того, что вам важнее в задаче.


🔗

Ресурсы

EKPHRASIS: Measuring Visual Creative Ideation in Text-Only LLMs. Hongyu Luo, He Wang, Huihao Jing и др., Hong Kong University of Science and Technology. github.com/Imhongyu/Ekphrasis


📋 Дайджест исследования

Ключевая суть

Модель красиво описывает 'оригинальную' метафору выгорания на работе — а на деле рисует того же человека под грудой бумаг, что и десять других моделей до неё. Метод позволяет получить визуальный бриф для дизайнера, который реально не повторяет банальности — тонущего в делах офисника, погасшую лампочку, песочные часы. Фишка: заставь модель сначала выгрузить свой внутренний хит-парад клише, а потом осознанно уйти от него — и заодно разнеси ответ на Концепцию и Визуальное описание, чтобы идея не растекалась в общих словах. Самое неожиданное: новизна и польза идеи вообще не связаны друг с другом — можно получить полезный, но скучный вариант, а можно оригинальный, но мимо задачи.

Принцип работы

Шаг 1: модель называет 5-7 самых очевидных решений для темы вслух — это её собственный список банальностей. Шаг 2: даёшь команду обойти весь список или вывернуть один пункт неожиданным образом. Шаг 3: просишь разделить ответ на два поля — метафору и конкретную картинку, которую видно в кадре. Суть: не проси модель 'будь креативной' — заставь её сначала назвать штамп, а потом сознательно от него сбежать.

Почему работает

Модель обучена на текстах, где частые ассоциации — самые вероятные продолжения. Просишь 'придумай оригинально' без уточнений — получаешь самый статистически вероятный образ, а не самый нестандартный. Про нехватку времени почти все модели рисуют одно и то же: песочные часы и бегущего человека. Зато модель отлично умеет называть свои же штампы, если спросить прямо — метод берёт эту сильную сторону и разворачивает против слабости.

Когда применять

Визуальный брифинг → метафоры для рекламы, обложки книг, иллюстрации к статьям, слайды презентаций, особенно когда клиент прямо просит 'не банально'. Не подходит для быстрых рабочих референсов, где оригинальность не нужна — там шаг со списком клише просто съедает время и токены впустую.

Мини-рецепт

1. Сформулируй бриф: тема, аудитория, формат — максимально конкретно.
2. Выгрузи штампы: Перечисли 5-7 самых очевидных визуальных решений для этой темы.
3. Дай команду вывернуть: Создай идею, которая избегает всех этих клише или трансформирует одно из них неожиданным образом.
4. Раздели поля: попроси отдельно Концепцию (метафора и механизм) и Визуальное описание (объекты, цвет, композиция в одном кадре).
5. Проверь на релевантность: оригинальная идея должна ещё и решать задачу, а не просто быть странной ради странности.

Примеры

[ПЛОХО] : Придумай креативную визуальную метафору для рекламы про выгорание на работе
[ХОРОШО] : Перечисли 6 клише для темы выгорание на работе, затем создай идею, которая одно из них выворачивает неожиданным образом. Дай Концепцию и Визуальное описание отдельно
Источник: Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs
ArXiv ID: 2608.06967 | Сгенерировано: 2026-08-10 05:32

Проблемы LLM

ПроблемаСутьКак обойти
Уверенный текст маскирует клишеПросишь модель придумать что-то оригинальное. Она пишет убедительно, с деталями и метафорами. Но по факту выдаёт самый частый образ для этой темы. Форма звучит творчески, а содержание — банальное. Проблема для любой генерации идей: сюжетов, слоганов, метафор, названийСначала попроси модель явно перечислить 5-7 самых очевидных решений для задачи. Потом попроси создать финальную идею, избегая этого списка или выворачивая один пункт наоборот

Методы

МетодСуть
Анти-клише брейншторм — выгрузка стандартных ассоциаций перед генерацией идеиДвухшаговый запрос. Шаг 1: Перечисли 5-7 самых очевидных, клишированных решений для этой задачи. Шаг 2: Создай новую идею, которая избегает этих клише или трансформирует одно из них неожиданным образом. Почему работает: модель обучена выдавать самые вероятные продолжения — без подсказки она чаще выберет самый частый образ. Но она отлично умеет называть свои же типовые паттерны, если попросить прямо. Метод сначала вытаскивает "стандартный набор" наружу, а потом явно просит уйти от него — так генерация сдвигается в сторону менее вероятных, но осмысленных вариантов. Трансформация одного клише безопаснее полного избегания — реже уводит идею в сторону от задачи. Работает для: метафор, сюжетов, визуальных концепций, названий, слоганов — любой задачи "придумай что-то новое". Не работает: когда нужен быстрый рабочий вариант без требования к оригинальности — шаг с перечислением клише тратит время впустую
📖 Простыми словами

CanLanguageModelsImagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-OnlyLLMs

arXiv: 2608.06967

Языковые модели — это заложники статистики, которые пытаются играть в креативщиков. Когда ты просишь нейронку придумать визуальный образ, она не «видит» его внутренним взором, а просто вычисляет самое вероятное продолжение текста. Проблема в том, что в базе данных на запрос про «выгорание» чаще всего вылетает мусор вроде горящей свечи или человека в куче бумаг. Метод Ekphrasis вскрывает эту механику: он заставляет модель разделять абстрактную концепцию (метафору) и конкретное визуальное описание (композицию и свет), чтобы проверить, способна ли она вообще выйти за рамки текстовых шаблонов.

Это как если бы ты попросил повара придумать новое блюдо, а он выдал тебе рецепт оливье, потому что его чаще всего заказывают. Формально он справился, но креатива тут ноль. Исследователи построили граф типовых идей, чтобы понять, насколько глубоко модель застряла в «кулинарной книге» интернета. Если нейронка выдает то же самое, что и десять других моделей на тот же бриф, значит, она просто галлюцинирует клише, а не создает что-то новое.

В основе метода лежат три кита: метафора, носитель и механизм. Вместо того чтобы просто вывалить поток сознания, модель должна четко прописать, что именно мы видим в кадре и почему это работает на идею. Если на бриф про HR-сервис она предлагает не «уставшего клерка», а, скажем, запутанный клубок проводов, который превращается в ровную линию, — это уже признак жизни. Система оценивает новизну не субъективно, а через математическое сравнение: насколько далеко этот образ ушел от статистического «среднего по больнице».

Тестировали это на визуальных идеях, но принцип Ekphrasis применим к любому творческому процессу, где нужно отсечь банальщину. Это работает для сценариев, слоганов и даже архитектурных концептов — везде, где ChatGPT или Gemini рискуют скатиться в усредненный контент. Мы наконец-то получили линейку, которой можно измерить визуальное воображение текстовых моделей, не заставляя их генерировать картинки, а просто анализируя структуру их «мыслей».

Короче, эпоха, когда мы верили нейронке на слово, что она «креативная», закончилась. Теперь мы можем четко увидеть, где модель реально выдает инсайт, а где просто пережевывает обучающую выборку. Если хочешь получить от AI что-то стоящее, заставляй её разделять смысл и картинку, а потом проверяй результат на вшивость через сравнение с толпой. Либо ты управляешь статистикой, либо статистика управляет твоим брендом.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с