3,583 papers
arXiv:2608.06634 73 6 авг. 2026 г. FREE

Genre vs Story: почему промпты для AI-музыки не долетают до того, что слышит слушатель

КЛЮЧЕВАЯ СУТЬ
Обнаружено: слово «рок» почти всегда узнаётся в готовом треке. Слово «расставание в дождливую ночь» — почти никогда. Разбор 200 промптов для Suno и Udio показывает системный разрыв между тем, что вы пишете, и тем, что слышит слушатель. Метод позволяет писать промпты для AI-музыки так, чтобы результат совпал с задумкой. Модель кодирует только акустический след — тембр, инструмент, темп, а сюжет она в звук не превращает, слушатель просто додумывает его сам после того как трек уже готов.
Адаптировать под запрос

TL;DR

Когда вы просите Suno или Udio сгенерировать песню, слова про жанр («рок», «лоу-фай», «80-е синтвейв») почти всегда узнаются в готовом треке — а слова про историю и сюжет («песня о разбитом сердце в дождливую ночь», «путешествие героя») почти никогда не долетают до звука. Исследователи сравнили 200 промптов и то, как слушатели описывают получившуюся музыку своими словами — и нашли системный разрыв.

Люди пишут промпты как сценарии: жанр плюс история. Но у AI-модели, которая генерирует музыку, нет способа «закодировать» сюжет в звуковые волны — она превращает в звук только то, что имеет акустический след: тембр, инструмент, темп, стиль. Промпт с историей про «расставание в дождливую ночь» может звучать как что угодно, потому что дождь и расставание — это не звук, это смысл, который нужно придумать поверх звука.

Вывод простой: если хотите, чтобы результат генерации музыки совпал с тем, что вы себе представляли — закладывайте в промпт конкретные звуковые характеристики (жанр, инструменты, темп, тембр), а сюжет и настроение-как-историю оставляйте за кадром или добавляйте отдельно как текст песни, не как описание звучания.

📋

Схема находки (как строить промпт для музыки)

ШАГ 1: Жанр/стиль → конкретное название (не "красивая музыка", а "лоу-фай хип-хоп")
ШАГ 2: Инструменты и вокал → конкретика ("женский вокал", "акустическая гитара", "драм-машина")
ШАГ 3: Тембр и текстура звука → прилагательные звучания ("тёплый", "искажённый", "воздушный")
ШАГ 4: Темп/структура (если важно) → "120 bpm", "минорная тональность", "куплет-припев"
ШАГ 5: История/сюжет — по минимуму → если нужен, выносите в текст лирики отдельно, не смешивайте со звуковыми характеристиками

Все шаги — в одном промпте, просто в таком порядке приоритета.


🚀

Пример применения

Задача: Вы делаете фоновую музыку для видео на YouTube — атмосферный трек про «одиночество в большом городе ночью», используете Suno или Udio.

Промпт (плохой, интуитивный):

Меланхоличная песня о человеке, который идёт один по ночному городу под дождём, 
вспоминает прошлое, чувствует одиночество и надежду

Промпт (по находкам исследования):

Lo-fi хип-хоп, синтезаторные пэды, приглушённый бит, женский вокал без слов (вокализ), 
90 bpm, минорная тональность, тёплый приглушённый тембр, атмосфера ночного города

Результат: Второй промпт с высокой вероятностью даст трек, который слушатель, услышав его без контекста, опишет похожими словами — «спокойный лоу-фай», «атмосферный», «женский вокал». Первый промпт с историей про одиночество и дождь может выдать что угодно — от эмбиента до поп-баллады, потому что сюжет не имеет прямого звукового эквивалента.


🧠

Почему это работает

Генеративные модели музыки, как и текстовые LLM, обучены в основном на данных с метаданными — жанровые теги, BPM, описания инструментов. У них нет обучающего сигнала, который связывает слово «расставание» с конкретным звуком — это связь, которую слушатель додумывает сам, когда слышит готовый трек, а не то, что модель может целенаправленно воспроизвести.

Зато жанровые и инструментальные слова модель умеет реализовывать надёжно — потому что это конкретные акустические категории, а не абстрактный смысл. «Рок» превращается в гитару и барабаны — слушатель это слышит и называет теми же или соседними словами («рок» → «гитара», «электрогитара»).

Рычаг управления: если хотите предсказуемый результат — пишите звуковые характеристики (жанр, инструмент, темп, тембр). Если хотите экспериментировать и не важна точность — можно оставлять нарративные описания, результат будет непредсказуемым, но иногда интересным.


📋

Шаблон промпта для text-to-music (Suno, Udio и похожие)

{жанр/стиль}, {ключевые инструменты и тип вокала}, {темп в bpm или "медленный/быстрый"}, 
{тембр/текстура звука: тёплый/яркий/грязный/воздушный}, {тональность если важна}

Что подставлять: - {жанр/стиль} — конкретное название жанра или суб-жанра, не общее «красивая музыка» - {инструменты и вокал} — что конкретно должно звучать (гитара, синт, женский/мужской вокал, инструментал без вокала) - {темп} — bpm или словами - {тембр} — как должен звучать сам звук, а не что он должен «означать»

🚀 Быстрый старт — вставь в чат:

Вот принцип написания промптов для генерации музыки (Suno/Udio): жанр и инструменты 
долетают до результата надёжно, а истории и сюжеты — нет, потому что у них нет 
акустического эквивалента. Помоги мне составить промпт для {моя задача}, 
задавай вопросы про жанр, инструменты, темп и тембр — не про сюжет.

[вставить шаблон выше]

LLM спросит про конкретные звуковые характеристики вашей задачи — жанр, темп, инструменты — потому что именно они попадают в готовый трек, а сюжетные детали модель не сможет закодировать в звук.


⚠️

Ограничения

⚠️ Одна система: все выводы получены только на Udio. Другие сервисы (Suno, MusicFX) могут вести себя иначе — особенно Suno, где промпт проходит через дополнительную обработку LLM перед генерацией.

⚠️ Кросс-культурная часть предварительная: сравнение английских и корейских слушателей — исследователи сами называют его exploratory (предварительным), группы отличались по способу набора участников, различия могут быть не только культурными.

⚠️ Не решает проблему лирики: если вам нужна музыка с текстом песни про конкретную историю — вывод не про это. Речь только про то, что промпт-описание звучания (не текст песни) с историей не совпадает с тем, как слушатель опишет звук.


🔍

Как исследовали

Команда взяла 200 реальных промптов из открытого датасета пользовательских запросов к Udio, сгенерировала по ним аудио и попросила 70 англоязычных и 78 корейскоязычных слушателей своими словами описать, что они услышали — без подсказок, в свободной форме. Чтобы сравнивать тексты, два аспиранта вручную (не через автоматический алгоритм, как в предыдущих работах) разработали таксономию из семи категорий: жанр, настроение, инструменты, музыкальная теория, тембр, функция и сюжет/история.

Дальше сравнивали тексты на трёх уровнях: какие категории вообще встречаются (presence), сколько места они занимают в тексте (density), и насколько по смыслу похожи промпт и описание (через векторное сравнение Sentence-BERT). Интересная деталь: даже когда слово из жанра не повторялось буквально, слушатель называл «соседнее» слово — «metal» превращалось в «rock» или «scream», «hip-hop» — в «rap». Модель воспроизводит не точное слово, а смысловую окрестность.

Самый неожиданный результат — сюжетные промпты не просто слабо совпадали с описанием, а были главным предиктором несовпадения: в промптах с низким совпадением доля нарративных слов была почти в три раза выше, чем в промптах с высоким совпадением. Это и дало главный практический вывод — сюжет в промпте не гарантия сюжета в звуке.


🔗

Ресурсы

From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music, Sangheon Park, Claire Arthur — Georgia Institute of Technology, School of Music. Опубликовано в материалах ISMIR 2026. Основано на датасете промптов Casini et al. и Song Describer dataset.


📋 Дайджест исследования

Ключевая суть

Обнаружено: слово «рок» почти всегда узнаётся в готовом треке. Слово «расставание в дождливую ночь» — почти никогда. Разбор 200 промптов для Suno и Udio показывает системный разрыв между тем, что вы пишете, и тем, что слышит слушатель. Метод позволяет писать промпты для AI-музыки так, чтобы результат совпал с задумкой. Модель кодирует только акустический след — тембр, инструмент, темп, а сюжет она в звук не превращает, слушатель просто додумывает его сам после того как трек уже готов.

Принцип работы

Правило простое: пиши то, что имеет звук, а не то, что имеет смысл. Жанр, инструмент, темп, тембр — это акустические категории, они попадают в трек напрямую. История, метафоры, настроение-как-сюжет — это смысл, который слушатель достраивает уже поверх готового звука. Хочешь предсказуемый результат — выбрасывай сюжет из описания звучания, а текст песни пиши отдельным блоком, не смешивая со звуковыми характеристиками.

Почему работает

Причина техническая: модели генерации музыки учились на данных с метками — жанровые теги, темп в BPM, названия инструментов. Слова вроде «расставание» там не было — модель никогда не видела пару «это слово → такой звук». Отсюда разрыв на 200 промптах: жанр в описании и в отзыве слушателя совпадает почти всегда, история — почти никогда. Слушатель слышит минорную тональность и медленный темп и сам придумывает историю про расставание — это работа его головы, а не модели.

Когда применять

Генерация музыки в Suno, Udio, MusicFX → конкретно для задач, где важно предсказать звучание заранее — фон для видео, подкаста, рекламного ролика. Не подходит, если нужен трек с текстом песни про конкретную историю — сюжет туда закладывается через лирику, а не через описание звучания.

Мини-рецепт

1. Жанр: назови конкретный поджанр — не «красивая музыка», а «лоу-фай хип-хоп»
2. Инструменты и вокал: что реально должно звучать — гитара, синтезатор, женский вокал без слов
3. Тембр: как звучит сам звук — тёплый, искажённый, воздушный
4. Темп: цифра в BPM или «медленный/быстрый», плюс тональность если важна
5. Сюжет — по минимуму: если нужен, пиши его отдельно как текст песни, не смешивай со звуковыми характеристиками

Примеры

[ПЛОХО] : Меланхоличная песня о человеке, который идёт один по ночному городу под дождём, вспоминает прошлое и чувствует одиночество
[ХОРОШО] : Lo-fi хип-хоп, синтезаторные пэды, приглушённый бит, женский вокал без слов, 90 bpm, минорная тональность, тёплый приглушённый тембр
Источник: From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music
ArXiv ID: 2608.06634 | Сгенерировано: 2026-08-10 05:38

Проблемы LLM

ПроблемаСутьКак обойти
Сюжет и история не превращаются в звук при генерации музыкиПросишь модель сделать песню «про расставание в дождливую ночь». Модель не может закодировать смысл слов в звуковые волны — у дождя и расставания нет тембра, темпа или инструмента. Результат звучит как что угодно, не связанное с сюжетом. Слушатель, услышав трек без текста промпта, никогда не угадает историю, которую ты закладывалУбери сюжет из описания звучания. Опиши жанр, инструменты, темп, тембр напрямую: «лоу-фай хип-хоп, женский вокал без слов, 90 bpm, тёплый приглушённый звук». Если история нужна — вынеси её в текст песни (лирику), а не в описание звука

Методы

МетодСуть
Порядок приоритета в промпте для музыки: жанр инструменты тембр темп сюжет (по минимуму)Пиши промпт в таком порядке: конкретный жанр/суб-жанр, конкретные инструменты и тип вокала, прилагательные тембра («тёплый», «искажённый», «воздушный»), темп в bpm или словами. Сюжет добавляй последним и по минимуму, либо выноси в отдельный текст лирики. Работает потому что модель обучена на метаданных (жанровые теги, bpm, описания инструментов) — это прямые акустические категории, которые она умеет воспроизводить. Абстрактный сюжет такого прямого эквивалента не имеет. Применяй: когда нужен предсказуемый, узнаваемый результат в text-to-music сервисах (Suno, Udio). Не применяй: если цель — эксперимент и неожиданный результат важнее точности

Тезисы

ТезисКомментарий
Генеративная модель надёжно воспроизводит только то, что имеет прямой физический след в обучающих данныхМодель музыки (как и модель картинок) учится на данных с метками: жанр, темп, инструмент — это конкретные акустические категории с чётким соответствием звуку. Слово «расставание» или «одиночество» — это смысл, который слушатель домысливает сам после того, как услышит трек, а не то, что модель целенаправленно кодирует в звуковые волны. Применяй: при работе с любой генерацией медиа (музыка, изображения) закладывай в описание физически измеримые характеристики результата (стиль, материал, цвет, звук, форма), а абстрактные идеи и истории добавляй отдельным слоем, не смешивая с описанием самого объекта
📖 Простыми словами

FromPromptingto Describing: A Cross-Cultural Study ofLanguageforAI-Generated Music

arXiv: 2608.06634

Музыкальные нейронки вроде Suno или Udio работают не как композиторы-интеллектуалы, а как автоматические сортировщики тегов. В их «мозгах» звук намертво сцеплен с техническими параметрами: жанром, темпом и набором инструментов. Когда ты пишешь промпт, модель ищет в своей базе не эмоции, а конкретные звуковые паттерны. Проблема в том, что для ИИ существует только то, что можно измерить или четко классифицировать, а всё остальное — информационный шум, который он просто игнорирует.

Это как если бы ты пришел к глухому повару и попросил приготовить «блюдо с привкусом ностальгии по детству». Повар пожмет плечами и просто сварит тебе макароны, потому что «макароны» — это понятный ингредиент, а «ностальгия» — это абстрактная херня, которой нет в холодильнике. В итоге ты получаешь еду, которая технически съедобна, но совершенно не попадает в твое настроение, потому что повар и ты говорите на разных языках.

Исследование показало жесткую статистику: слова про жанр вроде «синтвейв» или «лоу-фай» отражаются в звуке почти всегда, а вот сюжетные заходы про «разбитое сердце» или «путешествие героя» пролетают мимо кассы. Модели обучены на метаданных, а не на глубоком анализе смыслов. У них нет нейронной связи между словом «расставание» и минорным аккордом — эту связь достраивает уже твой мозг, когда слушает готовый трек, а сама нейронка просто накидала случайных звуков из категории «грустный поп».

Этот принцип функционального разрыва применим к любому генеративному контенту. Если ты делаешь фоновую музыку для видео или заказываешь ИИ-картинку, забудь про эпитеты и «душу». Работают только жесткие дескрипторы: инструменты, темп, конкретные стили. Пытаться выжать из нейронки сложную метафору — это пустая трата времени, она всё равно выдаст усредненный результат по самому понятному ей тегу. Жанр побеждает сюжет в 10 случаях из 10.

Короче: хватит играть в поэта, когда общаешься с алгоритмом. Если хочешь получить нужный вайб, описывай не чувства, а инструменты, которые эти чувства вызывают. Вместо «одиночества в большом городе» пиши «эмбиент, медленное пианино, звуки дождя, лоу-фай». Либо ты говоришь на языке тегов, либо получаешь рандомную поделку, в которой формально всё на месте, но смысла ноль. Кто научится переводить эмоции в технические параметры, тот и приручит эти модели.

Работа с исследованием

Адаптируйте исследование под ваши задачи или создайте готовый промпт на основе техник из исследования.

0 / 2000
~0.5-2 N-токенов ~10-30с
~0.3-1 N-токенов ~5-15с