TL;DR
Когда вы просите Suno или Udio сгенерировать песню, слова про жанр («рок», «лоу-фай», «80-е синтвейв») почти всегда узнаются в готовом треке — а слова про историю и сюжет («песня о разбитом сердце в дождливую ночь», «путешествие героя») почти никогда не долетают до звука. Исследователи сравнили 200 промптов и то, как слушатели описывают получившуюся музыку своими словами — и нашли системный разрыв.
Люди пишут промпты как сценарии: жанр плюс история. Но у AI-модели, которая генерирует музыку, нет способа «закодировать» сюжет в звуковые волны — она превращает в звук только то, что имеет акустический след: тембр, инструмент, темп, стиль. Промпт с историей про «расставание в дождливую ночь» может звучать как что угодно, потому что дождь и расставание — это не звук, это смысл, который нужно придумать поверх звука.
Вывод простой: если хотите, чтобы результат генерации музыки совпал с тем, что вы себе представляли — закладывайте в промпт конкретные звуковые характеристики (жанр, инструменты, темп, тембр), а сюжет и настроение-как-историю оставляйте за кадром или добавляйте отдельно как текст песни, не как описание звучания.
Схема находки (как строить промпт для музыки)
ШАГ 1: Жанр/стиль → конкретное название (не "красивая музыка", а "лоу-фай хип-хоп")
ШАГ 2: Инструменты и вокал → конкретика ("женский вокал", "акустическая гитара", "драм-машина")
ШАГ 3: Тембр и текстура звука → прилагательные звучания ("тёплый", "искажённый", "воздушный")
ШАГ 4: Темп/структура (если важно) → "120 bpm", "минорная тональность", "куплет-припев"
ШАГ 5: История/сюжет — по минимуму → если нужен, выносите в текст лирики отдельно, не смешивайте со звуковыми характеристиками
Все шаги — в одном промпте, просто в таком порядке приоритета.
Пример применения
Задача: Вы делаете фоновую музыку для видео на YouTube — атмосферный трек про «одиночество в большом городе ночью», используете Suno или Udio.
Промпт (плохой, интуитивный):
Меланхоличная песня о человеке, который идёт один по ночному городу под дождём,
вспоминает прошлое, чувствует одиночество и надежду
Промпт (по находкам исследования):
Lo-fi хип-хоп, синтезаторные пэды, приглушённый бит, женский вокал без слов (вокализ),
90 bpm, минорная тональность, тёплый приглушённый тембр, атмосфера ночного города
Результат: Второй промпт с высокой вероятностью даст трек, который слушатель, услышав его без контекста, опишет похожими словами — «спокойный лоу-фай», «атмосферный», «женский вокал». Первый промпт с историей про одиночество и дождь может выдать что угодно — от эмбиента до поп-баллады, потому что сюжет не имеет прямого звукового эквивалента.
Почему это работает
Генеративные модели музыки, как и текстовые LLM, обучены в основном на данных с метаданными — жанровые теги, BPM, описания инструментов. У них нет обучающего сигнала, который связывает слово «расставание» с конкретным звуком — это связь, которую слушатель додумывает сам, когда слышит готовый трек, а не то, что модель может целенаправленно воспроизвести.
Зато жанровые и инструментальные слова модель умеет реализовывать надёжно — потому что это конкретные акустические категории, а не абстрактный смысл. «Рок» превращается в гитару и барабаны — слушатель это слышит и называет теми же или соседними словами («рок» → «гитара», «электрогитара»).
Рычаг управления: если хотите предсказуемый результат — пишите звуковые характеристики (жанр, инструмент, темп, тембр). Если хотите экспериментировать и не важна точность — можно оставлять нарративные описания, результат будет непредсказуемым, но иногда интересным.
Шаблон промпта для text-to-music (Suno, Udio и похожие)
{жанр/стиль}, {ключевые инструменты и тип вокала}, {темп в bpm или "медленный/быстрый"},
{тембр/текстура звука: тёплый/яркий/грязный/воздушный}, {тональность если важна}
Что подставлять: - {жанр/стиль} — конкретное название жанра или суб-жанра, не общее «красивая музыка» - {инструменты и вокал} — что конкретно должно звучать (гитара, синт, женский/мужской вокал, инструментал без вокала) - {темп} — bpm или словами - {тембр} — как должен звучать сам звук, а не что он должен «означать»
🚀 Быстрый старт — вставь в чат:
Вот принцип написания промптов для генерации музыки (Suno/Udio): жанр и инструменты
долетают до результата надёжно, а истории и сюжеты — нет, потому что у них нет
акустического эквивалента. Помоги мне составить промпт для {моя задача},
задавай вопросы про жанр, инструменты, темп и тембр — не про сюжет.
[вставить шаблон выше]
LLM спросит про конкретные звуковые характеристики вашей задачи — жанр, темп, инструменты — потому что именно они попадают в готовый трек, а сюжетные детали модель не сможет закодировать в звук.
Ограничения
⚠️ Одна система: все выводы получены только на Udio. Другие сервисы (Suno, MusicFX) могут вести себя иначе — особенно Suno, где промпт проходит через дополнительную обработку LLM перед генерацией.
⚠️ Кросс-культурная часть предварительная: сравнение английских и корейских слушателей — исследователи сами называют его exploratory (предварительным), группы отличались по способу набора участников, различия могут быть не только культурными.
⚠️ Не решает проблему лирики: если вам нужна музыка с текстом песни про конкретную историю — вывод не про это. Речь только про то, что промпт-описание звучания (не текст песни) с историей не совпадает с тем, как слушатель опишет звук.
Как исследовали
Команда взяла 200 реальных промптов из открытого датасета пользовательских запросов к Udio, сгенерировала по ним аудио и попросила 70 англоязычных и 78 корейскоязычных слушателей своими словами описать, что они услышали — без подсказок, в свободной форме. Чтобы сравнивать тексты, два аспиранта вручную (не через автоматический алгоритм, как в предыдущих работах) разработали таксономию из семи категорий: жанр, настроение, инструменты, музыкальная теория, тембр, функция и сюжет/история.
Дальше сравнивали тексты на трёх уровнях: какие категории вообще встречаются (presence), сколько места они занимают в тексте (density), и насколько по смыслу похожи промпт и описание (через векторное сравнение Sentence-BERT). Интересная деталь: даже когда слово из жанра не повторялось буквально, слушатель называл «соседнее» слово — «metal» превращалось в «rock» или «scream», «hip-hop» — в «rap». Модель воспроизводит не точное слово, а смысловую окрестность.
Самый неожиданный результат — сюжетные промпты не просто слабо совпадали с описанием, а были главным предиктором несовпадения: в промптах с низким совпадением доля нарративных слов была почти в три раза выше, чем в промптах с высоким совпадением. Это и дало главный практический вывод — сюжет в промпте не гарантия сюжета в звуке.
Ресурсы
From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music, Sangheon Park, Claire Arthur — Georgia Institute of Technology, School of Music. Опубликовано в материалах ISMIR 2026. Основано на датасете промптов Casini et al. и Song Describer dataset.
