Аудио AI РЪКОВОДСТВО

Символично музикално поколение

Генерирането на символична музика създава музика като структурирана нотация — ноти, височини, времетраене и тайминг (често като MIDI) — вместо като необработено аудио.

2 min readПоследна актуализация

Преглед

It gives composers editable, instrument-agnostic output they can tweak note by note.

Дълбоко гмуркане

Вместо да произвеждат завършена форма на вълната, символните системи генерират „партитурата“: последователности от ноти с височина, продължителност, скорост и синхронизиране, обикновено в MIDI или форма на пиано. Тъй като изходът е символичен, той е напълно редактиран - можете да промените една нота, да размените инструменти, да транспонирате клавиши или да я предадете на човек-изпълнител. Забележителните проекти включват MelodyRNN и MusicVAE на Google Magenta, MuseNet (2019) на OpenAI, който генерира многоинструментални композиции в много стилове, и работата на Anticipatory Music Transformer. Компромисът спрямо инструментите за необработен звук като Suno е, че символичните модели не произвеждат действителния звук или реалистични вокали; имат нужда от синтезатор или семплер, за да бъдат чути. Но те предлагат прецизност, контролируемост и малки, бързи изображения.

Техническа информация

Тези модели третират музиката като език: бележките (или нотни събития като „включване на нота“, „изключване на нота“, отместване на времето) се превръщат в токени и модел на последователност – исторически RNN/LSTM, сега обикновено Трансформатор – предсказва следващото събитие. Някои използват VAE, за да научат гладко латентно пространство, така че да можете да интерполирате между мелодиите. Тъй като символната последователност е хиляди пъти по-къса от необработената форма на вълната, тези модели се обучават и генерират много по-бързо от аудио моделите и техният изход може директно да се редактира във всеки софтуер за нотиране.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на символното музикално поколение

Генерирането на символи все повече се съчетава с аудио: Transformer композира партитурата, след което висококачествен невронен синтезатор или семплер я изобразява, съчетавайки възможност за редактиране с реалистичен звук. Очаквайте по-тясна интеграция в DAW и инструменти за нотиране като копилоти, които предлагат хармонии, допълват аранжименти или продължават мелодия при поискване. Тъй като контролът се подобрява, музикантите вероятно ще третират символичния AI като интерактивен партньор за композиране, като тръбопроводът за символно-плюс-аудио преодолява празнината до продукция със студийно качество.

Внедряване в реалния свят

Композитор, използващ Google Magenta инструменти за генериране на идеи за мелодия или хармония, след което редактира нота по нота в DAW.

Студио за игри, генериращо процедурно MIDI фонова музика, която се адаптира към играта и се изобразява с всеки набор от инструменти.

Музикално-образователен софтуер, генериращ автоматично практически упражнения и акомпанимент в избрана тоналност и трудност.

Продуцент, използващ модели в стил MuseNet, за да изготви многоинструментални аранжименти в различни жанрове, след което ги прецизира и реоркестрира.

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Symbolic Music Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

MusicLM йерархично генериране на музика

Frequently asked questions

What is Symbolic Music Generation?

Генерирането на символична музика създава музика като структурирана нотация — ноти, височини, времетраене и тайминг (често като MIDI) — вместо като необработено аудио. Той дава на композиторите възможност за редактиране, независими от инструменти изходни данни, които те могат да променят нота по нота.

Какво всъщност произвежда генерирането на символична музика?

Символните системи извеждат "партитурата" - отбелязват събития като височина, продължителност и време - вместо действителния звук.

Какво е ключово предимство на символния изход пред генерирането на необработен звук?

Тъй като изходът е символична нотация, всяка нота може да се редактира и може да бъде транспонирана, преинструментирана или изпълнена от човек.

Кой от тях е добре познат символичен музикален модел от OpenAI?

MuseNet (2019) генерира символични композиции с множество инструменти в много музикални стилове.

Как съвременните символни модели обикновено третират музиката изчислително?

Символните модели токенизират нотни събития (като нотно включване, нотно изключване, времево изместване) и използват модели на последователност като Transformers, за да предскажат следващото събитие.

Защо символичните модели обикновено се обучават и генерират по-бързо от моделите със суров звук?

Една символна последователност е много по-компактна от милиони аудио проби, така че моделите я обработват много по-ефективно.