音訊人工智慧指南

象徵性音樂的產生

符號音樂生成將音樂創建為結構化記譜——音符、音調、持續時間和時間(通常為 MIDI)——而不是原始音訊。

閱讀時間約2分鐘最後更新

概述

It gives composers editable, instrument-agnostic output they can tweak note by note.

深入探討

符號系統不是產生最終的波形,而是產生「樂譜」:具有音高、持續時間、力度和計時的音符序列,通常採用 MIDI 或鋼琴捲簾形式。因為輸出是符號性的,所以它是完全可編輯的——您可以更改單個音符、交換樂器、移調鍵或將其交給人類表演者。標誌性項目包括 Google Magenta 的 MelodyRNN 和 MusicVAE、OpenAI 的 MuseNet (2019)(產生了多種風格的多樂器作品)以及 Anticipatory Music Transformer 作品。與 Suno 等原始音訊工具相比,符號模型無法產生實際的聲音或真實的聲音;他們需要合成器或取樣器才能被聽到。但它們提供了精確性、可控性以及微小、快速的表示。

技術洞察

這些模型將音樂視為一種語言:音符(或音符事件,例如“音符開”、“音符關”、時移)成為標記,序列模型(歷史上是 RNN/LSTM,現在通常是 Transformer)預測下一個事件。有些使用 VAE 來學習平滑的潛在空間,以便您可以在旋律之間進行插值。由於符號序列比原始波形短數千倍,因此這些模型的訓練和生成速度比音訊模型快得多,並且它們的輸出可以在任何符號軟體中直接編輯。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

象徵音樂世代的未來

符號生成越來越多地與音訊配對:Transformer 創作樂譜,然後由高品質的神經合成器或取樣器進行渲染,將可編輯性與逼真的聲音結合。預計將更緊密地整合到 DAW 和記譜工具中,作為副駕駛,建議和聲、填充編曲或按需繼續旋律。隨著控制的改進,音樂家可能會將符號人工智慧視為互動式作曲夥伴,符號加音訊管道彌合了與工作室品質輸出的差距。

現實世界的實施

作曲家使用 Google Magenta 工具產生旋律或和聲創意,然後在 DAW 中逐個音符進行編輯。

遊戲工作室按程式產生 MIDI 背景音樂,適應遊戲玩法並使用任何樂器組進行渲染。

音樂教育軟體會自動產生選定調和難度的練習題和伴奏。

製作人使用 MuseNet 風格的模型來起草跨流派的多樂器編排,然後對其進行完善和重新編排。

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Symbolic Music Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

MusicLM 分層音樂生成

常見問題

What is Symbolic Music Generation?

符號音樂生成將音樂創建為結構化記譜——音符、音調、持續時間和時間(通常為 MIDI)——而不是原始音訊。它為作曲家提供了可編輯的、與樂器無關的輸出,他們可以逐個音符地進行調整。

象徵性音樂的產生實際上產生了什麼?

符號系統輸出「樂譜」——音調、持續時間和時間等音符事件——而不是實際的聲音。

與原始音訊生成相比,符號輸出的主要優勢是什麼?

由於輸出是符號符號,因此每個音符都是可編輯的,並且可以由人類轉置、重新演奏或演奏。

下列哪一個是 OpenAI 中著名的符號音樂模型?

MuseNet(2019)產生了跨越多種音樂風格的多樂器符號作品。

現代符號模型通常如何透過計算處理音樂?

符號模型對音符事件(如音符開、音符關閉、時移)進行標記,並使用 Transformer 等序列模型來預測下一個事件。

為什麼符號模型的訓練和生成速度通常比原始音訊模型更快?

符號序列比數百萬個音訊樣本要緊湊得多,因此模型處理它的效率要高得多。