音訊人工智慧指南

使用變形金剛進行音樂標記

音樂標籤使用 Transformer 模型來聆聽歌曲並預測描述性標籤,例如流派、情緒、樂器和節奏。

閱讀時間約2分鐘最後更新

概述

It powers search, recommendation, and auto-organization across huge music catalogs.

深入探討

音樂自動標記是一個多標籤分類問題:一首曲目可以同時是「搖滾」、「活力」、「吉他」和「器樂」。 Transformer 透過將音訊轉換為頻譜圖(時頻影像)並透過自註意力層提供它的補丁來解決這個問題,就像 Vision Transformer 處理影像補丁一樣。音訊頻譜圖轉換器 (AST) 和 MERT 等模型可以學習整個音軌的長範圍模式,捕捉合唱與相隔幾分鐘的主歌之間的關係。許多都是在數百萬個未標記的剪輯上進行自我監督預訓練,然後在 MagnaTagATune 或百萬歌曲資料集等標記資料集上進行微調。由於標籤並不互相排斥,因此最後一層使用 sigmoid 輸出,根據平均精確度和 ROC-AUC 等基準進行評分。

技術洞察

原始音訊被轉換為 log-Mel 頻譜圖,分成重疊的區塊,並線性嵌入位置編碼。自註意讓每個補丁都權衡其他補丁,因此遙遠的音樂事件會影響每個標籤。與單標籤圖像分類器不同,音樂標籤對每個標籤應用一個 sigmoid,而不是一個 softmax,因為標籤同時出現。自監督預訓練(預測屏蔽音頻標記)在對較小的標記集進行微調之前提供了強有力的表示。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

變形金剛音樂標籤的未來

標籤與自然語言理解相結合,因此您可以搜尋“帶有乙烯基爆裂聲的夢幻低保真音樂用於學習”,而不是固定的流派按鈕。 CLAP 等對比音訊文字模型將音樂和描述集中在一個空間中,從而實現訓練中從未見過的零樣本標籤。期待更豐富、更精細的標籤、更好地處理融合類型以及設備上的隱私標記。圍繞受版權目錄培訓的權利和歸屬辯論將決定這些模型可以使用哪些數據。

現實世界的實施

自動產生流派和情緒標籤,以便串流媒體服務可以建立「焦點」或「鍛鍊」播放列表

讓音樂庫為搜尋同步授權的影片編輯者提供「歡快的原聲吉他」曲目

為推薦引擎提供動力,以找到超出用戶明確評分範圍的聲音相似歌曲

透過偵測到的樂器、調性和速度自動組織製作人的樣本集合

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Music Tagging with Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

音樂自動標記

常見問題

What is Music Tagging with Transformers?

音樂標籤使用 Transformer 模型來聆聽歌曲並預測描述性標籤,例如流派、情緒、樂器和節奏。它支援跨龐大音樂目錄的搜尋、推薦和自動組織。

為什麼音樂標籤被視為多標籤問題?

一首歌可以同時是搖滾、充滿活力和吉他驅動的,因此多個標籤適用於一首曲目。

變壓器標註器通常使用什麼輸入表示?

音訊被轉換為時頻頻譜圖,然後像影像補丁一樣透過自註意力進行補丁和饋送。

為什麼音樂標籤模型對每個標籤使用 sigmoid 輸出而不是一個 softmax?

Softmax 強制機率總和為 1(單選); sigmoid 讓每個標籤獨立為真。

自監督預訓練對於 MERT 等模型有何作用?

在大型未標記語料庫上對屏蔽音訊預測進行預訓練,建立隨後在標記資料上進行微調的表示。

哪個資料集通常用於微調和基準音樂標記器?

MagnaTagATune 和百萬歌曲資料集是標準標記音樂基準; MNIST 和 ImageNet 是圖像集。