オーディオAIガイド

MusicLM: 階層的なセマンティックおよび音響トークン

MusicLM は、Google のテキストから音楽へのモデルであり、音楽構造のセマンティック トークンとサウンドの詳細の音響トークンの階層を通じて長文オーディオを生成します。

2分の読書最終更新日

ディープダイブ

Google 研究によって 2023 年初頭に発表された MusicLM は、言語モデルが単語を予測するのと同じように、個別のオーディオ トークンのシーケンスを予測するものとして音楽生成を構成します。これは表現の階層を使用します。セマンティック トークン (w2v-BERT と呼ばれるモデルから) は、長いスパンにわたってメロディーやリズムなどの高レベルの構造をキャプチャし、一方、音響トークン (SoundStream ニューラル コーデックから) は、音色やテクスチャなどの詳細をキャプチャします。最初のステージでは、テキスト プロンプトからセマンティック トークンが生成され、その後のステージで、それらのセマンティクスに基づいて音響の詳細が入力されます。テキスト コンディショニングは、説明と音声が同じ空間に収まるようにトレーニングされた共同音楽テキスト埋め込みである MuLM/MuLan から来ています。この段階的なアプローチにより、MusicLM は数秒後に変化するのではなく、数分間音楽的に一貫した状態を保つことができます。

技術的な洞察

重要なアイデアは、トークン階層全体で構造をテクスチャから切り離すことです。粗いセマンティック トークンはまばらで変化が遅いため、Transformer はシーケンス長が長くなくても長期的な形式をモデル化できます。音響トークンは密度が高く、レートが高いですが、すでに固定されたセマンティクスに基づいて予測するだけでよいため、各段階が扱いやすくなります。 SoundStream の残差ベクトル量子化により、階層化された音響コードが生成され、最終デコーダーが 24 kHz の波形に戻します。

戦略的影響

アクセスと到達範囲

文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。

費用と予算

メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。

速度とスケール

顧客対応システムは、音声対話を大規模に処理できます。

MusicLM の将来: 階層的なセマンティックおよび音響トークン

MusicLM の階層型トークンのアプローチは、MusicGen や商用音楽ツールなどの後のシステムのテンプレートになりました。より厳密なメロディーの調整(鼻歌を歌ったり、完全なアレンジメントを取得したり)、ヴァースとコーラスを含むより長く完全に構成された曲、楽器やキーの制御性の向上が期待されます。厄介な問題は法的および倫理的なものです。トレーニング データのライセンス、アーティストの同意、および人工の音楽と区別できるように生成されたオーディオに透かしを入れることが、現在導入の中心となっています。

現実世界の実装

書かれたシーンの説明を映画または予告編のスコアに変換する。 「合唱団を伴う壮大なオーケストラの構築」

画像のキャプションやアートインスタレーションの絵画の説明に応じた BGM を生成する

短い鼻歌や口笛のメロディーを完全に楽器化されたアレンジメントに拡張する

広告やコンテンツのクリエイター向けに、さまざまなテンポや雰囲気のさまざまなストック ミュージック トラックを作成します。

リスクとガードレール

同意がない場合、音声の悪用やなりすましのリスクが高まります。

アクセント、方言、または騒がしい環境では精度が低下する可能性があります。

合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。

実装ロードマップ

1

音声のキャプチャ、複製、再利用については明示的な同意を取得してください。

2

さまざまな話者や背景条件で品質をテストします。

3

人間がいつ出力をレビューまたは承認する必要があるかを定義します。

4

合成音声にラベルを付け、出所記録を保管して説明責任を果たします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

象徴的な音楽の生成

よくある質問

MusicLM:階層的意味トークンと音響トークンとは何か?

MusicLM は、Google のテキストから音楽へのモデルであり、音楽構造のセマンティック トークンとサウンドの詳細の音響トークンの階層を通じて長文オーディオを生成します。

MusicLM は基本的に音楽を生成するタスクをどのように処理しますか?

MusicLM は、言語モデルが単語を予測する方法と同様に、音楽生成を個別のオーディオ トークンに対する自己回帰予測としてフレーム化します。

MusicLM におけるセマンティック トークンの役割は何ですか?

セマンティック トークン (w2v-BERT から) は、長いスパンにわたってメロディーやリズムなど、粗くてゆっくりと変化する構造をキャプチャします。

音色や質感などの音響の詳細を提供するコンポーネントはどれですか?

音響トークンは SoundStream ニューラル コーデックから取得され、音色やテクスチャなどの詳細をエンコードします。

MusicLM はテキスト プロンプトを音楽オーディオにどのように接続しますか?

MuLan は、テキストの説明と一致する音声が共有埋め込み空間内の近くのポイントにマッピングされるようにトレーニングされており、テキストの調整が可能になります。

階層的で段階的な設計が長期的な構造に役立つのはなぜですか?

疎なセマンティック トークンはゆっくりと変化するため、Transformer は密な音響の詳細が埋められる前に長期的な形式を効率的にモデル化できます。