ジュークボックス
ジュークボックスは、OpenAI の 2020 年ニューラル ネットワークで、生の音楽オーディオを生成します。これには、歌声、楽器、さらには特定のアーティストのスタイルの歌詞も含まれます。
概要
It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.
ディープダイブ
2020 年 4 月に OpenAI によってリリースされたジュークボックスは、記号的な音符ではなく生のオーディオとして音楽を生成します。つまり、ボーカルを含む実際のサウンドが生成されます。これは、Web から収集した約 120 万曲 (約半分が英語) に基づいてトレーニングされ、LyricWiki の歌詞とメタデータと組み合わせられました。ジャンル、アーティストのスタイル、歌詞に条件を付けると、そのアーティストのように(かすかながらでも)認識できるように歌います。出力は数分間実行されます。問題は速度と忠実度です。生成は非常に遅く、1 分間のオーディオをレンダリングするのに約 9 時間かかり、結果はこもったノイズの多い品質になります。ジュークボックスは研究されたものであり、洗練された製品ではありませんでしたが、可能性に対する期待を再形成しました。
技術的な洞察
ジュークボックスは、VQ-VAE オートエンコーダーを使用して 3 つの時間分解能で生のオーディオを圧縮し、長い波形をより短い離散コードのシーケンスに変換します。次に、自己回帰トランスフォーマーがアーティスト、ジャンル、歌詞に基づいてこれらのコードを 1 つずつ予測し、アップサンプラーが高周波のディテールを追加します。最下位レベルのコードをデコードして 44.1 kHz の波形に戻すと、何百万ものオーディオ サンプルを順番に生成する必要があるため、生成が非常に遅くなります。
戦略的影響
アクセスと到達範囲
文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。
費用と予算
メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。
速度とスケール
顧客対応システムは、音声対話を大規模に処理できます。
ジュークボックスの未来
現在、ジュークボックス自体は主に歴史的なマイルストーンであり、CD に近い品質の曲を数秒で生成する、Suno や Udio のような、より迅速な普及と潜在的なオーディオ モデルに取って代わられています。その中心となるアイデア、つまり個別のオーディオ トークンと歌詞の条件付けは、現代のシステムにも生き続けています。将来の生オーディオ モデルでは、生成時間が短縮され続け、ボーカルの明瞭さが向上し、細かいコントロールが追加されることが予想されますが、その一方で、著作権で保護された録音のトレーニングに関してジュークボックスが最初に提起した著作権に関する疑問は大きくなるばかりです。
現実世界の実装
ジュークボックスを参照アーキテクチャとして使用し、ニューラル ネットワークが長い形式の生のオーディオと歌声をモデル化する方法を研究している研究者。
ミュージシャンや愛好家は、選ばれたアーティストのラフなスタイルで新しい歌詞を歌う不気味でローファイな「AI カバー」を生成します。
MIDI スタイルの音符生成から、ボーカルを含む完全な生オーディオ合成への飛躍を実演する教育者。
サウンド デザイナーと実験アーティストは、リミックスやコラージュの原材料としてジュークボックスのぼんやりとした夢のようなテクスチャを収集します。
リスクとガードレール
同意がない場合、音声の悪用やなりすましのリスクが高まります。
アクセント、方言、または騒がしい環境では精度が低下する可能性があります。
合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。
実装ロードマップ
音声のキャプチャ、複製、再利用については明示的な同意を取得してください。
さまざまな話者や背景条件で品質をテストします。
人間がいつ出力をレビューまたは承認する必要があるかを定義します。
合成音声にラベルを付け、出所記録を保管して説明責任を果たします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
象徴的な音楽の生成
よくある質問
What is Jukebox?
ジュークボックスは、OpenAI の 2020 年ニューラル ネットワークで、生の音楽オーディオを生成します。これには、歌声、楽器、さらには特定のアーティストのスタイルの歌詞も含まれます。これは、AI が音符だけでなく、曲の長さの音楽の実際の波形をモデル化できるという画期的な証明でした。
ジュークボックスは、MIDI を出力する以前の記号音楽 AI のようなシステムと何が違うのでしょうか?
ジュークボックスは、音楽の実際のサウンドを生のオーディオとしてモデル化するため、音符データのみを出力するシンボリック システムとは異なり、ボーカルや楽器の音色を生成できます。
ジュークボックスは誰が、そしておおよそいつリリースしましたか?
OpenAI は、ボーカルを含む音楽を生成するための研究モデルとして、2020 年 4 月に Jukebox をリリースしました。
ジュークボックスの実質的な大きな制限は何ですか?
生のオーディオをサンプルごとにデコードするため、ジュークボックスは 1 分間の音楽を生成するのに 9 時間程度かかり、リアルタイムでの使用は非現実的でした。
ジュークボックスは、トランスフォーマーで長い生のオーディオを管理できるようにするためにどのようなコア技術を使用していますか?
ジュークボックスは、VQ-VAE オートエンコーダーを使用して波形を個別のトークンに圧縮し、トランスフォーマーはオーディオにアップサンプリングする前に自己回帰的にモデル化します。
ジュークボックスの出力を調整できるものは何ですか?
ジュークボックスは、ジャンル、真似するアーティスト、歌詞を受け入れ、そのスタイルでその言葉を歌おうとします。