自動音楽採譜
自動音楽転写 (AMT) は、音楽の生のオーディオ録音を楽譜、MIDI、ピアノ ロールなどの記号表記に変換します。
概要
It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.
ディープダイブ
AMT システムはオーディオ波形をリッスンし、どの音が演奏されるか、いつ開始されるか、どのくらい持続するか、場合によってはどの楽器が演奏するかを出力します。最大の課題はポリフォニーです。複数の音を同時に鳴らすと、その倍音が重なって周波数スペクトル内でぼやけてしまうため、1 つの大きな音から 1 つの C と G を分離するのが困難になることがあります。最新のシステムは、オーディオをメル スペクトログラムや Constant-Q Transform などの時間周波数表現に変換し、ディープ ニューラル ネットワークを使用してノートのオンセット、オフセット、ピッチを予測します。 Google のオンセットとフレーム モデルはピアノの転写のランドマークであり、MT3 のような新しいトランスフォーマー モデルは一度に複数の楽器を転写します。
技術的な洞察
重要な洞察は、オンセット検出をフレームレベルのピッチ検出から分離することです。 Onsets や Frames などのモデルは、1 つのネットワーク ヘッドを使用してノートが始まる正確な瞬間 (シャープでエネルギッシュなイベント) を特定し、もう 1 つのネットワーク ヘッドを使用して各フレームでどのピッチが鳴っているかを追跡します。オンセット予測はフレーム出力をゲートし、偽のノートを大幅に削減します。 Constant-Q 変換は、周波数ビンを対数的に配置し、音楽のピッチの 1 オクターブ間隔に一致させるため役立ちます。
戦略的影響
アクセスと到達範囲
文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。
費用と予算
メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。
速度とスケール
顧客対応システムは、音声対話を大規模に処理できます。
自動音楽採譜の未来
AMT はソロ ピアノから、ドラム、ボーカル、ベンドやビブラートなどの表現テクニックを含む、信頼性の高いマルチ楽器およびフルバンドのトランスクリプションに移行しています。大規模な合成および調整されたデータセットでトレーニングされたトランスフォーマー アーキテクチャがそのギャップを埋めつつあります。ソース分離、ライブ パフォーマンス用のリアルタイム トランスクリプション、ノートだけでなくマイクロ タイミングとダイナミクスをキャプチャするツールとのより緊密な統合が期待されます。長期的な目標は、あらゆる録音を編集可能で人間が読めるスコアに変換するシステムです。
現実世界の実装
MP3 録音を編集可能な楽譜に変換する AnthemScore および同様のアプリで、ミュージシャンが耳で曲を学ぶことができます。
ピアノ録音から MIDI を抽出し、プロデューサーが DAW で演奏をリボイスしたりクオンタイズできるようにします。
生徒が演奏した音符とスコアを比較して、間違った音符や見逃した音符にフラグを立てる音楽教育ツール
歴史的な録音や即興録音(ジャズのソロなど)を分析のために記譜する音楽学者
リスクとガードレール
同意がない場合、音声の悪用やなりすましのリスクが高まります。
アクセント、方言、または騒がしい環境では精度が低下する可能性があります。
合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。
実装ロードマップ
音声のキャプチャ、複製、再利用については明示的な同意を取得してください。
さまざまな話者や背景条件で品質をテストします。
人間がいつ出力をレビューまたは承認する必要があるかを定義します。
合成音声にラベルを付け、出所記録を保管して説明責任を果たします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Automatic Music Transcription quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
象徴的な音楽の生成
よくある質問
What is Automatic Music Transcription?
自動音楽転写 (AMT) は、音楽の生のオーディオ録音を楽譜、MIDI、ピアノ ロールなどの記号表記に変換します。これは、オーディオ AI における最も困難な問題の 1 つである、一度に再生される多くの重なり合うノートのもつれを解くことに取り組みます。
自動音楽転写は主に何を出力しますか?
AMT は、オーディオ録音を MIDI、ピアノ ロール、演奏された音符を記述する楽譜などの記号表記に変換します。
ポリフォニック音楽はなぜ転写が特に難しいのでしょうか?
複数の音が同時に鳴ると、その倍音が重なって、どの音程が存在するかを区別することが困難になります。
Google のオンセットとフレーム モデルで注目すべき点は何ですか?
オンセットとフレームでは、1 つのヘッドを使用して正確なノートのオンセットを検出し、もう 1 つのヘッドを持続ピッチに使用し、オンセットがフレーム出力をゲートしました。
Constant-Q Transform が音楽に役立つのはなぜですか?
音楽のピッチは対数的に配置されており (オクターブの周波数は 2 倍)、CQT の対数間隔のビンはこれに自然に一致します。
転写における「オンセット」とは何を指しますか?
オンセットとは、ノートが始まるときのシャープでエネルギッシュな瞬間であり、サステインよりも正確に定位するのが簡単です。