オーディオAIガイド

オーディオの定Q変換

Constant-Q 変換 (CQT) は、標準的なフーリエ変換の等間隔のビンの代わりに、音楽のピッチに一致する対数間隔のビンを使用する周波数解析です。

2分の読書最終更新日

概要

It matters because it mirrors how we perceive pitch, making it ideal for music analysis where notes double in frequency each octave.

ディープダイブ

通常の短時間フーリエ変換では、周波数ビンが線形に配置されるため、低音域が詰め込まれ、高音域の解像度が過剰になります。音楽はそのようには機能しません。各オクターブの周波数は 2 倍になり、半音は固定されたヘルツ数ではなく、固定された比率になります。 CQT は、中心周波数と帯域幅の比、つまり品質係数 Q をすべてのビンにわたって一定に保つことでこれを修正します。周波数が低いと解析ウィンドウが長くなり (周波数分解能が細かい)、周波数が高いと解析ウィンドウが短くなります (時間分解能が細かい)。その結果、1 つの行が 1 つの音高に対応し、同じコードがどのオクターブで演奏されても同一に見えるスペクトログラムが作成されます。この特性により、CQT はコード認識、転写、およびピッチ追跡のための自然なフロント エンドになります。

技術的な洞察

定数 Q は、各フィルターの帯域幅がその中心周波数に応じて変化するため、すべてのビンが同じ音楽セント数に及ぶことを意味します。通常、ビンは半音または 4 分音に揃えてオクターブあたり 12 または 24 個配置されます。ウィンドウの長さはビンごとに異なるため、効率的な実装では、各フィルターを個別に計算するのではなく、単一の FFT とスパース カーネル行列を使用します。これが、librosa のようなライブラリが CQT を高速化する方法です。

戦略的影響

アクセスと到達範囲

文字起こし、ナレーション、音声インターフェイスを通じてアクセシビリティを向上させます。

費用と予算

メディア チームは、より少ない予算で洗練されたオーディオをより迅速に出荷できます。

速度とスケール

顧客対応システムは、音声対話を大規模に処理できます。

オーディオ用の Constant-Q 変換の将来

CQT は、そのピッチ調整された構造により畳み込みネットワークが転置不変の特徴を学習できるため、深層学習音楽モデルの入力表現として使用されることが増えています。自動文字起こし、カバー曲の検出、ソース分離などのタスクにおいて、ニューラル オーディオとのより緊密な統合が期待されます。 CQT と学習されたフィルターバンクを組み合わせたハイブリッド フロントエンドが登場しており、微分可能な CQT レイヤーにより、モデルはトレーニング中にネットワークと共同で変換を最適化できるようになりました。

現実世界の実装

各 CQT ビンを音高クラスにマッピングする自動コード認識システム

ピアノ録音を楽譜または MIDI に変換する音楽転写ツール

オクターブ不変機能を活用したカバー曲と音楽の類似性検出

デジタルオーディオワークステーションのピッチシフトおよびキー検出プラグイン

リスクとガードレール

同意がない場合、音声の悪用やなりすましのリスクが高まります。

アクセント、方言、または騒がしい環境では精度が低下する可能性があります。

合成音声は、明確なラベルが付けられていないと、本物の音声と間違われる可能性があります。

実装ロードマップ

1

音声のキャプチャ、複製、再利用については明示的な同意を取得してください。

2

さまざまな話者や背景条件で品質をテストします。

3

人間がいつ出力をレビューまたは承認する必要があるかを定義します。

4

合成音声にラベルを付け、出所記録を保管して説明責任を果たします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Constant-Q Transform for Audio quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

オーディオのオンセット検出

よくある質問

What is Constant-Q Transform for Audio?

Constant-Q 変換 (CQT) は、標準的なフーリエ変換の等間隔のビンの代わりに、音楽のピッチに一致する対数間隔のビンを使用する周波数解析です。これは私たちがピッチをどのように認識するかを反映しているため重要であり、オクターブごとに音の周波数が 2 倍になる音楽分析に最適です。

Constant-Q Transform では周波数ビンの間隔はどのように設定されますか?

CQT は、標準的な FFT の線形間隔とは異なり、対数間隔のビンを使用するため、各ビンは音楽のピッチ間隔に対応します。

Constant-Q の「Q」は何を指しますか?

Q はフィルタの中心周波数とその帯域幅の比であり、CQT はこの比をすべてのビンにわたって一定に保ちます。

CQT が低周波数でより長い分析ウィンドウを使用するのはなぜですか?

低い音符は絶対ヘルツ単位で非常に近いため、ウィンドウを長くすると、それらを分離するのに必要な細かい周波数分解能が得られます。

CQT は、線形スペクトログラムと比較して、音楽に関してどのような知覚上の利点がありますか?

ビンの間隔はピッチ比に基づいているため、コードを 1 オクターブ上に移調するとパターンがシフトするだけで、オクターブ/移調の不変性が得られ、音楽タスクに役立ちます。

半音を揃えるために、オクターブあたり何個の CQT ビンが一般的に使用されますか?

オクターブあたり 12 個のビンは、各ビンを西洋半音スケールの半音に揃えます。 24 ビンでは 4 分の 1 トーンの解像度が得られます。