音訊人工智慧指南

音訊LM

AudioLM 是一個 Google 研究框架,它透過將聲音視為語言並逐一預測來產生逼真的音訊(語音或鋼琴音樂)。

閱讀時間約2分鐘最後更新

概述

It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.

深入探討

AudioLM 由 Google 於 2022 年推出,將音訊生成重新定義為語言建模問題:它將原始波形轉換為離散標記,然後預測下一個標記,就像文字模型預測下一個單字一樣。它的關鍵技巧是令牌類型的層次結構。 「語義」標記(來自 w2v-BERT 等模型)捕捉長期結構——語音、語法、旋律——而「聲學」標記(來自 SoundStream 神經編解碼器)捕捉精細細節,如說話者身份、音色和錄音條件。透過先預測語意標記,然後對其進行調節聲學標記,AudioLM 會產生在數秒內保持連貫的延續,同時保留原始語音或樂器。說話幾秒鐘後,它會繼續用相同的聲音說話;給定鋼琴,它以相同的風格即興演奏。

技術洞察

AudioLM 純粹是基於音訊進行訓練——沒有文字記錄。 SoundStream 透過殘差向量量化將音訊壓縮為聲學標記,而 w2v-BERT 提供粗略的語義標記。一堆 Transformer 語言模型分階段預測標記:首先是結構的語義,然後是用於高保真重建的粗略和精細的聲學標記。 SoundStream 的解碼器最終將預測的標記轉回波形,產生使說話者的聲音和韻律保持一致的音訊。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

AudioLM 的未來

AudioLM 基於令牌的配方成為後來系統的基礎:Google 的 AudioLM 想法被輸入到 MusicLM 中以實現文本到音樂和 SoundStorm 中以實現更快的生成,而更廣泛的領域現在將語義和聲學標記融合到語音、音樂和令牌中。期望更快的即時產生、更長的相干輸出以及文字或其他訊號引導純音訊訓練模型的多模態控制。同樣的技術也加劇了人們對語音克隆和音訊深度偽造的擔憂。

現實世界的實施

以同一說話者的聲音和語調繼續一段簡短的語音片段,無需抄本

即興創作與簡短錄製提示風格相符的新鋼琴音樂

充當 MusicLM 等文字轉音樂系統的音訊生成骨幹

研究保留樣本中的韻律和記錄聲學的語音合成

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

關鍵字辨識和喚醒詞

常見問題

What is AudioLM?

AudioLM 是一個 Google 研究框架,它透過將聲音視為語言並逐一預測來產生逼真的音訊(語音或鋼琴音樂)。這很重要,因為它表明您可以在沒有任何文字記錄或樂譜的情況下產生連貫、聽起來自然的音訊延續。

AudioLM 使用什麼核心思想來產生音訊?

AudioLM 將波形轉換為離散標記並按順序預測它們,將語言模型的下一個標記方法應用於原始聲音。

AudioLM 中「語意」標記的作用是什麼?

語義標記(來自 w2v-BERT)對高級結構和連貫性進行編碼,而聲學標記則處理精細的音訊細節。

哪個神經編解碼器產生 AudioLM 的聲學標記?

SoundStream 使用殘差向量量化將音訊壓縮為聲學標記,然後將預測標記解碼回波形。

AudioLM 需要什麼作為訓練資料?

一個顯著的特點是 AudioLM 純粹基於音訊進行訓練,沒有任何文字標籤,直接從聲音中學習結構。

為什麼 AudioLM 在聲學標記之前預測語義標記?

首先產生粗略結構,使輸出隨時間保持一致;然後,聲學令牌會根據該結構進行調整,以添加高保真細節。