音訊人工智慧指南

穩定的音頻潛在擴散

Stable Audio 是 Stability AI 的文字轉音訊系統,它使用潛在擴散來產生音樂和聲音效果,並明確控制剪輯長度。

閱讀時間約2分鐘最後更新

概述

It matters because it brought diffusion-based, timing-aware, commercially licensed audio generation to creators.

深入探討

Stable Audio 由 Stability AI 於 2023 年推出,使用潛在擴散技術從文字提示生下立體聲音樂和聲音效果,這與穩定擴散等圖像模型背後的技術屬於同一系列。它不是對影像像素進行去噪,而是對由變分自動編碼器創建的音訊的壓縮潛在表示進行去噪。一個顯著的功能是定時調節:模型在訓練期間得到開始和總持續時間信號,因此用戶可以請求特定長度的剪輯,包括帶有前奏和結尾的完整長度的音樂結構。 Stable Audio 2.0 於 2024 年發布,可以 44.1 kHz 立體聲產生長達約三分鐘的連貫曲目,並支援音訊到音訊的轉換。它接受了許可音樂的培訓以支持商業用途。

技術洞察

該系統由三個部分組成:將 44.1 kHz 立體聲音訊編碼為緊湊潛在序列的 VAE、嵌入提示的文本編碼器(CLAP 式或基於 T5 的模型)以及學習反轉潛在空間中的噪音過程的擴散變換器(或 U-Net)。定時嵌入條件在所需的開始和持續時間上產生。在推理時,模型會對文字引導的隨機潛在雜訊進行去噪,然後 VAE 解碼器重建波形。

戰略影響

交通與覆蓋範圍

它透過轉錄、旁白和語音介面提高了可訪問性。

成本與預算

媒體團隊可以用更少的預算更快地交付精美的音訊。

速度與規模

面向客戶的系統可以處理更大規模的語音互動。

穩定音頻潛在擴散的未來

音頻的潛在擴散正在朝著更長、更結構化的作品、更精細的干級和樂器控制以及透過蒸餾更快的採樣的方向發展。預計將更緊密地整合到音樂製作軟體、即時生成以及圍繞培訓數據授權和藝術家同意的道德工具中。隨著時間和調節的改進,創作者將更精確地指導編排、節奏和過渡,音訊到音訊編輯將允許使用者在保留節奏或風格的同時轉換現有錄音。

現實世界的實施

為影片和廣告產生精確長度的免版稅背景音樂

根據文字描述創建可循環播放的遊戲和應用程式配樂

為播客和預告片製作客製化音效和聲音

透過音訊到音訊提示將現有音訊剪輯轉換為新風格

風險與防護欄

如果未徵得同意,語音濫用和冒充風險就會增加。

由於口音、方言或嘈雜的環境,準確性可能會下降。

如果沒有明確的標籤,合成音訊可能會被誤認為是真實的語音。

實施路線圖

1

獲得語音捕獲、克隆和重用的明確同意。

2

測試不同揚聲器和背景條件下的品質。

3

定義人員必須審查或批准輸出的時間。

4

標記合成音訊並保留來源記錄以供問責。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stable Audio Latent Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

音頻擴散模型

常見問題

What is Stable Audio Latent Diffusion?

Stable Audio 是 Stability AI 的文字轉音訊系統,它使用潛在擴散來產生音樂和聲音效果,並明確控制剪輯長度。這很重要,因為它為創作者帶來了基於擴散的、定時感知的、商業許可的音訊生成。

Stable Audio 使用什麼核心技術來產生音訊?

穩定音訊應用潛在擴散,對音訊的壓縮潛在表示而不是原始像素或樣本進行降噪。

Stable Audio 提供了許多早期型號所缺乏的獨特控制功能?

定時調節允許用戶請求特定長度的音頻,從而實現具有適當前奏和後奏的完整曲目。

什麼組件將原始音訊壓縮為潛在表示?

VAE 將 44.1 kHz 立體聲音訊編碼為緊湊的潛在序列,然後將其解碼回波形。

2024 年穩定音訊 2.0 增加了哪些新功能?

Stable Audio 2.0 將完整曲目的長度延長至大約三分鐘,並引入了音訊到音訊的轉換。

那麼Stable Audio是如何開始產生過程的呢?

擴散從潛在空間中的隨機雜訊開始,並根據文字調節對其進行迭代降噪。