PANDUAN Audio AI

Difusi Spektogram Rifusi

Riffusion adalah peretasan cerdas yang menghasilkan musik dengan memperlakukan suara sebagai gambar: Riffusion menyempurnakan model gambar Difusi Stabil untuk melukiskan spektogram, lalu mengubah gambar tersebut kembali menjadi audio.

2 min readTerakhir diperbarui

Ikhtisar

It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.

Menyelam Lebih Dalam

Riffusion, dirilis pada akhir tahun 2022 oleh Seth Forsgren dan Hayk Martiros, dimulai sebagai proyek hobi. Trik intinya: spektogram adalah gambar 2D dengan sumbu horizontal adalah waktu, sumbu vertikal adalah frekuensi, dan kecerahan piksel adalah kenyaringan. Karena Difusi Stabil sudah menghasilkan gambar dari perintah teks, pembuatnya menyempurnakannya pada ribuan contoh teks spektogram berpasangan. Perintahkan dengan 'bass jazz funky' dan ia akan menghilangkan suara acak ke dalam spektogram suara tersebut. Untuk membuat audio dapat diputar, Riffusion menjalankan spektogram melalui algoritma Griffin-Lim yang merekonstruksi informasi fase yang hilang. Karena difusi dapat melakukan interpolasi dengan lancar di antara perintah, Riffusion juga dapat mengubah satu gaya ke gaya lainnya melalui klip yang berkesinambungan, berputar dengan mulus.

Wawasan Teknis

Riffusion menggunakan kembali jalur difusi laten tanpa perubahan: U-Net secara berulang menghilangkan noise Gaussian dari gambar laten yang dikondisikan pada penyematan teks CLIP. Satu-satunya pekerjaan khusus domain adalah representasi spektogram (skala mel, daya log) dan rekonstruksi fase Griffin-Lim yang mengubah spektogram magnitudo yang diprediksi kembali menjadi bentuk gelombang. Fase dibuang selama pengkodean, sehingga estimasi berulang Griffin-Lim adalah sumber utama dari karakteristik artefak 'berair'.

Dampak Strategis

Access and reach

Ini meningkatkan aksesibilitas melalui transkripsi, narasi, dan antarmuka suara.

Cost and budget

Tim media dapat mengirimkan audio yang bagus lebih cepat dengan anggaran lebih kecil.

Kecepatan dan skala

Sistem yang berhubungan dengan pelanggan dapat memproses interaksi lisan dalam skala yang lebih besar.

Masa Depan Difusi Spektogram Rifusi

Riffusion membuktikan bahwa jembatan spektogram-sebagai-gambar berfungsi, dan gagasan itu sekarang diterapkan di dalam sistem audio yang lebih besar dan menjadi perusahaan Riffusion. Harapkan alat di masa depan untuk menggantikan Griffin-Lim yang lossy dengan vocoder saraf yang dipelajari untuk fase yang lebih bersih, dan untuk menggabungkan difusi spektogram dengan codec audio laten. Pembelajaran yang lebih luas, yaitu bahwa model gambar dapat dialihkan ke modalitas baru, terus memengaruhi cara para peneliti melakukan bootstrap pada generator audio dan video dari tulang punggung yang telah dilatih sebelumnya.

Implementasi Dunia Nyata

Menghasilkan trek latar belakang perulangan pendek untuk video game indie dari perintah teks seperti 'pengejaran synthwave yang menegangkan'

Berubah dengan lancar antara dua gaya musik, mis. memadukan 'rumah tropis' menjadi 'lo-fi hip hop' dalam satu klip

Memproduksi musik ambient bebas royalti untuk video dan podcast YouTube tanpa biaya lisensi

Membuat prototipe ide melodi atau ritme yang kemudian direkam ulang oleh musisi dengan benar di stasiun kerja audio digital

Risiko & Pagar Pembatas

Risiko penyalahgunaan suara dan peniruan identitas meningkat jika tidak ada persetujuan.

Akurasi dapat menurun pada aksen, dialek, atau lingkungan yang bising.

Audio sintetis dapat disalahartikan sebagai ucapan asli tanpa label yang jelas.

Peta Jalan Implementasi

1

Dapatkan persetujuan eksplisit untuk pengambilan suara, kloning, dan penggunaan kembali.

2

Uji kualitas di beragam speaker dan kondisi latar belakang.

3

Tentukan kapan manusia harus meninjau atau menyetujui keluaran.

4

Beri label pada audio sintetis dan simpan catatan asalnya untuk akuntabilitas.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Riffusion Spectrogram Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Vocoder Difusi DiffWave

Pertanyaan yang sering diajukan

What is Riffusion Spectrogram Diffusion?

Riffusion adalah peretasan cerdas yang menghasilkan musik dengan memperlakukan suara sebagai gambar: Riffusion menyempurnakan model gambar Difusi Stabil untuk melukiskan spektogram, lalu mengubah gambar tersebut kembali menjadi audio. Hal ini penting karena menunjukkan bahwa alat yang dibuat untuk satu media (gambar) dapat menghasilkan media lain (musik) dengan hampir tidak ada arsitektur baru.

Model AI apa yang disempurnakan Riffusion untuk menghasilkan musik?

Riffusion menyempurnakan Difusi Stabil, model difusi gambar, untuk menghasilkan gambar spektogram yang kemudian dikonversi menjadi audio.

Apa yang diwakili oleh spektogram pada kedua sumbunya?

Dalam spektogram, sumbu horizontal adalah waktu, sumbu vertikal adalah frekuensi, dan kecerahan melambangkan kenyaringan.

Mengapa Riffusion membutuhkan algoritma seperti Griffin-Lim?

Spektogram menyimpan besaran tetapi membuang fase, sehingga Griffin-Lim memperkirakan fase secara berulang untuk membangun kembali bentuk gelombang yang dapat dimainkan.

Kemampuan apa yang diberikan difusi pada Riffusion saat menggabungkan dua perintah?

Model difusi dapat melakukan interpolasi dalam ruang laten, membiarkan Riffusion terus berubah dari satu gaya musik ke gaya musik lainnya.

Bagaimana Riffusion awalnya dibuat dan dirilis?

Riffusion dimulai sebagai proyek hobi oleh Seth Forsgren dan Hayk Martiros, dirilis ke publik pada akhir tahun 2022.