Perpustakaan AI gratis

Audio AI panduanGratis selamanya.

117 panduan berbahasa Inggris sederhana, jalur pembelajaran terstruktur, dan perpustakaan terbuka — dibuat oleh lembaga nonprofit 501(c)(3) independen sehingga siapa pun dapat memahami AI modern.

117Panduan gratis
1Trek topik
~2 minSesuai panduan
~4hReading time

Mulai di sini

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Trek topik

Jelajahi berdasarkan trek

Lompatlah ke area yang Anda minati. Setiap trek memiliki beberapa panduan berbahasa Inggris.

Perpustakaan lengkap

Semua panduan

117 dari 1019 panduan yang ditampilkan. Filter berdasarkan trek atau cari di atas.

Audio AI

Vocoder Difusi DiffWave

DiffWave adalah vocoder berbasis difusi yang mensintesis audio dengan menolak kebisingan acak secara berulang menjadi bentuk gelombang, dikondisikan pada mel-spektogram.

2 min bacaBaca
Audio AI

Model Audio Generatif Kulit Kayu

Bark adalah model teks-ke-audio sumber terbuka dari Suno yang menghasilkan tidak hanya ucapan tetapi juga tawa, desahan, musik, dan efek suara langsung dari perintah teks.

2 min bacaBaca
Audio AI

Sintesis Autoregresif TTS Kura-kura

Tortoise TTS adalah sistem text-to-speech sumber terbuka yang dihargai karena suaranya yang sangat alami, kaya emosi, dan kloning suara yang kuat hanya dari beberapa…

2 min bacaBaca
Audio AI

Kloning Suara Lintas Bahasa XTTS

XTTS adalah model text-to-speech multibahasa Coqui yang dapat mengkloning suara dari klip pendek dan kemudian berbicara dalam berbagai bahasa sambil mempertahankan…

2 min bacaBaca
Audio AI

Generasi Audio Paralel SoundStorm

SoundStorm adalah model pembuatan audio Google yang menghasilkan ucapan dan suara secara paralel, bukan hanya satu token dalam satu waktu, sehingga menghasilkan sintesis audio berkualitas tinggi…

2 min bacaBaca
Audio AI

Sintesis Teks-ke-Audio AudioGen

AudioGen adalah model Meta yang mengubah deskripsi teks menjadi suara lingkungan dan efek suara yang realistis, seperti 'anjing menggonggong sementara burung berkicau.

2 min bacaBaca
Audio AI

Difusi Laten Audio Stabil

Stable Audio adalah sistem teks-ke-audio Stability AI yang menggunakan difusi laten untuk menghasilkan musik dan efek suara, dengan kontrol eksplisit terhadap panjang klip.

2 min bacaBaca
Audio AI

Perangkat Pengenalan Ucapan Kaldi

Kaldi adalah perangkat sumber terbuka gratis yang menjadi platform penelitian dominan untuk membangun sistem pengenalan suara.

2 min bacaBaca
Audio AI

ASR Konvolusional Wav2Letter

Wav2Letter adalah sistem pengenalan ucapan ujung ke ujung dari Facebook AI yang hanya menggunakan jaringan saraf konvolusional, tidak ada pengulangan.

2 min bacaBaca
Audio AI

Jasper dan QuartzNet ASR

Jasper dan QuartzNet adalah model pengenalan suara konvolusional end-to-end dari NVIDIA, dengan QuartzNet menjadi model desain ulang yang jauh lebih kecil dan efisien…

2 min bacaBaca
Audio AI

Model Difusi untuk Audio

Model difusi menghasilkan audio dengan belajar membalikkan proses kebisingan selangkah demi selangkah, mengubah kebisingan acak menjadi ucapan, musik, atau efek suara yang koheren.

2 min bacaBaca
Audio AI

Deteksi Peristiwa Suara

Deteksi peristiwa suara (SED) mengidentifikasi suara apa yang muncul dalam aliran audio dan kapan tepatnya suara tersebut mulai dan berhenti.

2 min bacaBaca

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.