Perpustakaan AI gratis

Audio AI panduanGratis selamanya.

117 panduan berbahasa Inggris sederhana, jalur pembelajaran terstruktur, dan perpustakaan terbuka — dibuat oleh lembaga nonprofit 501(c)(3) independen sehingga siapa pun dapat memahami AI modern.

117Panduan gratis
1Trek topik
~2 minSesuai panduan
~4hReading time

Mulai di sini

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Trek topik

Jelajahi berdasarkan trek

Lompatlah ke area yang Anda minati. Setiap trek memiliki beberapa panduan berbahasa Inggris.

Perpustakaan lengkap

Semua panduan

117 dari 1019 panduan yang ditampilkan. Filter berdasarkan trek atau cari di atas.

Audio AI

Identifikasi Lagu Sampul

Identifikasi lagu cover mendeteksi ketika dua rekaman yang terdengar sangat berbeda sebenarnya merupakan lagu dasar yang sama — versi akustik live, remix…

2 min bacaBaca
Audio AI

Sintesis Audio yang Dapat Dibedakan DDSP

DDSP (Pemrosesan Sinyal Digital yang Dapat Dibedakan) menggabungkan blok penyusun synthesizer klasik dengan jaringan saraf, sehingga pembelajaran mendalam dapat mengontrol osilator…

2 min bacaBaca
Audio AI

Sintesis Pidato Ujung-ke-Ujung VITS

VITS adalah model text-to-speech yang mengubah teks langsung menjadi bentuk gelombang audio mentah dalam satu sistem terlatih, melewati alur dua tahap yang biasa.

2 min bacaBaca
Audio AI

FastSpeech dan TTS Non-Autoregresif

FastSpeech menghasilkan seluruh spektogram ucapan secara paralel, bukan satu frame dalam satu waktu, membuat sintesis jauh lebih cepat dan stabil.

2 min bacaBaca
Audio AI

TTS NaturalSpeech dan Difusi Laten

NaturalSpeech adalah rangkaian penelitian Microsoft TTS yang bertujuan untuk mendapatkan kualitas ucapan tingkat manusia, dengan versi yang lebih baru menggunakan difusi laten untuk menghasilkan…

2 min bacaBaca
Audio AI

Pengenalan Emosi Ucapan

Speech Emotion Recognition (SER) adalah AI yang mendeteksi keadaan emosi pembicara — kemarahan, kegembiraan, kesedihan, frustrasi — dari suaranya, bukan hanya…

2 min bacaBaca
Audio AI

Pidato Dupleks Penuh Moshi

Moshi adalah AI suara real-time bersumber terbuka dari Kyutai yang berbicara dan mendengarkan secara bersamaan — full-duplex — alih-alih bergantian.

2 min bacaBaca
Audio AI

Terjemahan Ucapan-ke-Ucapan

Terjemahan Pidato-ke-Ucapan (S2ST) mengambil kata-kata yang diucapkan dalam satu bahasa dan menghasilkan kata-kata yang diucapkan dalam bahasa lain — idealnya menjaga suara, nada…

2 min bacaBaca
Audio AI

HiFi-GAN dan Vocoder GAN

HiFi-GAN adalah vocoder permusuhan generatif yang mengubah spektogram mel menjadi bentuk gelombang audio mentah hampir seketika, menghasilkan ucapan berkualitas studio jauh…

2 min bacaBaca
Audio AI

Konversi Grafem-ke-Fonem

Konversi Grafem-ke-fonem (G2P) menerjemahkan huruf-huruf tertulis menjadi bunyi yang seharusnya diucapkan oleh sistem ucapan.

2 min bacaBaca
Audio AI

Normalisasi Teks untuk Ucapan

Normalisasi teks adalah langkah front-end yang menulis ulang teks tertulis mentah menjadi kata-kata yang diucapkan sepenuhnya sebelum sistem ucapan mengucapkannya.

2 min bacaBaca
Audio AI

Kodek Neural SoundStream

SoundStream adalah codec audio saraf ujung ke ujung Google yang memampatkan ucapan dan musik ke bitrate yang sangat rendah dengan tetap menjaga kualitas.

2 min bacaBaca

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.

Audio AI AI Guides — Page 2 of 10 | AI Understanding