Perpustakaan AI gratis

Audio AI panduanGratis selamanya.

117 panduan berbahasa Inggris sederhana, jalur pembelajaran terstruktur, dan perpustakaan terbuka — dibuat oleh lembaga nonprofit 501(c)(3) independen sehingga siapa pun dapat memahami AI modern.

117Panduan gratis
1Trek topik
~2 minSesuai panduan
~4hReading time

Mulai di sini

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Trek topik

Jelajahi berdasarkan trek

Lompatlah ke area yang Anda minati. Setiap trek memiliki beberapa panduan berbahasa Inggris.

Perpustakaan lengkap

Semua panduan

117 dari 1019 panduan yang ditampilkan. Filter berdasarkan trek atau cari di atas.

Audio AI

Kodek Audio Streaming Mimi

Mimi adalah codec audio saraf yang memampatkan ucapan menjadi aliran kecil token terpisah secara real-time, sehingga model AI dapat mendengarkan dan berbicara dengan kecepatan sangat rendah…

2 min bacaBaca
Audio AI

Dengarkan Hadiri dan Eja

Listen, Attend and Spell (LAS) adalah jaringan saraf penting tahun 2015 yang mentranskripsikan ucapan langsung menjadi karakter, tanpa pengucapan buatan tangan…

2 min bacaBaca
Audio AI

SpecAugment untuk Pengenalan Ucapan

SpecAugment adalah metode augmentasi data yang sederhana namun kuat yang menutupi dan membengkokkan spektogram ucapan untuk membuat model pengenalan lebih kuat.

2 min bacaBaca
Audio AI

Pemberian Tag Otomatis Musik

Pemberian tag otomatis musik menggunakan pembelajaran mesin untuk mendengarkan lagu dan secara otomatis melampirkan label deskriptif seperti genre, suasana hati, instrumen, dan tempo.

2 min bacaBaca
Audio AI

Transfer Timbre Musik

Transfer timbre membentuk kembali 'warna nada' audio sehingga satu instrumen terdengar seperti instrumen lainnya, mengubah melodi yang disenandungkan menjadi biola atau baris terompet…

2 min bacaBaca
Audio AI

Klasifikasi Pemandangan Akustik

Klasifikasi adegan akustik (ASC) melatih mesin untuk mengenali lingkungan tempat rekaman dibuat, jalan yang sibuk, taman yang sepi, kereta api, kafe…

2 min bacaBaca
Audio AI

NVIDIA Riva dan NeMo Pidato

NVIDIA Riva adalah SDK dengan akselerasi GPU untuk produksi AI ucapan (ASR, TTS, dan terjemahan), sedangkan NeMo adalah perangkat sumber terbuka untuk pelatihan dan penyempurnaan…

2 min bacaBaca
Audio AI

Arsitektur DeepSpeech

DeepSpeech adalah model pengenalan ucapan ujung ke ujung yang diperkenalkan oleh Baidu pada tahun 2014 yang memetakan fitur audio mentah langsung ke teks menggunakan jaringan saraf berulang…

2 min bacaBaca
Audio AI

Penyematan Speaker X-Vector

Vektor X adalah sidik jari numerik dengan panjang tetap dari suara pembicara yang dihasilkan oleh jaringan saraf, digunakan untuk mengetahui siapa yang berbicara, apa pun yang mereka katakan.

2 min bacaBaca
Audio AI

Penyelarasan Monotonik Glow-TTS

Glow-TTS adalah model text-to-speech yang belajar menyelaraskan teks ke ucapan menggunakan trik pencarian cerdas, sehingga menghilangkan kebutuhan akan perata terpisah.

2 min bacaBaca
Audio AI

Vocoder WaveGAN Paralel

Parallel WaveGAN adalah vocoder saraf cepat yang mengubah spektogram mel menjadi bentuk gelombang audio mentah menggunakan GAN kecil, menghasilkan semua sampel sekaligus.

2 min bacaBaca
Audio AI

Vocoder Berbasis Aliran WaveGlow

WaveGlow adalah vocoder saraf berbasis aliran dari NVIDIA yang mensintesis bentuk gelombang ucapan dari mel-spektogram dalam satu lintasan tanpa autoregresi.

2 min bacaBaca

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.