Bezpłatna biblioteka AI

Dźwiękowa sztuczna inteligencja przewodnikiZa darmo na zawsze.

117 przewodniki w prostym języku angielskim, ustrukturyzowane ścieżki edukacyjne i otwarta biblioteka — stworzone przez niezależną organizację non-profit 501(c)(3), aby każdy mógł zrozumieć współczesną sztuczną inteligencję.

117Bezpłatne przewodniki
1Ścieżki tematyczne
~2 minWedług przewodnika
~4hCzas czytania

Zacznij tutaj

Pięć Kursy oparte na wynikach

Każdy kurs zawiera wyraźne wyniki, zmapowane kompetencje, ćwiczenia oraz praktyczny projekt końcowy.

Ścieżki tematyczne

Przeglądaj według utworu

Wskocz w obszar, na którym Ci zależy. Do każdego utworu dołączono wiele przewodników w języku angielskim.

Pełna biblioteka

Wszystkie przewodniki

117 z 1019 pokazane przewodniki. Filtruj według utworu lub wyszukaj powyżej.

Dźwiękowa sztuczna inteligencja

Kodek audio Mimi do przesyłania strumieniowego

Mimi to neuronowy kodek audio, który kompresuje mowę w niewielki strumień dyskretnych tokenów w czasie rzeczywistym, dzięki czemu modele AI mogą słuchać i mówić przy bardzo niskim…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Słuchaj Weź udział i przeliteruj

Listen, Attend and Spell (LAS) to przełomowa sieć neuronowa z 2015 roku, która transkrybuje mowę bezpośrednio na znaki, bez ręcznie tworzonej wymowy…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

SpecAugment do rozpoznawania mowy

SpecAugment to prosta, ale wydajna metoda powiększania danych, która maskuje i zniekształca spektrogram mowy, aby zwiększyć niezawodność modeli rozpoznawania.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Automatyczne tagowanie muzyki

Automatyczne tagowanie muzyki wykorzystuje uczenie maszynowe do słuchania utworu i automatycznego dołączania opisowych etykiet, takich jak gatunek, nastrój, instrumenty i tempo.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Transfer barwy muzycznej

Transfer barwy zmienia „kolor tonu” dźwięku, dzięki czemu jeden instrument brzmi jak inny, zamieniając nuconą melodię w linię skrzypiec lub trąbki…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Klasyfikacja scen akustycznych

Klasyfikacja scen akustycznych (ASC) uczy maszyny rozpoznawania środowiska, w którym dokonano nagrania: ruchliwej ulicy, cichego parku, pociągu, kawiarni…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Przemówienie NVIDIA Riva i NeMo

NVIDIA Riva to akcelerowany przez GPU pakiet SDK do produkcyjnej sztucznej inteligencji mowy (ASR, TTS i tłumaczenie), natomiast NeMo to zestaw narzędzi typu open source do szkolenia i dostrajania…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Architektura DeepSpeech

DeepSpeech to kompleksowy model rozpoznawania mowy wprowadzony przez Baidu w 2014 roku, który mapuje surowe funkcje audio bezpośrednio na tekst za pomocą powtarzającego się sygnału neuronowego…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wbudowane głośniki X-Vector

Wektory X to numeryczne odciski palców o stałej długości głosu mówiącego, generowane przez sieć neuronową i używane do rozpoznawania, kto mówi, niezależnie od tego, co mówi.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Monotoniczne wyrównanie Glow-TTS

Glow-TTS to model zamiany tekstu na mowę, który samodzielnie uczy się dopasowywania tekstu do mowy za pomocą sprytnej sztuczki wyszukiwania, eliminując potrzebę stosowania osobnego modułu wyrównującego.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Równoległy wokoder WaveGAN

Parallel WaveGAN to szybki wokoder neuronowy, który zamienia spektrogram melowy w surową falę audio za pomocą małego GAN, generując wszystkie próbki na raz.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wokoder oparty na przepływie WaveGlow

WaveGlow to wokoder neuronowy firmy NVIDIA oparty na przepływie, który syntetyzuje przebiegi mowy ze spektrogramów mel w jednym przebiegu, bez autoregresji.

2 min. przeczytajPrzeczytaj

Skończyłeś czytać? Udowodnij to.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 4 of 10 | AI Understanding