Bezpłatna biblioteka AI

Dźwiękowa sztuczna inteligencja przewodnikiZa darmo na zawsze.

117 przewodniki w prostym języku angielskim, ustrukturyzowane ścieżki edukacyjne i otwarta biblioteka — stworzone przez niezależną organizację non-profit 501(c)(3), aby każdy mógł zrozumieć współczesną sztuczną inteligencję.

117Bezpłatne przewodniki
1Ścieżki tematyczne
~2 minWedług przewodnika
~4hCzas czytania

Zacznij tutaj

Pięć Kursy oparte na wynikach

Każdy kurs zawiera wyraźne wyniki, zmapowane kompetencje, ćwiczenia oraz praktyczny projekt końcowy.

Ścieżki tematyczne

Przeglądaj według utworu

Wskocz w obszar, na którym Ci zależy. Do każdego utworu dołączono wiele przewodników w języku angielskim.

Pełna biblioteka

Wszystkie przewodniki

117 z 1019 pokazane przewodniki. Filtruj według utworu lub wyszukaj powyżej.

Dźwiękowa sztuczna inteligencja

Suno i Udio

Suno i Udio to dwa wiodące konsumenckie generatory muzyki AI, które zamieniają krótki tekst w pełny utwór o jakości zbliżonej do studyjnej – wraz z wokalem…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Symboliczne pokolenie muzyki

Symboliczne generowanie muzyki tworzy muzykę w postaci uporządkowanego zapisu — nut, wysokości, czasu trwania i czasu (często w formacie MIDI) — a nie jako surowy dźwięk.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Współczynniki cepstralne częstotliwości Mel

Współczynniki cepstralne częstotliwości Mel (MFCC) to zwarty zestaw liczb, które podsumowują kształt widma częstotliwości dźwięku w sposób, w jaki ludzkie uszy odbierają…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Sieć WaveNet

WaveNet, wprowadzony przez DeepMind w 2016 roku, był przełomową siecią neuronową, która generuje surowy dźwięk, jedna próbka na raz, tworząc uderzająco naturalną mowę…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Takotron 2

Tacotron 2 to kompleksowy system zamiany tekstu na mowę firmy Google (2017), który zamienia tekst pisany bezpośrednio w spektrogram melowy, który neuronowy wokoder przekształca...

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wykrywanie fałszywych dźwięków

Wykrywanie fałszywych dźwięków to zestaw technik stosowanych do sprawdzenia, czy nagranie głosowe zostało wypowiedziane przez prawdziwego człowieka, czy też zsyntetyzowane/sklonowane przez sztuczną inteligencję.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Modelowanie prozodyczne

Modelowanie prozodyczne uczy maszyny melodii mowy, rytmu, wysokości, akcentu i tempa, które wpływają na słowa.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Synteza mowy emocjonalnej

Synteza mowy emocjonalnej generuje głosy, które brzmią radośnie, smutno, gniewnie lub spokojnie, a nie tylko są zrozumiałe, ale także wiarygodnie odczuwalne.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Konwersja głosu

Konwersja głosu przekształca nagraną mowę jednej osoby tak, aby brzmiała tak, jakby została wypowiedziana przez kogoś innego, zachowując jednocześnie oryginalne słowa i czas.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Diaryzacja mówcy

Diaryzacja mówcy odpowiada na pytanie „kto mówił, kiedy?” poprzez podzielenie nagrania audio na segmenty oznaczone tożsamością mówiącego.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Weryfikacja mówcy

Weryfikacja mówiącego potwierdza, czy głos pasuje do określonej tożsamości, działając jako hasło głosowe.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wykrywanie aktywności głosowej

Funkcja wykrywania aktywności głosowej (VAD) moment po chwili decyduje, czy sygnał audio zawiera ludzką mowę, czy tylko ciszę i hałas.

2 min. przeczytajPrzeczytaj

Skończyłeś czytać? Udowodnij to.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.