Bezpłatna biblioteka AI

Dźwiękowa sztuczna inteligencja przewodnikiZa darmo na zawsze.

117 przewodniki w prostym języku angielskim, ustrukturyzowane ścieżki edukacyjne i otwarta biblioteka — stworzone przez niezależną organizację non-profit 501(c)(3), aby każdy mógł zrozumieć współczesną sztuczną inteligencję.

117Bezpłatne przewodniki
1Ścieżki tematyczne
~2 minWedług przewodnika
~4hCzas czytania

Zacznij tutaj

Pięć Kursy oparte na wynikach

Każdy kurs zawiera wyraźne wyniki, zmapowane kompetencje, ćwiczenia oraz praktyczny projekt końcowy.

Ścieżki tematyczne

Przeglądaj według utworu

Wskocz w obszar, na którym Ci zależy. Do każdego utworu dołączono wiele przewodników w języku angielskim.

Pełna biblioteka

Wszystkie przewodniki

117 z 1019 pokazane przewodniki. Filtruj według utworu lub wyszukaj powyżej.

Dźwiękowa sztuczna inteligencja

Synteza głosu śpiewu

Singing Voice Synthesis (SVS) to sztuczna inteligencja, która zamienia napisaną melodię i tekst w w pełni zaśpiewany występ wokalny.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

AudioLM

AudioLM to platforma badawcza Google, która generuje realistyczny dźwięk — mowę lub muzykę fortepianową — traktując dźwięk jak język i przewidując go jako symbol…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

MusicGen

MusicGen to model sztucznej inteligencji Meta, który generuje muzykę na podstawie opisu tekstowego i opcjonalnie melodii, którą nucisz lub przesyłasz.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wyszukiwanie słów kluczowych i słowa budzące

Wykrywanie słów kluczowych to technologia, która zawsze nasłuchuje, dzięki której urządzenie może poczekać na pojedynczą frazę wyzwalającą, taką jak „Hej Siri” lub „Alexa”, zanim uruchomi się…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wymuszone wyrównanie

Wymuszone wyrównanie automatycznie łączy znaną transkrypcję z jej dźwiękiem, zaznaczając dokładnie, kiedy zaczyna się i kończy każde słowo lub dźwięk.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Spektrogramy Mela

Spektrogram melowy to obraz dźwięku w czasie, z częstotliwością rozłożoną w sposób, w jaki ludzkie uszy odbierają wysokość.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Koneksjonistyczna klasyfikacja czasowa

Connectionist Temporal Classification (CTC) to funkcja straty i metoda dekodowania, która pozwala sieciom neuronowym zamieniać długą sekwencję audio na tekst bez…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Modele przetworników RNN

RNN-Transducer (RNN-T) to architektura rozpoznawania mowy przyjazna dla przesyłania strumieniowego, która naprawia największą słabość CTC — niezdolność do modelowania zależności…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Architektura konformistyczna

Conformer to blok sieci neuronowej, który łączy splot z samouwagą, przechwytując zarówno drobnoziarniste lokalne wzorce dźwiękowe, jak i kontekst dalekiego zasięgu…

2 min. przeczytajPrzeczytaj

Skończyłeś czytać? Udowodnij to.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.