Bezpłatna biblioteka AI

Dźwiękowa sztuczna inteligencja przewodnikiZa darmo na zawsze.

117 przewodniki w prostym języku angielskim, ustrukturyzowane ścieżki edukacyjne i otwarta biblioteka — stworzone przez niezależną organizację non-profit 501(c)(3), aby każdy mógł zrozumieć współczesną sztuczną inteligencję.

117Bezpłatne przewodniki
1Ścieżki tematyczne
~2 minWedług przewodnika
~4hCzas czytania

Zacznij tutaj

Pięć Kursy oparte na wynikach

Każdy kurs zawiera wyraźne wyniki, zmapowane kompetencje, ćwiczenia oraz praktyczny projekt końcowy.

Ścieżki tematyczne

Przeglądaj według utworu

Wskocz w obszar, na którym Ci zależy. Do każdego utworu dołączono wiele przewodników w języku angielskim.

Pełna biblioteka

Wszystkie przewodniki

117 z 1019 pokazane przewodniki. Filtruj według utworu lub wyszukaj powyżej.

Dźwiękowa sztuczna inteligencja

Kompresja dźwięku EnCodec

EnCodec to neuronowy kodek audio o wysokiej jakości firmy Meta, który kompresuje mowę i muzykę przy bardzo niskiej przepływności, a jakość może konkurować ze znacznie cięższymi formatami.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Kwantyzacja wektorów resztkowych

Kwantyzacja wektorów resztkowych (RVQ) to technika, która przekształca ciągłe osadzanie dźwięku w kompaktowy stos dyskretnych kodów poprzez wielokrotną kwantyzację…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Rozpoznawanie mówcy ECAPA-TDNN

ECAPA-TDNN to architektura sieci neuronowej, która przekształca dowolny klip mowy w kompaktowy osadzony „odcisk głosu”, umożliwiając maszynom określenie, kto mówi.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Funkcja zapobiegania fałszowaniu głośników i ASVspoof

Ochrona przed fałszowaniem to warstwa obronna, która wykrywa fałszywe lub odtwarzane głosy próbujące oszukać systemy uwierzytelniania głosowego.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Odszumianie mowy za pomocą RNNoise

RNNoise to niewielka, szybka sieć neuronowa, która w czasie rzeczywistym usuwa szum tła z mowy.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Osadzanie dźwięku i nauka reprezentacji

Osadzanie dźwięku przekształca dźwięk w zwarte wektory liczbowe, które oddają znaczenie, dzięki czemu maszyny mogą porównywać, wyszukiwać i klasyfikować dźwięk w sposób, w jaki rozpoznają go ludzie…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Eliminacja echa akustycznego

Eliminacja echa akustycznego (AEC) to technologia, która zapobiega odbijaniu się własnego głosu podczas połączenia.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Separacja mowy i problem przyjęcia koktajlowego

Separacja mowy polega na oddzieleniu poszczególnych głosów od nagrania, w którym mówi kilka osób jednocześnie.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Trening niezmienniczy permutacji

Trening niezmienniczy permutacji (PIT) to sprytna sztuczka szkoleniowa, która pozwala modelowi oddzielić wiele głosów bez dbania o to, w którym gnieździe wyjściowym wyląduje każdy głos…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wyszukiwanie informacji muzycznych

Wyszukiwanie informacji muzycznych (MIR) to dziedzina, która uczy komputery analizowania, rozumienia i wyszukiwania muzyki na podstawie sygnałów audio i zapisów nutowych.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Separacja źródeł muzyki Demucs i HT-Demucs

Dowiedz się, jak Demucs i HT-Demucs dzielą muzykę na wokale i struny instrumentów, korzystając z kształtu fali, spektrogramu i modelowania transformatora.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Rozpoznawanie akordów audio

Rozpoznawanie akordów audio polega na automatycznym oznaczaniu akordów granych w całym utworze bezpośrednio na podstawie jego ścieżki dźwiękowej.

2 min. przeczytajPrzeczytaj

Skończyłeś czytać? Udowodnij to.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.