Bezpłatna biblioteka AI

Dźwiękowa sztuczna inteligencja przewodnikiZa darmo na zawsze.

117 przewodniki w prostym języku angielskim, ustrukturyzowane ścieżki edukacyjne i otwarta biblioteka — stworzone przez niezależną organizację non-profit 501(c)(3), aby każdy mógł zrozumieć współczesną sztuczną inteligencję.

117Bezpłatne przewodniki
1Ścieżki tematyczne
~2 minWedług przewodnika
~4hCzas czytania

Zacznij tutaj

Pięć Kursy oparte na wynikach

Każdy kurs zawiera wyraźne wyniki, zmapowane kompetencje, ćwiczenia oraz praktyczny projekt końcowy.

Ścieżki tematyczne

Przeglądaj według utworu

Wskocz w obszar, na którym Ci zależy. Do każdego utworu dołączono wiele przewodników w języku angielskim.

Pełna biblioteka

Wszystkie przewodniki

117 z 1019 pokazane przewodniki. Filtruj według utworu lub wyszukaj powyżej.

Dźwiękowa sztuczna inteligencja

Identyfikacja utworu coverowego

Identyfikacja utworu coverowego pozwala wykryć, kiedy dwa bardzo różnie brzmiące nagrania to w rzeczywistości ten sam utwór bazowy — akustyczna wersja na żywo, remiks…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Różnicowa synteza audio DDSP

DDSP (Differentiable Digital Signal Processing) łączy klasyczne elementy składowe syntezatorów z sieciami neuronowymi, dzięki czemu głębokie uczenie się może kontrolować oscylatory…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Kompleksowa synteza mowy VITS

VITS to model zamiany tekstu na mowę, który zamienia tekst bezpośrednio na surowe przebiegi audio w jednym wytrenowanym systemie, z pominięciem zwykłego dwuetapowego potoku.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

FastSpeech i nieautoregresywny TTS

FastSpeech generuje równolegle cały spektrogram mowy, a nie jedną klatkę na raz, dzięki czemu synteza jest znacznie szybsza i stabilniejsza.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

NaturalSpeech i dyfuzja utajona TTS

NaturalSpeech to linia badań Microsoft TTS, których celem jest jakość mowy na poziomie ludzkim, przy czym późniejsze wersje wykorzystują utajoną dyfuzję w celu generowania bogatych, naturalnych…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Rozpoznawanie emocji w mowie

Rozpoznawanie emocji mowy (SER) to sztuczna inteligencja, która wykrywa stan emocjonalny osoby mówiącej – złość, radość, smutek, frustrację – na podstawie dźwięku jej głosu, a nie tylko…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Mowa Moshi w pełnym dupleksie

Moshi to oparta na otwartym kodzie źródłowym sztuczna inteligencja głosowa firmy Kyutai działająca w czasie rzeczywistym, która mówi i słucha w tym samym czasie — w trybie pełnego dupleksu — zamiast działać po kolei.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Tłumaczenie mowy na mowę

Tłumaczenie mowy na mowę (S2ST) polega na przetwarzaniu słów mówionych w jednym języku i tworzeniu słów mówionych w innym — idealnie zachowując głos i ton mówiącego…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wokodery HiFi-GAN i GAN

HiFi-GAN to wokoder generatywno-kontradyktoryjny, który niemal natychmiast przekształca spektrogram mel w surową falę audio, tworząc mowę o studyjnej jakości daleko…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Konwersja grafemu na fonem

Konwersja grafemu na fonem (G2P) przekłada pisane litery na dźwięki, które system mowy powinien faktycznie wymawiać.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Normalizacja tekstu dla mowy

Normalizacja tekstu to etap początkowy, który polega na przepisaniu surowego tekstu na w pełni wypowiadane słowa, zanim system mowy je wypowie.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Kodek neuronowy SoundStream

SoundStream to kompleksowy neuronowy kodek audio firmy Google, który kompresuje mowę i muzykę do wyjątkowo niskiej przepływności, zachowując jednocześnie jakość.

2 min. przeczytajPrzeczytaj

Skończyłeś czytać? Udowodnij to.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 2 of 10 | AI Understanding