PRZEWODNIK AI audio

Zestaw narzędzi do rozpoznawania mowy Kaldi

Kaldi to darmowy zestaw narzędzi typu open source, który stał się dominującą platformą badawczą do tworzenia systemów rozpoznawania mowy.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because for nearly a decade it was the go-to foundation for academic and industrial ASR work.

Głębokie nurkowanie

Kaldi, wydany w 2011 roku i prowadzony przez Daniela Poveya, jest napisany w C++ z przepisami sklejonymi ze sobą za pomocą skryptów bash i Perl. Opiera się na klasycznym potoku ASR: wyodrębnia cechy akustyczne (MFCC lub banki filtrów), modeluje dźwięki fonemów za pomocą modeli mieszaniny Gaussa lub później głębokich sieci neuronowych i łączy model akustyczny, leksykon wymowy i model językowy w jeden wykres z możliwością przeszukiwania. Decydującym wyborem technicznym było użycie ważonych przetworników stanu skończonego (WFST) z biblioteki OpenFST w celu skomponowania wszystkich źródeł wiedzy w jeden graf dekodujący. Kaldi dostarczył „przepisy” na standardowe zbiory danych, takie jak Switchboard, Librispeech i Wall Street Journal, umożliwiając badaczom reprodukcję najnowocześniejszych wyników. Stała się implementacją referencyjną, względem której porównywano nowe systemy.

Wgląd techniczny

Podstawową sztuczką Kaldiego jest złożenie czterech WFST w jeden wykres zwany HCLG: H odwzorowuje stany sieci neuronowej lub GMM na telefony zależne od kontekstu, C obsługuje kontekst fonetyczny (trifony), L to leksykon wymowy odwzorowujący telefony na słowa, a G to model języka. Mnożenie tych przetworników i optymalizacja wyniku daje pojedynczy wykres, który dekoder przeszukuje za pomocą algorytmu Viterbiego z przyciętą wiązką, skutecznie przekształcając klatki audio w najbardziej prawdopodobną sekwencję słów.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość zestawu narzędzi do rozpoznawania mowy Kaldi

Hybrydowe podejście Kaldiego HMM-DNN zostało w dużej mierze zastąpione kompleksowymi modelami neuronowymi, które mapują dźwięk bezpośrednio na tekst. Następca Daniela Poveya, projekt k2 (z ekosystemami Icefall i Lhotse), na nowo przedstawia pomysły Kaldiego dotyczące WFST w PyTorch z różniczkowalnymi automatami o skończonych stanach. Można się spodziewać, że sam Kaldi pozostanie historycznym punktem odniesienia i narzędziem dydaktycznym, podczas gdy jego koncepcyjni następcy łączą klasyczne dekodowanie strukturalne z nowoczesnymi, opartymi na transformatorach i samonadzorowanymi modelami akustycznymi.

Implementacja w świecie rzeczywistym

Laboratoria akademickie odtwarzające testy porównawcze Librispeech i Switchboard w celu sprawdzenia nowych badań w zakresie modelowania akustycznego

Tworzenie niestandardowych systemów poleceń głosowych dla języków o niskich zasobach lub języków mniejszościowych przy użyciu receptur Kaldi

Wymuszone dopasowanie dźwięku do transkrypcji ze względów językowych, tworzenia zestawu danych i synchronizacji napisów

Wspieranie wczesnych rozwiązań wyszukiwania głosowego i dyktowania w branży, zanim dojrzały kompleksowe modele

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Kaldi Speech Recognition Toolkit quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Rozpoznawanie mowy szeptanej

Często zadawane pytania

What is Kaldi Speech Recognition Toolkit?

Kaldi to darmowy zestaw narzędzi typu open source, który stał się dominującą platformą badawczą do tworzenia systemów rozpoznawania mowy. Ma to znaczenie, ponieważ przez prawie dekadę stanowił podstawową podstawę akademickich i przemysłowych prac ASR.

W jakim języku programowania napisany jest rdzeń Kaldiego?

Rdzeń Kaldiego został napisany w C++ w celu zapewnienia wydajności, a skrypty bash i Perl koordynowały receptury uczenia i dekodowania.

Jakiej struktury matematycznej używa Kaldi, aby połączyć swój model akustyczny, leksykon i model językowy w jeden wykres dekodujący?

Kaldi układa WFST z biblioteki OpenFST w pojedynczy wykres HCLG, który przeszukuje dekoder.

Kto jest głównym twórcą i liderem projektu Kaldi?

Daniel Povey kierował rozwojem Kaldi, wydanego po raz pierwszy w 2011 roku, a później rozpoczął kolejny projekt K2.

Jakie modele GMM (Gaussian Mixture Models) pierwotnie wykorzystywano do modelowania w klasycznym potoku Kaldiego?

GMM modelowały prawdopodobieństwo akustyczne stanów fonemów, zanim głębokie sieci neuronowe zastąpiły je w systemach hybrydowych.

Jak nazywa się nowoczesny ekosystem będący następcą Kaldiego, oparty na PyTorch?

k2 wraz z Icefall i Lhotse ponownie implementują idee Kaldiego dotyczące stanu skończonego w różniczkowej formie przyjaznej dla PyTorch.