Zvukový průvodce AI

Kaldi sada nástrojů pro rozpoznávání řeči

Kaldi je bezplatná sada nástrojů s otevřeným zdrojovým kódem, která se stala dominantní výzkumnou platformou pro vytváření systémů rozpoznávání řeči.

2 minuty čteníNaposledy aktualizováno

Přehled

It matters because for nearly a decade it was the go-to foundation for academic and industrial ASR work.

Hluboký ponor

Kaldi, vydané v roce 2011 a vedené Danielem Poveyem, je napsáno v C++ s recepturami slepenými skripty bash a Perl. Je postaven na klasickém potrubí ASR: extrahujte akustické prvky (MFCC nebo filtrační banky), modelujte zvuky fonémů pomocí modelů Gaussian Mixture Models nebo později hlubokých neuronových sítí a kombinujte akustický model, lexikon výslovnosti a jazykový model do jediného prohledávatelného grafu. Jeho definující technickou volbou bylo použití vážených konečných převodníků (WFST) z knihovny OpenFST ke složení všech zdrojů znalostí do jednoho dekódovacího grafu. Kaldi dodal „recepty“ pro standardní datové sady, jako je Switchboard, Librispeech a Wall Street Journal, a umožnil tak výzkumníkům reprodukovat nejnovější výsledky. Stala se referenční implementací, se kterou byly porovnávány nové systémy.

Technický přehled

Základním trikem Kaldiho je skládání čtyř WFST do jednoho grafu zvaného HCLG: H mapuje stavy neuronové sítě nebo GMM na kontextově závislé telefony, C zpracovává fonetický kontext (trifony), L je lexikon výslovnosti mapující telefony na slova a G je jazykový model. Vynásobením těchto převodníků a optimalizací výsledku vznikne jediný graf, který dekodér prohledává pomocí algoritmu Viterbiho ořezávaného paprskem a efektivně převádí zvukové snímky na nejpravděpodobnější sekvenci slov.

Strategický dopad

Přístup a dosah

Zlepšuje dostupnost prostřednictvím přepisu, vyprávění a hlasových rozhraní.

Cena a rozpočet

Mediální týmy mohou dodávat vylepšený zvuk rychleji s menšími rozpočty.

Rychlost a měřítko

Systémy orientované na zákazníky mohou zpracovávat mluvené interakce ve větším měřítku.

Budoucnost Kaldiho sady nástrojů pro rozpoznávání řeči

Kaldiho hybridní HMM-DNN přístup byl z velké části nahrazen end-to-end neuronovými modely, které mapují zvuk přímo na text. Nástupnický projekt Daniela Poveyho, k2 (s ekosystémem Icefall a Lhotse), přetváří Kaldiho nápady WFST v PyTorch s diferencovatelnými automaty s konečným stavem. Očekávejte, že samotný Kaldi zůstane historickým odkazem a výukovým nástrojem, zatímco jeho koncepční potomci spojí klasické strukturované dekódování s moderními akustickými modely založenými na transformátorech a samořízenými akustickými modely.

Real-World Implementace

Akademické laboratoře reprodukující benchmarky Librispeech a Switchboard k ověření nového výzkumu akustického modelování

Vytváření vlastních systémů hlasového ovládání pro jazyky s nízkými zdroji nebo menšinové jazyky pomocí receptů Kaldi

Vynucené zarovnání zvuku s přepisy pro lingvistiku, vytváření datové sady a časování titulků

Pohání časné hlasové vyhledávání a diktování backendů v průmyslu, než dospějí komplexní modely

Rizika a zábradlí

Pokud chybí souhlas, zvyšuje se riziko zneužití hlasu a předstírání jiné identity.

Přesnost může klesat v přízvuku, dialektech nebo hlučném prostředí.

Syntetický zvuk lze bez jasného označení zaměnit za autentickou řeč.

Plán implementace

1

Získejte výslovný souhlas se zachycením hlasu, klonováním a opětovným použitím.

2

Otestujte kvalitu napříč různými reproduktory a podmínkami pozadí.

3

Definujte, kdy musí člověk zkontrolovat nebo schválit výstupy.

4

Označte syntetický zvuk a veďte záznamy o původu pro zajištění odpovědnosti.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Kaldi Speech Recognition Toolkit quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Šeptání Rozpoznávání řeči

Často kladené otázky

What is Kaldi Speech Recognition Toolkit?

Kaldi je bezplatná sada nástrojů s otevřeným zdrojovým kódem, která se stala dominantní výzkumnou platformou pro vytváření systémů rozpoznávání řeči. Záleží na tom, protože téměř deset let to byl základní základ pro akademickou a průmyslovou práci ASR.

V jakém programovacím jazyce je napsáno jádro Kaldi?

Kaldiho jádro je napsáno v C++ pro výkon, se skripty bash a Perl, které organizují tréninkové a dekódovací recepty.

Jakou matematickou strukturu používá Kaldi ke spojení svého akustického modelu, lexikonu a jazykového modelu do jednoho dekódovacího grafu?

Kaldi skládá WFST z knihovny OpenFST do jediného HCLG grafu, který dekodér prohledává.

Kdo je hlavním tvůrcem a vedoucím projektu Kaldi?

Daniel Povey vedl vývoj Kaldi, která byla poprvé vydána v roce 2011 a později zahájila následnický projekt k2.

Co bylo v klasickém potrubí Kaldiho původně použito k modelování GMM (Gaussian Mixture Models)?

GMM modelovaly akustickou pravděpodobnost fonémových stavů předtím, než je v hybridních systémech nahradily hluboké neuronové sítě.

Jak se jmenuje moderní ekosystém nástupce Kaldi založený na PyTorch?

k2, spolu s Icefall a Lhotse, znovu implementuje Kaldiho myšlenky konečných stavů v diferencovatelné formě přátelské k PyTorch.