Zvukový průvodce AI

Poslouchejte Attend and Spell

Listen, Attend and Spell (LAS) je přelomová neuronová síť z roku 2015, která přepisuje řeč přímo do znaků, bez ručně vytvořeného slovníku výslovnosti nebo samostatného jazykového modelu.

2 minuty čteníNaposledy aktualizováno

Přehled

It showed that a single end-to-end model could do speech recognition.

Hluboký ponor

Listen, Attend and Spell, představený výzkumníky Google Chan, Jaitly, Le a Vinyals v roce 2015, byl jedním z prvních skutečných end-to-end rozpoznávačů řeči. Má dvě části: 'Listener', pyramidální obousměrný LSTM, který kóduje zvuk a zároveň zmenšuje časovou dimenzi, a 'Speller', dekodér LSTM založený na pozornosti, který vysílá znaky jeden po druhém. Mechanismus pozornosti umožňuje pravopisu zaměřit se na příslušný úsek zvuku pro každé výstupní písmeno. Na rozdíl od starších kanálů HMM-DNN nepotřebuje LAS žádný slovník fonémů, žádné vynucené zarovnání a žádný samostatně školený jazykový model; učí se pravopis, hranice slov a akustiku společně z přepsaného zvuku. Přímo inspiroval moderní systémy ASR se sekvencí po sekvenci a založené na pozornosti.

Technický přehled

LAS kombinuje kodér-dekodér s pozorností. Pyramidový kodér LSTM snižuje časové rozlišení na polovinu v každé ze tří vrstev, čímž zkracuje dlouhou akustickou sekvenci na zvládnutelnou délku, takže pozornost je ovladatelná. V každém kroku dekódování pravopis vypočítává váhy pozornosti nad všemi stavy kodéru, spojuje je do kontextového vektoru a předpovídá další znak. Trénink maximalizuje pravděpodobnost správné sekvence znaků; trik s naplánovaným vzorkováním snižuje nesoulad mezi vlakem a testem.

Strategický dopad

Přístup a dosah

Zlepšuje dostupnost prostřednictvím přepisu, vyprávění a hlasových rozhraní.

Cena a rozpočet

Mediální týmy mohou dodávat vylepšený zvuk rychleji s menšími rozpočty.

Rychlost a měřítko

Systémy orientované na zákazníky mohou zpracovávat mluvené interakce ve větším měřítku.

Budoucnost poslechu Attend and Spell

LAS je nyní historický, ale jeho DNA prochází každým moderním systémem ASR. Jeho myšlenka kodéru a dekodéru založená na pozornosti se vyvinula v rozpoznávače Transformer a Conformer, zatímco související přístupy, jako je RNN-Transducer, zapínají diktování na zařízení. Budoucí systémy pokračují v této trajektorii end-to-end, spojují rozpoznávání s překladem a porozuměním v jednotlivých vícejazyčných modelech a posouvají se směrem k streamování, transkripci s nízkou latencí, kterou LAS, protože není streaming, původně nemohl poskytnout.

Real-World Implementace

Přepis mluvené angličtiny přímo do písmen bez slovníku výslovnosti

Slouží jako koncepční základ pro systémy hlasového diktování a titulků založené na pozornosti

Demonstrace komplexního školení pro akademické kurzy rozpoznávání řeči a srovnávací testy

Inspirativní modely sekvencí po sekvencích později používané v kanálech překladu řeči

Rizika a zábradlí

Pokud chybí souhlas, zvyšuje se riziko zneužití hlasu a předstírání jiné identity.

Přesnost může klesat v přízvuku, dialektech nebo hlučném prostředí.

Syntetický zvuk lze bez jasného označení zaměnit za autentickou řeč.

Plán implementace

1

Získejte výslovný souhlas se zachycením hlasu, klonováním a opětovným použitím.

2

Otestujte kvalitu napříč různými reproduktory a podmínkami pozadí.

3

Definujte, kdy musí člověk zkontrolovat nebo schválit výstupy.

4

Označte syntetický zvuk a veďte záznamy o původu pro zajištění odpovědnosti.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Listen Attend and Spell quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Automatické označování hudby

Často kladené otázky

What is Listen Attend and Spell?

Listen, Attend and Spell (LAS) je přelomová neuronová síť z roku 2015, která přepisuje řeč přímo do znaků, bez ručně vytvořeného slovníku výslovnosti nebo samostatného jazykového modelu. Ukázalo se, že jediný end-to-end model dokáže rozpoznávat řeč.

Jaké jsou dvě hlavní součásti modelu LAS?

LAS se skládá z kodéru „Listener“, který zpracovává zvuk, a dekodéru založeného na pozornosti „Speller“, který vysílá znaky.

Co vydává Speller v LAS?

The Speller je dekodér, který vytváří přepis znak po znaku a přímo se učí pravopis.

Proč se kodér LAS nazývá „pyramidový“?

Každá vrstva pyramidálního BLSTM zkracuje délku sekvence na polovinu, čímž zkracuje dlouhou zvukovou sekvenci, takže pozornost je výpočetně proveditelná.

Jakou starší komponentu LAS zejména NEPOŽADUJE?

Na rozdíl od klasických kanálů HMM-DNN se LAS učí přímo z párů zvuk-text bez použití slovníku fonémů nebo nuceného zarovnání.

Jaký mechanismus umožňuje pravopisu zaměřit se na relevantní část zvuku pro každou postavu?

Mechanismus pozornosti počítá váhy stavů kodéru a vytváří kontextový vektor, který dekodér používá v každém kroku.