Audio AI ÚTMUTATÓ

Figyelj, figyelj és írj

A Listen, Attend and Spell (LAS) egy mérföldkőnek számító 2015-ös neurális hálózat, amely a beszédet közvetlenül karakterekké írja át, kézzel készített kiejtési szótár vagy külön nyelvi modell nélkül.

2 perc olvasásUtoljára frissítve

Áttekintés

It showed that a single end-to-end model could do speech recognition.

Mély merülés

A Listen, Attend és Spell, amelyet a Google kutatók, Chan, Jaitly, Le és Vinyals vezettek be 2015-ben, az egyik első valódi végpontok közötti beszédfelismerő. Két részből áll: egy „Listener”, egy piramis alakú, kétirányú LSTM, amely kódolja a hangot, miközben csökkenti az idődimenziót, és egy „Speller”, egy figyelem alapú LSTM dekóder, amely egyenként bocsát ki karaktereket. A figyelemmechanizmus lehetővé teszi, hogy a Speller az egyes kimeneti betűk megfelelő audió szeletére összpontosítson. A régebbi HMM-DNN csővezetékekkel ellentétben a LAS-nak nincs szüksége fonémaszótárra, nincs kényszer igazítás, és nincs külön betanított nyelvi modell sem; az átírt hanganyagból közösen tanulja meg a helyesírást, a szóhatárokat és az akusztikát. Közvetlenül ihlette a modern szekvencia-szekvencia és figyelem alapú ASR rendszereket.

Technikai betekintés

A LAS egyesíti a kódoló-dekódolót a figyelemfelkeltéssel. A piramis alakú LSTM kódoló megfelezi az időfelbontást mindhárom rétegben, így egy hosszú akusztikus sorozatot kezelhető hosszúságúra vág, így a figyelem irányítható. A Speller minden dekódolási lépésnél kiszámítja a figyelem súlyát a kódoló összes állapotára vonatkozóan, összekeveri őket egy kontextusvektorba, és megjósolja a következő karaktert. A képzés maximalizálja a helyes karaktersorozat valószínűségét; egy ütemezett mintavételi trükk csökkenti a vonat/teszt eltérést.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A hallgatás jövője, figyelj és varázsolj

A LAS ma már történelmi, de DNS-e minden modern ASR rendszeren áthalad. Figyelemre épülő kódoló-dekódoló ötlete Transformer és Conformer felismerőkké fejlődött, míg a kapcsolódó megközelítések, mint például az RNN-Transducer tápellátási diktálása. A jövőbeli rendszerek ezt a végponttól végpontig terjedő pályát folytatják, egyesítve a felismerést a fordítással és a megértéssel egyetlen többnyelvű modellben, és a streaming, alacsony késleltetésű átírás felé tolják, amit a LAS, mivel nem streaming, eredetileg nem tudott biztosítani.

Valós megvalósítás

A beszélt angol átírása közvetlenül betűkké, kiejtési szótár nélkül

A figyelem alapú diktálási és feliratozási rendszerek fogalmi alapja

Végpontok közötti képzés bemutatása tudományos beszédfelismerési kurzusokhoz és benchmarkokhoz

Inspiráló sorozatról szekvenciára modellek, amelyeket később a beszédfordítási folyamatokban használtak

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Listen Attend and Spell quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Zene automatikus címkézése

Gyakran ismételt kérdések

What is Listen Attend and Spell?

A Listen, Attend and Spell (LAS) egy mérföldkőnek számító 2015-ös neurális hálózat, amely a beszédet közvetlenül karakterekké írja át, kézzel készített kiejtési szótár vagy külön nyelvi modell nélkül. Megmutatta, hogy egyetlen end-to-end modell képes beszédfelismerésre.

Mi a LAS modell két fő összetevője?

A LAS egy „Listener” kódolóból áll, amely feldolgozza a hangot, és egy „Speller” figyelemalapú dekóderből, amely karaktereket bocsát ki.

Mit ad ki a Speller a LAS-ban?

A Speller egy dekódoló, amely karakterenként állítja elő az átírást, és közvetlenül tanulja meg a helyesírást.

Miért hívják piramisnak a LAS kódolót?

A piramis alakú BLSTM minden egyes rétege felére csökkenti a szekvencia hosszát, lerövidítve a hosszú hangsorozatot, így a figyelem számításilag megvalósítható.

Milyen régebbi komponenst NEM igényel a LAS?

A klasszikus HMM-DNN csővezetékekkel ellentétben a LAS közvetlenül a hang-szöveg párokból tanul fonémaszótár vagy kényszerített igazítás nélkül.

Melyik mechanizmus teszi lehetővé, hogy a helyesíró az egyes karakterek hangjának megfelelő részére összpontosítson?

Egy figyelemfelkeltő mechanizmus a kódoló állapotaira súlyokat számít ki, és egy kontextusvektort alkot, amelyet a dekódoló minden lépésben használ.