Figyelj, figyelj és írj
A Listen, Attend and Spell (LAS) egy mérföldkőnek számító 2015-ös neurális hálózat, amely a beszédet közvetlenül karakterekké írja át, kézzel készített kiejtési szótár vagy külön nyelvi modell nélkül.
Áttekintés
It showed that a single end-to-end model could do speech recognition.
Mély merülés
A Listen, Attend és Spell, amelyet a Google kutatók, Chan, Jaitly, Le és Vinyals vezettek be 2015-ben, az egyik első valódi végpontok közötti beszédfelismerő. Két részből áll: egy „Listener”, egy piramis alakú, kétirányú LSTM, amely kódolja a hangot, miközben csökkenti az idődimenziót, és egy „Speller”, egy figyelem alapú LSTM dekóder, amely egyenként bocsát ki karaktereket. A figyelemmechanizmus lehetővé teszi, hogy a Speller az egyes kimeneti betűk megfelelő audió szeletére összpontosítson. A régebbi HMM-DNN csővezetékekkel ellentétben a LAS-nak nincs szüksége fonémaszótárra, nincs kényszer igazítás, és nincs külön betanított nyelvi modell sem; az átírt hanganyagból közösen tanulja meg a helyesírást, a szóhatárokat és az akusztikát. Közvetlenül ihlette a modern szekvencia-szekvencia és figyelem alapú ASR rendszereket.
Technikai betekintés
A LAS egyesíti a kódoló-dekódolót a figyelemfelkeltéssel. A piramis alakú LSTM kódoló megfelezi az időfelbontást mindhárom rétegben, így egy hosszú akusztikus sorozatot kezelhető hosszúságúra vág, így a figyelem irányítható. A Speller minden dekódolási lépésnél kiszámítja a figyelem súlyát a kódoló összes állapotára vonatkozóan, összekeveri őket egy kontextusvektorba, és megjósolja a következő karaktert. A képzés maximalizálja a helyes karaktersorozat valószínűségét; egy ütemezett mintavételi trükk csökkenti a vonat/teszt eltérést.
Stratégiai hatás
Hozzáférés és elérés
Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.
Költség és költségvetés
A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.
Sebesség és méretarány
Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.
A hallgatás jövője, figyelj és varázsolj
A LAS ma már történelmi, de DNS-e minden modern ASR rendszeren áthalad. Figyelemre épülő kódoló-dekódoló ötlete Transformer és Conformer felismerőkké fejlődött, míg a kapcsolódó megközelítések, mint például az RNN-Transducer tápellátási diktálása. A jövőbeli rendszerek ezt a végponttól végpontig terjedő pályát folytatják, egyesítve a felismerést a fordítással és a megértéssel egyetlen többnyelvű modellben, és a streaming, alacsony késleltetésű átírás felé tolják, amit a LAS, mivel nem streaming, eredetileg nem tudott biztosítani.
Valós megvalósítás
A beszélt angol átírása közvetlenül betűkké, kiejtési szótár nélkül
A figyelem alapú diktálási és feliratozási rendszerek fogalmi alapja
Végpontok közötti képzés bemutatása tudományos beszédfelismerési kurzusokhoz és benchmarkokhoz
Inspiráló sorozatról szekvenciára modellek, amelyeket később a beszédfordítási folyamatokban használtak
Kockázatok és védőkorlátok
A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.
A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.
A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.
Végrehajtási ütemterv
Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.
Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.
Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.
Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Listen Attend and Spell quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Zene automatikus címkézése
Gyakran ismételt kérdések
What is Listen Attend and Spell?
A Listen, Attend and Spell (LAS) egy mérföldkőnek számító 2015-ös neurális hálózat, amely a beszédet közvetlenül karakterekké írja át, kézzel készített kiejtési szótár vagy külön nyelvi modell nélkül. Megmutatta, hogy egyetlen end-to-end modell képes beszédfelismerésre.
Mi a LAS modell két fő összetevője?
A LAS egy „Listener” kódolóból áll, amely feldolgozza a hangot, és egy „Speller” figyelemalapú dekóderből, amely karaktereket bocsát ki.
Mit ad ki a Speller a LAS-ban?
A Speller egy dekódoló, amely karakterenként állítja elő az átírást, és közvetlenül tanulja meg a helyesírást.
Miért hívják piramisnak a LAS kódolót?
A piramis alakú BLSTM minden egyes rétege felére csökkenti a szekvencia hosszát, lerövidítve a hosszú hangsorozatot, így a figyelem számításilag megvalósítható.
Milyen régebbi komponenst NEM igényel a LAS?
A klasszikus HMM-DNN csővezetékekkel ellentétben a LAS közvetlenül a hang-szöveg párokból tanul fonémaszótár vagy kényszerített igazítás nélkül.
Melyik mechanizmus teszi lehetővé, hogy a helyesíró az egyes karakterek hangjának megfelelő részére összpontosítson?
Egy figyelemfelkeltő mechanizmus a kódoló állapotaira súlyokat számít ki, és egy kontextusvektort alkot, amelyet a dekódoló minden lépésben használ.