Lyssna Delta och stava
Listen, Attend and Spell (LAS) är ett landmärke 2015 neuralt nätverk som transkriberar tal direkt till tecken, utan handbyggd uttalsordbok eller separat språkmodell.
Översikt
It showed that a single end-to-end model could do speech recognition.
Djupdykning
Listen, Attend and Spell, som introducerades av Google-forskarna Chan, Jaitly, Le och Vinyals 2015, var en av de första verkliga taligenkännare från slut till ände. Den har två delar: en "Listener", en pyramidformad dubbelriktad LSTM som kodar ljudet samtidigt som tidsdimensionen krymper, och en "Speller", en uppmärksamhetsbaserad LSTM-avkodare som avger tecken ett i taget. Uppmärksamhetsmekanismen låter Speller fokusera på det relevanta ljudstycket för varje utgående bokstav. Till skillnad från äldre HMM-DNN-pipelines behöver LAS ingen fonemordbok, ingen forcerad anpassning och ingen separat tränad språkmodell; den lär sig stavning, ordgränser och akustik tillsammans från transkriberat ljud. Det inspirerade direkt moderna sekvens-till-sekvens och uppmärksamhetsbaserade ASR-system.
Teknisk insikt
LAS kombinerar en kodare-avkodare med uppmärksamhet. Den pyramidformade LSTM-kodaren halverar tidsupplösningen vid vart och ett av tre lager, och skär en lång akustisk sekvens till en hanterbar längd så att uppmärksamheten är lätt att hantera. Vid varje avkodningssteg beräknar stavaren uppmärksamhetsvikter över alla kodartillstånd, blandar dem i en kontextvektor och förutsäger nästa tecken. Träning maximerar sannolikheten för rätt teckensekvens; ett schema med schemalagda provtagningar minskar tåg-/testfel.
Strategisk inverkan
Access and reach
Det förbättrar tillgängligheten genom transkription, berättarröst och röstgränssnitt.
Cost and budget
Medieteam kan skicka polerat ljud snabbare med mindre budgetar.
Speed and scale
Kundvända system kan behandla talade interaktioner i större skala.
Framtiden för lyssna delta och stava
LAS är nu historiskt, men dess DNA går igenom alla moderna ASR-system. Dess uppmärksamhetsbaserade encoder-decoder-idé utvecklades till Transformer- och Conformer-igenkännare, medan relaterade tillvägagångssätt som RNN-Transducer driver diktering på enheten. Framtida system fortsätter denna bana från början till slut, kombinerar igenkänning med översättning och förståelse i enstaka flerspråkiga modeller, och driver mot strömning, transkription med låg latens som LAS, eftersom det inte är strömmande, inte kunde tillhandahålla ursprungligen.
Real-World Implementation
Transkribera talad engelska direkt till bokstäver utan uttalsordbok
Fungerar som den konceptuella grunden för uppmärksamhetsbaserad röstdiktering och bildtextningssystem
Demonstrera end-to-end-utbildning för akademiska kurser och riktmärken för taligenkänning
Inspirerande sekvens-till-sekvens-modeller som senare används i pipelines för talöversättning
Risker & skyddsräcken
Riskerna för missbruk av röst och personifiering ökar när samtycke saknas.
Noggrannheten kan sjunka över accenter, dialekter eller bullriga miljöer.
Syntetiskt ljud kan misstas för autentiskt tal utan tydlig märkning.
Färdplan för genomförande
Skaffa uttryckligt samtycke för röstinfångning, kloning och återanvändning.
Testa kvalitet över olika högtalare och bakgrundsförhållanden.
Definiera när en människa måste granska eller godkänna utdata.
Märk syntetiskt ljud och håll härkomstregister för ansvarstagande.
Fortsätt utforska
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Listen Attend and Spell quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Automatisk märkning av musik
Frequently asked questions
What is Listen Attend and Spell?
Listen, Attend and Spell (LAS) är ett landmärke 2015 neuralt nätverk som transkriberar tal direkt till tecken, utan handbyggd uttalsordbok eller separat språkmodell. Den visade att en enda end-to-end-modell kunde göra taligenkänning.
Vilka är de två huvudkomponenterna i LAS-modellen?
LAS består av en 'Listener'-kodare som bearbetar ljudet och en 'Speller' uppmärksamhetsbaserad avkodare som avger tecken.
Vad ger stavaren i LAS ut?
Spelaren är en avkodare som producerar transkriptionen tecken för tecken och lär sig stavning direkt.
Varför kallas LAS-kodaren 'pyramidal'?
Varje lager av den pyramidformade BLSTM halverar sekvenslängden, vilket förkortar den långa ljudsekvensen så att uppmärksamhet är beräkningsmässigt möjlig.
Vilken äldre komponent kräver inte LAS?
Till skillnad från klassiska HMM-DNN-pipelines, lär sig LAS direkt från ljud-till-text-par utan fonemordbok eller påtvingad anpassning.
Vilken mekanism låter Spelaren fokusera på den relevanta delen av ljudet för varje karaktär?
En uppmärksamhetsmekanism beräknar vikter över kodartillstånd och bildar en kontextvektor som avkodaren använder vid varje steg.