Audio AI GUIDE

Lyssna Delta och stava

Listen, Attend and Spell (LAS) är ett landmärke 2015 neuralt nätverk som transkriberar tal direkt till tecken, utan handbyggd uttalsordbok eller separat språkmodell.

2 min readSenast uppdaterad

Översikt

It showed that a single end-to-end model could do speech recognition.

Djupdykning

Listen, Attend and Spell, som introducerades av Google-forskarna Chan, Jaitly, Le och Vinyals 2015, var en av de första verkliga taligenkännare från slut till ände. Den har två delar: en "Listener", en pyramidformad dubbelriktad LSTM som kodar ljudet samtidigt som tidsdimensionen krymper, och en "Speller", en uppmärksamhetsbaserad LSTM-avkodare som avger tecken ett i taget. Uppmärksamhetsmekanismen låter Speller fokusera på det relevanta ljudstycket för varje utgående bokstav. Till skillnad från äldre HMM-DNN-pipelines behöver LAS ingen fonemordbok, ingen forcerad anpassning och ingen separat tränad språkmodell; den lär sig stavning, ordgränser och akustik tillsammans från transkriberat ljud. Det inspirerade direkt moderna sekvens-till-sekvens och uppmärksamhetsbaserade ASR-system.

Teknisk insikt

LAS kombinerar en kodare-avkodare med uppmärksamhet. Den pyramidformade LSTM-kodaren halverar tidsupplösningen vid vart och ett av tre lager, och skär en lång akustisk sekvens till en hanterbar längd så att uppmärksamheten är lätt att hantera. Vid varje avkodningssteg beräknar stavaren uppmärksamhetsvikter över alla kodartillstånd, blandar dem i en kontextvektor och förutsäger nästa tecken. Träning maximerar sannolikheten för rätt teckensekvens; ett schema med schemalagda provtagningar minskar tåg-/testfel.

Strategisk inverkan

Access and reach

Det förbättrar tillgängligheten genom transkription, berättarröst och röstgränssnitt.

Cost and budget

Medieteam kan skicka polerat ljud snabbare med mindre budgetar.

Speed and scale

Kundvända system kan behandla talade interaktioner i större skala.

Framtiden för lyssna delta och stava

LAS är nu historiskt, men dess DNA går igenom alla moderna ASR-system. Dess uppmärksamhetsbaserade encoder-decoder-idé utvecklades till Transformer- och Conformer-igenkännare, medan relaterade tillvägagångssätt som RNN-Transducer driver diktering på enheten. Framtida system fortsätter denna bana från början till slut, kombinerar igenkänning med översättning och förståelse i enstaka flerspråkiga modeller, och driver mot strömning, transkription med låg latens som LAS, eftersom det inte är strömmande, inte kunde tillhandahålla ursprungligen.

Real-World Implementation

Transkribera talad engelska direkt till bokstäver utan uttalsordbok

Fungerar som den konceptuella grunden för uppmärksamhetsbaserad röstdiktering och bildtextningssystem

Demonstrera end-to-end-utbildning för akademiska kurser och riktmärken för taligenkänning

Inspirerande sekvens-till-sekvens-modeller som senare används i pipelines för talöversättning

Risker & skyddsräcken

Riskerna för missbruk av röst och personifiering ökar när samtycke saknas.

Noggrannheten kan sjunka över accenter, dialekter eller bullriga miljöer.

Syntetiskt ljud kan misstas för autentiskt tal utan tydlig märkning.

Färdplan för genomförande

1

Skaffa uttryckligt samtycke för röstinfångning, kloning och återanvändning.

2

Testa kvalitet över olika högtalare och bakgrundsförhållanden.

3

Definiera när en människa måste granska eller godkänna utdata.

4

Märk syntetiskt ljud och håll härkomstregister för ansvarstagande.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Listen Attend and Spell quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Automatisk märkning av musik

Frequently asked questions

What is Listen Attend and Spell?

Listen, Attend and Spell (LAS) är ett landmärke 2015 neuralt nätverk som transkriberar tal direkt till tecken, utan handbyggd uttalsordbok eller separat språkmodell. Den visade att en enda end-to-end-modell kunde göra taligenkänning.

Vilka är de två huvudkomponenterna i LAS-modellen?

LAS består av en 'Listener'-kodare som bearbetar ljudet och en 'Speller' uppmärksamhetsbaserad avkodare som avger tecken.

Vad ger stavaren i LAS ut?

Spelaren är en avkodare som producerar transkriptionen tecken för tecken och lär sig stavning direkt.

Varför kallas LAS-kodaren 'pyramidal'?

Varje lager av den pyramidformade BLSTM halverar sekvenslängden, vilket förkortar den långa ljudsekvensen så att uppmärksamhet är beräkningsmässigt möjlig.

Vilken äldre komponent kräver inte LAS?

Till skillnad från klassiska HMM-DNN-pipelines, lär sig LAS direkt från ljud-till-text-par utan fonemordbok eller påtvingad anpassning.

Vilken mekanism låter Spelaren fokusera på den relevanta delen av ljudet för varje karaktär?

En uppmärksamhetsmekanism beräknar vikter över kodartillstånd och bildar en kontextvektor som avkodaren använder vid varje steg.