Аудио AI РЪКОВОДСТВО

Слушайте, посещавайте и сричайте

Listen, Attend and Spell (LAS) е забележителна невронна мрежа от 2015 г., която транскрибира реч директно в знаци, без ръчно изграден речник за произношение или отделен езиков модел.

2 min readПоследна актуализация

Преглед

It showed that a single end-to-end model could do speech recognition.

Дълбоко гмуркане

Listen, Attend and Spell, представен от Google изследователите Chan, Jaitly, Le и Vinyals през 2015 г., беше един от първите истински разпознаватели на реч от край до край. Той има две части: „Слушател“, пирамидален двупосочен LSTM, който кодира аудиото, като същевременно свива измерението на времето, и „Слушател“, базиран на внимание LSTM декодер, който излъчва символи един по един. Механизмът за внимание позволява на Speller да се съсредоточи върху съответния фрагмент от аудио за всяка изходна буква. За разлика от по-старите конвейери на HMM-DNN, LAS не се нуждае от фонемен речник, без принудително подравняване и без отделно обучен езиков модел; той научава правописа, границите на думите и акустиката съвместно от транскрибирано аудио. Той директно вдъхнови съвременните ASR системи от последователност към последователност и базирани на вниманието.

Техническа информация

LAS съчетава енкодер-декодер с внимание. Пирамидалният LSTM енкодер намалява наполовина времевата разделителна способност на всеки от трите слоя, нарязвайки дълга акустична последователност на управляема дължина, така че вниманието да е податливо. При всяка стъпка на декодиране Speller изчислява тежести на вниманието за всички състояния на енкодера, смесва ги в контекстен вектор и предвижда следващия знак. Обучението увеличава максимално вероятността за правилната последователност от знаци; трик с планирано вземане на проби намалява несъответствието между влака и теста.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на слушането, присъствието и правописа

LAS вече е историческа, но нейното ДНК преминава през всяка съвременна ASR система. Неговата идея за енкодер-декодер, базиран на вниманието, еволюира в Transformer и Conformer разпознаватели, докато свързани подходи като RNN-Transducer захранване на устройството диктовка. Бъдещите системи продължават тази траектория от край до край, сливайки разпознаването с превода и разбирането в единични многоезични модели и насочвайки се към стрийминг, транскрипция с ниска латентност, която LAS, тъй като не е стрийминг, първоначално не може да осигури.

Внедряване в реалния свят

Транскрибиране на говорим английски директно в букви без речник за произношение

Служи като концептуална основа за базирани на внимание гласови диктовки и системи за надписи

Демонстриране на обучение от край до край за академична курсова работа и показатели за разпознаване на реч

Вдъхновяващи модели от последователност до последователност, използвани по-късно в конвейери за превод на реч

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Listen Attend and Spell quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Автоматично маркиране на музика

Frequently asked questions

What is Listen Attend and Spell?

Listen, Attend and Spell (LAS) е забележителна невронна мрежа от 2015 г., която транскрибира реч директно в знаци, без ръчно изграден речник за произношение или отделен езиков модел. Той показа, че един модел от край до край може да направи разпознаване на реч.

Кои са двата основни компонента на модела LAS?

LAS се състои от енкодер „Listener“, който обработва аудиото, и декодер, базиран на вниманието „Speller“, който излъчва знаци.

Какво извежда Speller в LAS?

Speller е декодер, който произвежда транскрипция символ по знак, научавайки директно правописа.

Защо LAS енкодерът се нарича "пирамидален"?

Всеки слой на пирамидалния BLSTM намалява наполовина дължината на последователността, скъсявайки дългата аудио последователност, така че вниманието е изчислително възможно.

Какъв по-стар компонент НЕ изисква LAS?

За разлика от класическите канали на HMM-DNN, LAS се учи директно от двойки аудио към текст без речник на фонемите или принудително подравняване.

Кой механизъм позволява на Speller да се фокусира върху съответната част от звука за всеки знак?

Механизъм за внимание изчислява теглата върху състоянията на енкодера, образувайки контекстен вектор, който декодерът използва на всяка стъпка.