የድምጽ AI መመሪያ

ያዳምጡ ተገኝ እና ፊደል

ያዳምጡ፣ ይከታተሉ እና ሆሄ (LAS) ንግግርን በቀጥታ ወደ ገፀ-ባህሪያት የሚገለብጥ የ2015 ዋና ምልክት ነው፣ ምንም በእጅ የተሰራ የአነባበብ መዝገበ ቃላት ወይም የተለየ የቋንቋ ሞዴል የለውም።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It showed that a single end-to-end model could do speech recognition.

ጥልቅ ዳይቭ

በGoogle ተመራማሪዎች ቻን፣ ጃይትሊ፣ ሌ እና ቪንያልስ በ2015 ያስተዋወቀው ያዳምጡ፣ ይከታተሉ እና ፊደል ይናገሩ፣ ከመጀመሪያዎቹ እውነተኛ ከጫፍ እስከ ጫፍ የንግግር መለያዎች አንዱ ነበር። ሁለት ክፍሎች አሉት፡- 'አድማጭ'፣ የፒራሚዳል ባለሁለት አቅጣጫዊ LSTM ኦዲዮውን የሰዓት ልኬት እየጠበበ በኮድ እና 'Speller' ትኩረትን ላይ የተመሰረተ LSTM ዲኮደር በአንድ ጊዜ ቁምፊዎችን ያስወጣል። የትኩረት ዘዴው ስፔለር ለእያንዳንዱ የውጤት ደብዳቤ በሚመለከተው የድምጽ ቁራጭ ላይ እንዲያተኩር ያስችለዋል። እንደ አሮጌው የኤች.ኤም.ኤም.ኤም.ኤን.ኤን.ኤን.ኤን የቧንቧ መስመሮች በተለየ፣ LAS ምንም የስልክ መዝገበ ቃላት፣ የግዳጅ አሰላለፍ እና የተለየ የሰለጠነ የቋንቋ ሞዴል አያስፈልገውም። ፊደል፣ የቃላት ወሰኖች እና አኮስቲክስ ከተገለበጠ ድምጽ ይማራል። ዘመናዊ ቅደም ተከተል-ወደ-ቅደም ተከተል እና ትኩረትን መሰረት ያደረገ የ ASR ስርዓቶችን በቀጥታ አነሳሳ.

ቴክኒካዊ ግንዛቤ

ላስ ኢንኮደር ዲኮደርን ከትኩረት ጋር ያጣምራል። የፒራሚዳል LSTM ኢንኮደር በእያንዳንዱ ሶስት እርከኖች ላይ ያለውን የጊዜ መፍታት በግማሽ ይቀንሳል፣ ረጅም የአኮስቲክ ቅደም ተከተል ወደ ሚተዳደር ርዝመት በመቁረጥ ትኩረትን ይስባል። በእያንዳንዱ የመግለጫ ደረጃ ስፔለር በሁሉም የመቀየሪያ ግዛቶች ላይ የትኩረት ክብደት ያሰላል፣ ወደ አውድ ቬክተር ያዋህዳቸዋል እና የሚቀጥለውን ገጸ ባህሪ ይተነብያል። ስልጠና ትክክለኛ የቁምፊ ቅደም ተከተል የመሆን እድልን ከፍ ያደርገዋል; የታቀደው ናሙና ዘዴ የባቡር/የሙከራ አለመመጣጠን ይቀንሳል።

ስልታዊ ተጽእኖ

መድረስ እና መድረስ

በጽሑፍ፣ በትረካ እና በድምፅ በይነገጾች ተደራሽነትን ያሻሽላል።

ወጪ እና በጀት

የሚዲያ ቡድኖች በትንሽ በጀቶች የተጣራ ድምጽ በፍጥነት መላክ ይችላሉ።

ፍጥነት እና ልኬት

ከደንበኛ ጋር የሚገናኙ ስርዓቶች የንግግር ግንኙነቶችን በትልቁ ደረጃ ማካሄድ ይችላሉ።

የማዳመጥ እና የፊደል አጻጻፍ የወደፊት ዕጣ ፈንታ

ላስ አሁን ታሪካዊ ነው፣ ነገር ግን ዲ ኤን ኤው በሁሉም ዘመናዊ የASR ስርዓት ውስጥ ያልፋል። ትኩረትን መሰረት ያደረገ ኢንኮደር-ዲኮደር ሃሳቡ ወደ ትራንስፎርመር እና ኮንፎርመር ማወቂያዎች ተቀየረ፣ ተዛማጅ አቀራረቦች ደግሞ እንደ RNN-Transducer power on-divice. የወደፊቱ ስርዓቶች ይህንን ከጫፍ እስከ ጫፍ ያለውን አካሄድ ይቀጥላሉ። በነጠላ ብዙ ቋንቋዎች ሞዴሎች ውስጥ ከትርጉም እና ግንዛቤ ጋር በመቀላቀል እና ወደ ዥረት መግፋት፣ ዝቅተኛ መዘግየት ወደ ጽሑፍ ግልባጭ በመግፋት LAS ዥረት ያልሆነ በመሆኑ በመጀመሪያ ማቅረብ አልቻለም።

የእውነተኛ-ዓለም አተገባበር

ያለ አጠራር መዝገበ ቃላት በቀጥታ የሚነገር እንግሊዝኛን ወደ ፊደሎች መገልበጥ

በትኩረት ላይ ለተመሰረተ የድምፅ ቃላቶች እና የመግለጫ ፅሁፎች ስርዓቶች እንደ ሃሳባዊ መሰረት ሆኖ ማገልገል

ለአካዳሚክ የንግግር እውቅና ኮርስ ስራ እና መለኪያዎች ከጫፍ እስከ ጫፍ ስልጠናን ማሳየት

አነቃቂ ተከታታይ-ወደ-ቅደም ተከተል ሞዴሎች በኋላ በንግግር መተርጎም ቧንቧዎች ውስጥ ጥቅም ላይ ይውላሉ

አደጋዎች እና የጥበቃ መንገዶች

ስምምነት ሲጠፋ የድምፅ አላግባብ መጠቀም እና የማስመሰል አደጋዎች ይጨምራሉ።

ትክክለኛነት በአነጋገር ዘዬዎች፣ ቀበሌኛዎች ወይም ጫጫታ አካባቢዎች ላይ ሊወድቅ ይችላል።

ሰራሽ ኦዲዮ ግልጽ ምልክት ሳይደረግበት ለትክክለኛ ንግግር ሊሳሳት ይችላል።

የትግበራ ፍኖተ ካርታ

1

ለድምጽ ቀረጻ፣ ክሎኒንግ እና እንደገና ጥቅም ላይ ለማዋል ግልጽ የሆነ ፈቃድ ያግኙ።

2

በተለያዩ የድምጽ ማጉያዎች እና የበስተጀርባ ሁኔታዎች ላይ ጥራትን ይሞክሩ።

3

አንድ ሰው መቼ ውጤቶችን መገምገም ወይም ማጽደቅ እንዳለበት ይግለጹ።

4

ሰው ሰራሽ ኦዲዮን ይሰይሙ እና ለተጠያቂነት የፕሮቨንስ መዝገቦችን ያስቀምጡ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Listen Attend and Spell quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

ሙዚቃ በራስ-መለያ መስጠት

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is Listen Attend and Spell?

ያዳምጡ፣ ይከታተሉ እና ሆሄ (LAS) ንግግርን በቀጥታ ወደ ገፀ-ባህሪያት የሚገለብጥ የ2015 ዋና ምልክት ነው፣ ምንም በእጅ የተሰራ የአነባበብ መዝገበ ቃላት ወይም የተለየ የቋንቋ ሞዴል የለውም። አንድ ነጠላ ከጫፍ እስከ ጫፍ ሞዴል የንግግር ማወቂያን ሊያደርግ እንደሚችል አሳይቷል.

የLAS ሞዴል ሁለት ዋና ዋና ክፍሎች ምንድናቸው?

ላስ ኦዲዮውን የሚያስኬድ 'አድማጭ' ኢንኮደር እና 'Speller' ትኩረትን መሰረት ያደረገ ቁምፊዎችን የሚያወጣ ዲኮደር ይዟል።

ስፔለር በLAS ውስጥ ምን ያደርጋል?

ስፔለር የፊደል አጻጻፍን በቀጥታ የሚማር የጽሑፍ ግልባጭ ገጸ ባህሪን በባህሪ የሚያወጣ ዲኮደር ነው።

የLAS ኢንኮደር ለምን 'ፒራሚዳል' ይባላል?

እያንዳንዱ የፒራሚዳል BLSTM ንብርብር የተከታታይ ርዝመቱን በግማሽ ይቀንሳል፣ ረጅሙን የኦዲዮ ቅደም ተከተል ያሳጥራል ስለዚህ ትኩረት በስሌት የሚቻል ነው።

ላስ በተለይ የማይፈልገው የትኛውን የቆየ አካል ነው?

እንደ ክላሲክ ኤችኤምኤም-ዲኤንኤን የቧንቧ መስመሮች፣ ላስ ምንም የስልክ መዝገበ ቃላት ወይም የግዳጅ አሰላለፍ ከሌለው ከድምጽ ወደ ጽሑፍ ጥንዶች በቀጥታ ይማራል።

ስፔለር ለእያንዳንዱ ቁምፊ ተገቢ በሆነው የድምጽ ክፍል ላይ እንዲያተኩር የሚያደርገው የትኛው ዘዴ ነው?

የትኩረት ዘዴ ክብደቶችን በኤንኮደር ግዛቶች ላይ ያሰላል፣ ይህም በእያንዳንዱ ደረጃ ዲኮደሩ የሚጠቀምበትን አውድ ቬክተር ይፈጥራል።