የድምጽ AI መመሪያ

VALL-E እና የኮዴክ ቋንቋ ሞዴሎች

VALL-E የተሻሻለ ጽሑፍ-ወደ-ንግግር እንደ የቋንቋ ሞዴሊንግ ችግር በድምጽ ኮዴክ ቶከኖች ላይ፣ የድምጽ ክሎኒንግን ከናሙና ከሦስት ሰከንድ ብቻ አስችሏል።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

ተመሳሳይ ቀጣይ-ቶከን ትንበያ የጽሑፍ LLMs በሚያስደንቅ ሁኔታ ተፈጥሯዊ፣ ገላጭ ንግግርን ሊያመነጭ እንደሚችል አሳይቷል።

ጥልቅ ዳይቭ

በ2023 መጀመሪያ ላይ በMicrosoft የተገለጸው VALL-E የንግግር ውህደትን እንደ የቋንቋ ሞዴሊንግ ይመለከታል። ስፔክትሮግራም ከመተንበይ ይልቅ የነርቭ ኮዴክን (ኢንኮዴክ) ልዩ አኮስቲክ ቶከን ይተነብያል፣ ስለዚህ ትውልድ በድምጽ መዝገበ-ቃላት ላይ ቀጣይ-ቶከን ትንበያ ይሆናል። የማይታይ ድምጽ ማጉያ የ3 ሰከንድ ቀረጻ እና የዒላማ ጽሑፍ ከተሰጠው፣ VALL-E በተናጋሪው ድምጽ ውስጥ ይቀጥላል፣ እንጨትን እና የአኮስቲክ አካባቢን ጭምር ይጠብቃል። በ60,000 ሰአታት ንግግር ላይ የሰለጠነው፣ ከተለመዱት የTTS የመረጃ ስብስቦች እጅግ የላቀ፣ ይህም ጠንካራ ዜሮ-ሾት ክሎኒንግ እንዲሆን አድርጎታል። የኮዴክ ቶከኖች ተደራራቢ ስለሆኑ (በአርቪኪው በኩል)፣ VALL-E ሁለት ደረጃዎችን ይጠቀማል፡- autoregressive ሞዴል የመጀመሪያውን ይተነብያል፣ ጥቅጥቅ ያለ የማስመሰያ ዥረት በጥያቄው ላይ ተስተካክሏል፣ እና ራስ-ሰር ያልሆነ ሞዴል ቀሪዎቹን ዝርዝር ቶከኖች ይሞላል። ይህ የኮዴክ-ኤልኤም አዘገጃጀት እንደ VALL-E 2 ያሉ ተተኪዎችን እና ብዙ የንግግር መሰረት ሞዴሎችን አነሳስቷል።

ቴክኒካዊ ግንዛቤ

ዘዴው በተዋረድ ኮዴክ ቶከኖች ላይ ዲቃላ መፍታት ነው። የ autoregressive ደረጃ በጣም አስፈላጊ የሆነውን የመጀመሪያ-የኮድ ደብተር ቶከኖች አንድ በአንድ ይተነብያል፣ ፕሮሶዲ እና ይዘትን ይይዛል። ቀሪዎቹ የኮድ ደብተሮች፣ ጥሩ አኮስቲክ ዝርዝርን ይጨምራሉ፣ በአንደኛው ዥረት እና በተናጋሪው መጠየቂያ ላይ በተስተካከለ ራስ-ሰር ባልሆነ ሞዴል በትይዩ ይተነብያሉ። ይህ ክፍፍል እያንዳንዱን ቶከን በቅደም ተከተል የማመንጨት ወጪን በማስወገድ ጥራትን ከፍ ያደርገዋል እና ኮዴክ መጠቀም ማለት ንግግር እና ጽሑፍ በተመሳሳይ ትራንስፎርመር ማሽነሪዎች ሊቀረጹ ይችላሉ።

ስልታዊ ተጽእኖ

መድረስ እና መድረስ

በጽሑፍ፣ በትረካ እና በድምፅ በይነገጾች ተደራሽነትን ያሻሽላል።

ወጪ እና በጀት

የሚዲያ ቡድኖች በትንሽ በጀቶች የተጣራ ድምጽ በፍጥነት መላክ ይችላሉ።

ፍጥነት እና ልኬት

ከደንበኛ ጋር የሚገናኙ ስርዓቶች የንግግር ግንኙነቶችን በትልቁ ደረጃ ማካሄድ ይችላሉ።

የVALL-E እና የኮዴክ ቋንቋ ሞዴሎች የወደፊት ዕጣ

የኮዴክ ቋንቋ ሞዴሎች ንግግርን ከትልቅ የቋንቋ ሞዴሎች ጋር በማዋሃድ በአንድ ሞዴል ወደሚሰሙት፣ ወደሚያስቡ እና ወደ ሚናገሩ የተዋሃዱ ስርዓቶች እየጠቆሙ ነው። የተሻለ መረጋጋት እና ጥቂት ቅርሶች፣ የእውነተኛ ጊዜ ዥረት ማመንጨት እና በስሜታዊነት እና ዘይቤ ላይ ጥብቅ ቁጥጥርን ይጠብቁ። VALL-Eን ለተደራሽነት እና ለደብዳቤ ጠቃሚ የሚያደርገው ተመሳሳይ ኃይለኛ ክሎኒንግ ጥልቅ የውሸት እና የስምምነት ስጋቶችን ያስነሳል፣ ስለዚህ የውሃ ምልክት ማድረግ፣ የድምጽ ማረጋገጫ ጥበቃዎች እና የፖሊሲ ጥበቃዎች እነዚህ ስርዓቶች እንዴት እንደሚተገበሩ ዋና አካል እየሆኑ ነው።

የእውነተኛ-ዓለም አተገባበር

ከጥቂት ሴኮንዶች ኦዲዮ ድምጽን ለግል የተበጁ ረዳቶች ወይም የተደራሽነት መሣሪያዎችን መዝጋት

ዋናውን የተናጋሪውን ግንድ እየጠበቀ ቪዲዮን ወደ ሌሎች ቋንቋዎች መገልበጥ እና መገልበጥ

የቀረጻውን አኮስቲክ አካባቢ የሚጠብቅ ገላጭ፣ ከአውድ ጋር የሚዛመድ ትረካ በማመንጨት ላይ

የንግግር ድምጽን በሚረዱ እና በሚፈጥሩ መልቲሞዳል ረዳቶች ውስጥ እንደ የንግግር የጀርባ አጥንት ሆኖ ማገልገል

አደጋዎች እና የጥበቃ መንገዶች

ስምምነት ሲጠፋ የድምፅ አላግባብ መጠቀም እና የማስመሰል አደጋዎች ይጨምራሉ።

ትክክለኛነት በአነጋገር ዘዬዎች፣ ቀበሌኛዎች ወይም ጫጫታ አካባቢዎች ላይ ሊወድቅ ይችላል።

ሰራሽ ኦዲዮ ግልጽ ምልክት ሳይደረግበት ለትክክለኛ ንግግር ሊሳሳት ይችላል።

የትግበራ ፍኖተ ካርታ

1

ለድምጽ ቀረጻ፣ ክሎኒንግ እና እንደገና ጥቅም ላይ ለማዋል ግልጽ የሆነ ፈቃድ ያግኙ።

2

በተለያዩ የድምጽ ማጉያዎች እና የበስተጀርባ ሁኔታዎች ላይ ጥራትን ይሞክሩ።

3

አንድ ሰው መቼ ውጤቶችን መገምገም ወይም ማጽደቅ እንዳለበት ይግለጹ።

4

ሰው ሰራሽ ኦዲዮን ይሰይሙ እና ለተጠያቂነት የፕሮቨንስ መዝገቦችን ያስቀምጡ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VALL-E and Codec Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

ትልቅ የቋንቋ ሞዴሎች ድንገተኛ ችሎታዎች

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

VALL-E እና የኮዴክ ቋንቋ ሞዴሎች ምንድን ናቸው?

VALL-E የተሻሻለ ጽሑፍ-ወደ-ንግግር እንደ የቋንቋ ሞዴሊንግ ችግር በድምጽ ኮዴክ ቶከኖች ላይ፣ የድምጽ ክሎኒንግን ከናሙና ከሦስት ሰከንድ ብቻ አስችሏል። ተመሳሳይ ቀጣይ-ቶከን የትንበያ ኃይል ሰጪ ጽሑፍ LLMs በሚያስደንቅ ሁኔታ ተፈጥሯዊ፣ ገላጭ ንግግር ማመንጨት እንደሚችል አሳይቷል።

VALL-Eን ከቀደምት የጽሑፍ-ወደ-ንግግር ሥርዓቶች የሚለየው የትኛው ዋና ሐሳብ ነው?

VALL-E የንግግር ማመንጨትን እንደ የቋንቋ ሞዴል በመመልከት TTSን እንደ ቀጣይ ማስመሰያ ትንበያ በልዩ የድምፅ ኮድ ቶከኖች ያዘጋጃል።

አዲስ የተናጋሪ ድምጽ ለመዝጋት VALL-E ምን ያህል ማጣቀሻ ኦዲዮ ያስፈልገዋል?

VALL-E ከማይታየው የድምጽ ማጉያ በግምት 3 ሰከንድ ናሙና ዜሮ-ሾት የድምጽ ክሎኒንግ ማከናወን ይችላል።

VALL-E የኦዲዮ ቶከኖቹን ለማምረት የትኛውን የነርቭ ኮዴክ ይጠቀማል?

VALL-E በMeta's EnCodec ላይ ይገነባል፣ ንግግርን ለማዋሃድ ልዩ የሆኑ የአኮስቲክ ቶከኖቹን ይተነብያል።

ለምንድነው VALL-E ሁለቱንም አውቶሪግሬሲቭ እና ራስ-ሰር ያልሆነ ደረጃን የሚጠቀመው?

የኮዴክ ቶከኖች በ RVQ በኩል ተዋረድ ናቸው; VALL-E የመጀመሪያውን ሻካራ ዥረት በራስ-ሰር ይተነብያል እና የተቀረው ዝርዝር ቶከኖች በትይዩ ለውጤታማነት።

ጠንካራ ዜሮ-ሾት ክሎኒንግ በማንቃት VALL-E ምን ያህል የንግግር መረጃ ሰለጠነ?

VALL-E በ60,000 ሰአታት ንግግር ላይ የሰለጠነው፣ ከተለመዱት የTTS የመረጃ ስብስቦች እጅግ የላቀ ነው፣ ይህም የዜሮ-ሾት አጠቃላይነቱን ከፍ አድርጓል።