NaturalSpeech እና ድብቅ ስርጭት TTS
NaturalSpeech በሰው ደረጃ የንግግር ጥራት ላይ ያተኮረ የMicrosoft TTS ምርምር መስመር ነው፣ በኋለኛው እትሞች የበለፀጉ ተፈጥሯዊ ድምጾችን ለማመንጨት ድብቅ ስርጭትን በመጠቀም።
አጠቃላይ እይታ
It shows how diffusion models, famous for images, can produce expressive, controllable audio.
ጥልቅ ዳይቭ
የመጀመሪያው NaturalSpeech (2022) በ LJSpeech መለኪያ ላይ በሰው ደረጃ ጥራት ላይ ለመድረስ የተዘገበው የመጀመሪያው ሥርዓት ነው፣ ከእውነተኛ ቅጂዎች በአስተማማኝ ሁኔታ ሊለዩት በማይችሉ አድማጮች የተፈረደ ነው። በሥልጠና እና በመረጃ መካከል ያለውን ክፍተት ለመዝጋት በጥንቃቄ የተገጣጠሙ ቀዳሚዎች ያለው ተለዋዋጭ አውቶኢንኮደር ተጠቅሟል። NaturalSpeech 2 ከዚያም ስውር ስርጭትን ያዘ፡ ንግግር በነርቭ ኦዲዮ ኮድ ወደ ተከታታይ ድብቅ ቬክተሮች ተቀይሯል፣ እና ስርጭት ሞዴል እነዚያን ድብቅ ነገሮች ከጽሁፍ ለማመንጨት ይማራል፣ ይህም ከአጭር ጊዜ ፈጣን በሆነ ፍጥነት በዜሮ የተተኮሰ የድምፅ ክሎኒንግ እንዲኖር ያስችላል። NaturalSpeech 3 ንግግሮችን ወደ ተለያዩ ባህሪያት እንደ ይዘት፣ ፕሮሶዲ፣ ቲምብር እና አኮስቲክ ዝርዝር በመለየት ፋክተዝዝድ ስርጭትን አስተዋውቋል፣ ስለዚህ እያንዳንዱ ለከፍተኛ ታማኝነት እና ተለዋዋጭነት ለብቻው ተቀርጾ እና ቁጥጥር ሊደረግበት ይችላል።
ቴክኒካዊ ግንዛቤ
ድብቅ ስርጭት የሚሠራው ጫጫታ ወደ ውሱን የድብቅ ንግግር ውክልና በመጨመር እና ጫጫታውን ደረጃ በደረጃ ለመቀልበስ ኔትወርክን በማሰልጠን ነው። ኔቸርSpeech 2 ጥሬ ሞገዶችን ወይም ሙሉ ስፔክትሮግራሞችን ከመጥቀስ ይልቅ ዝቅተኛ መጠን ያላቸው እና ለመቅረጽ ቀላል የሆኑትን የኮዴክ ድብቅ ምስሎችን ውድቅ ያደርጋል። በጽሑፍ እና በማጣቀሻ የድምፅ መጠየቂያ ላይ ማቀዝቀዝ የተገላቢጦሽ ስርጭትን ይመራዋል፣ ስለዚህ የመጨረሻዎቹ ናሙናዎች ድብቅ ምስሎች ከተጠየቀው ይዘት እና የተናጋሪ ማንነት ጋር የሚዛመድ ወደ ንግግር ይለያሉ።
ስልታዊ ተጽእኖ
መድረስ እና መድረስ
በጽሑፍ፣ በትረካ እና በድምፅ በይነገጾች ተደራሽነትን ያሻሽላል።
ወጪ እና በጀት
የሚዲያ ቡድኖች በትንሽ በጀቶች የተጣራ ድምጽ በፍጥነት መላክ ይችላሉ።
ፍጥነት እና ልኬት
ከደንበኛ ጋር የሚገናኙ ስርዓቶች የንግግር ግንኙነቶችን በትልቁ ደረጃ ማካሄድ ይችላሉ።
የወደፊቱ የተፈጥሮ ንግግር እና ድብቅ ስርጭት TTS
በስርጭት ላይ የተመሰረተ እና የተመረተ TTS የሚያመለክተው ተፈጥሯዊ ብቻ ሳይሆኑ በጥሩ ሁኔታ ሊንቀሳቀሱ ወደሚችሉ ድምጾች ነው፣ ይህም ተጠቃሚዎች ቲምበርን፣ ስሜትን እና ፕሮሶዲንን እንደ ገለልተኛ መደወያዎች እንዲያስተካክሉ ያስችላቸዋል። ፈጣን ናሙናን በማጣራት እና በጥቂት-ደረጃ ስርጭት፣ ከሴኮንዶች ድምጽ ጠንከር ያለ ዜሮ-ሾት ክሎኒንግ እና ከትላልቅ የቋንቋ ሞዴሎች ጋር በዐውደ-ጽሑፉ ላይ ግንዛቤን ለማስጨበጥ ይጠብቁ። ከፍተኛ ታማኝነት ያለው ክሎኒንግ ግልጽ አላግባብ የመጠቀም አደጋዎችን ስለሚያመጣ እነዚህ እድገቶች የውሃ ምልክት ማድረግን እና የስምምነት መከላከያዎችን አስፈላጊነት ያጠናክራሉ።
የእውነተኛ-ዓለም አተገባበር
የዳቢንግ ስቱዲዮዎች NaturalSpeech 2-style zero-shot cloningን በመጠቀም ፊልሞችን አከባቢያዊ ለማድረግ የአንድን ተዋንያን ድምጽ ከአጭር ናሙና ጠርዘዋል።
የኦዲዮ መጽሐፍ መድረኮች አድማጮች ከእውነተኛ የድምጽ ችሎታ ለመለየት የሚታገሉ የሰው ደረጃ ትረካ ያመነጫሉ።
የተደራሽነት መሳሪያዎች ንግግራቸውን ላጡ ሰዎች ከአሮጌ ቅጂዎች የአንድን ሰው ድምጽ እንደገና ይፈጥራሉ።
የይዘት ፈጠራ ስብስቦች አዘጋጆች በተናጥል ቲምበር እና ፕሮሶዲ እንዲያስተካክሉ ያስችላቸዋል ፣የተፈጥሮSpeech 3 ፋብራዊ ባህሪያትን በመጠቀም።
አደጋዎች እና የጥበቃ መንገዶች
ስምምነት ሲጠፋ የድምፅ አላግባብ መጠቀም እና የማስመሰል አደጋዎች ይጨምራሉ።
ትክክለኛነት በአነጋገር ዘዬዎች፣ ቀበሌኛዎች ወይም ጫጫታ አካባቢዎች ላይ ሊወድቅ ይችላል።
ሰራሽ ኦዲዮ ግልጽ ምልክት ሳይደረግበት ለትክክለኛ ንግግር ሊሳሳት ይችላል።
የትግበራ ፍኖተ ካርታ
ለድምጽ ቀረጻ፣ ክሎኒንግ እና እንደገና ጥቅም ላይ ለማዋል ግልጽ የሆነ ፈቃድ ያግኙ።
በተለያዩ የድምጽ ማጉያዎች እና የበስተጀርባ ሁኔታዎች ላይ ጥራትን ይሞክሩ።
አንድ ሰው መቼ ውጤቶችን መገምገም ወይም ማጽደቅ እንዳለበት ይግለጹ።
ሰው ሰራሽ ኦዲዮን ይሰይሙ እና ለተጠያቂነት የፕሮቨንስ መዝገቦችን ያስቀምጡ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the NaturalSpeech and Latent Diffusion TTS quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
የተረጋጋ የድምጽ ድብቅ ስርጭት
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is NaturalSpeech and Latent Diffusion TTS?
NaturalSpeech በሰው ደረጃ የንግግር ጥራት ላይ ያተኮረ የMicrosoft TTS ምርምር መስመር ነው፣ በኋለኛው እትሞች የበለፀጉ ተፈጥሯዊ ድምጾችን ለማመንጨት ድብቅ ስርጭትን በመጠቀም። በምስሎች ዝነኛ የሆኑት የስርጭት ሞዴሎች እንዴት ገላጭ እና መቆጣጠር የሚችል ኦዲዮን መፍጠር እንደሚችሉ ያሳያል።
የመጀመሪያው NaturalSpeech (2022) ምን ደረጃ ላይ እንደደረሰ ሪፖርት ተደርጓል?
NaturalSpeech በLJSpeech ላይ የሰው ደረጃ ላይ ለመድረስ የመጀመሪያው ስርዓት ተብሎ ተዘግቧል፣ አድማጮች ከእውነተኛ ንግግር ሊለዩት ባለመቻላቸው።
የ NaturalSpeech 2 ድብቅ ስርጭት ሞዴል ምን ያመነጫል?
NaturalSpeech 2 ከጥሬ ሞገድ ቅርጾች ይልቅ ጥቅጥቅ ያሉ እና ለመቅረጽ ቀላል በሆኑ በኮዴክ ላተንቶች ላይ ይሰራጫል።
የስርጭት ሞዴል በከፍተኛ ደረጃ መረጃን እንዴት ያመነጫል?
ስርጭቱ በስልጠና ወቅት ድምጽን ይጨምራል እና መቀልበስን ይማራል፣ ከዘፈቀደ ድምጽ ቀስ በቀስ በመቃወም ናሙናዎችን ያመነጫል።
ምን ቁልፍ አቅም ድብቅ ስርጭት NaturalSpeech 2 ይሰጣል?
NaturalSpeech 2 አጭር የድምጽ መጠየቂያን በማስተካከል በግልጽ የሰለጠነውን የተናጋሪውን ድምጽ ሊዘጋው ይችላል።
የ NaturalSpeech 3's 'factorized diffusion' ማዕከላዊ ሀሳብ ምንድን ነው?
የተከፋፈለ ስርጭት ይዘትን፣ ፕሮሶዲን፣ ቲምበሬን እና አኮስቲክ ዝርዝርን ይከፋፍላል ስለዚህም እያንዳንዱ ባህሪ በተናጠል እንዲቀረጽ እና እንዲቆጣጠር።