የድምጽ AI መመሪያ

StyleTTS 2 የቅጥ ስርጭት

StyleTTS 2 የድምፅ 'ዘይቤ'ን - ፕሮሶዲ፣ ስሜትን እና ድምጽ ማጉያ ቲምበርን - እንደ የዘፈቀደ ተለዋዋጭ ከስርጭት ሞዴል ጋር የሚይዝ፣ ከዚያም ድምጽን ከትልቅ የንግግር ቋንቋ ሞዴል ጋር ከተቃራኒ ስልጠና ጋር የሚያዋህድ ከጽሑፍ ወደ ንግግር ሞዴል ነው።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It matters because it reached human-level naturalness on single-speaker benchmarks without needing a reference clip at inference time.

ጥልቅ ዳይቭ

እ.ኤ.አ. በ2023 በኮሎምቢያ ዩኒቨርሲቲ ተመራማሪዎች የተለቀቀው StyleTTS 2 ንግግርን ያመነጫል በመጀመሪያ የተደበቀ 'style vector' በመግቢያው ጽሑፍ ላይ ብቻ የተስተካከለ የማሰራጨት ሂደትን በመጠቀም እና ያንን ዘይቤ እና ፎነሞቹን በሞገድ ቅርፅ በመለየት ነው። የስታይል ቬክተር በጽሁፉ ውስጥ ያልተፃፈውን ነገር ሁሉ ይቆጣጠራል፡ የመናገር ፍጥነት፣ የኢንቶኔሽን ኮንቱር፣ ለአፍታ ማቆም እና ስሜታዊ ቀለም። በወሳኝ መልኩ፣ በትልልቅ ቀድሞ የሰለጠኑ የንግግር ቋንቋ ሞዴሎች (WavLM) እንደ አድሎአዊ የተቃዋሚ ስልጠናን ይጨምራል፣ ውጤቱን ወደ እውነተኛ ሰው-ድምጽ ወደሚሰማ ድምጽ ይገፋፋል። በLJSpeech ቤንችማርክ ላይ በአድማጭ ደረጃ የተሰጡ የሰዎች ቅጂዎችን በልጧል፣ እና በብዙ ተናጋሪው LibriTTS ላይ ከመሠረታዊ እውነት ጋር የተዛመደ ነው - ከጫፍ እስከ ጫፍ የነርቭ ቲኤስ ጥራት ወሳኝ ምዕራፍ።

ቴክኒካዊ ግንዛቤ

ዋናው ብልሃት የስታይል ስርጭት ነው፡ አንድ ቋሚ ፕሮሶዲ ከመተንበይ ይልቅ ስታይልቲቲኤስ 2 ሞዴሎችን ስታይል እንደ ፕሮባቢሊቲ ማከፋፈያ እና ናሙናዎች በዝቅተኛ ልኬት ድብቅ ቦታ ውስጥ በሚሰራ የስርጭት ሞዴል በኩል ናሙናዎች ፣ ስለሆነም ተመሳሳይ አረፍተ ነገር በብዙ ተፈጥሯዊ መንገዶች ሊነገር ይችላል። ከጫፍ እስከ ጫፍ፣ የቆይታ ጊዜ መተንበይ፣ የቅጥ ኢንኮደር፣ ዲኮደር እና በWavLM ላይ የተመሰረተ ተቃራኒ አድሎአዊ በጋራ የሰለጠኑ ሲሆን ይህም ቅልጥፍናዎች ከሞገድ ቅርጽ ጥራት ወደ ሙሉ የቧንቧ መስመር እንዲመለሱ ያስችላቸዋል።

ስልታዊ ተጽእኖ

መድረስ እና መድረስ

በጽሑፍ፣ በትረካ እና በድምፅ በይነገጾች ተደራሽነትን ያሻሽላል።

ወጪ እና በጀት

የሚዲያ ቡድኖች በትንሽ በጀቶች የተጣራ ድምጽ በፍጥነት መላክ ይችላሉ።

ፍጥነት እና ልኬት

ከደንበኛ ጋር የሚገናኙ ስርዓቶች የንግግር ግንኙነቶችን በትልቁ ደረጃ ማካሄድ ይችላሉ።

የStyleTTS 2 ዘይቤ ስርጭት የወደፊት ጊዜ

የቅጥ ስርጭት ከዜሮ-ሾት የድምጽ ክሎኒንግ ጋር እንዲዋሃድ ይጠብቁ ስለዚህ ለጥቂት ሰኮንዶች የማጣቀሻ ኦዲዮ ናሙና የተደረገውን ዘይቤ እንዲመራው እና ፈጣሪዎች ስሜትን ፣ አጽንዖትን ወይም ፍጥነትን በግልፅ እንዲደውሉ በሚያስችል መቆጣጠሪያ መያዣዎች። ፈዘዝ ያሉ ስሪቶች በመሣሪያዎች ላይ በቅጽበት ጥቅም ላይ የሚውሉ ባለብዙ ደረጃ ስርጭት ናሙናዎችን ለመቁረጥ ዓላማ አላቸው። እነዚህ ሞዴሎች የስርጭት ጥራት ላይ ሲደርሱ የውሃ ምልክት ማድረጊያ እና የስምምነት ማረጋገጫ የድምፅ ማጉደል እና ጥልቅ ሀሰተኛ አላግባብ አጠቃቀም ስጋቶችን ለመፍታት መደበኛ ይሆናሉ።

የእውነተኛ-ዓለም አተገባበር

ተመሳሳይ ድምጽ ማጉያ በተፈጥሮ ነጠላ ድምጽ ከማሰማት ይልቅ በምዕራፎች ውስጥ ፕሮሶዲ የሚለዋወጥበት የኦዲዮ መጽሐፍ ትረካ ማመንጨት

በርካታ የድምጽ ተዋናዮችን ሳይቀጥር ለኢንዲ ጨዋታዎች እና አኒሜሽን ገላጭ ገጸ-ባህሪ ድምጾችን ማምረት

ለረጅም ጊዜ ለማዳመጥ በቂ ሰው የሚመስሉ የተደራሽነት ስክሪን አንባቢዎችን ማብቃት።

በተፈጥሮ አፅንዖት እና ከግልጽ የስክሪፕት ጽሁፍ ፍጥነት ጋር የተተረጎሙ ኢ-ትምህርት የድምጽ ማጉሊያዎችን መፍጠር

አደጋዎች እና የጥበቃ መንገዶች

ስምምነት ሲጠፋ የድምፅ አላግባብ መጠቀም እና የማስመሰል አደጋዎች ይጨምራሉ።

ትክክለኛነት በአነጋገር ዘዬዎች፣ ቀበሌኛዎች ወይም ጫጫታ አካባቢዎች ላይ ሊወድቅ ይችላል።

ሰራሽ ኦዲዮ ግልጽ ምልክት ሳይደረግበት ለትክክለኛ ንግግር ሊሳሳት ይችላል።

የትግበራ ፍኖተ ካርታ

1

ለድምጽ ቀረጻ፣ ክሎኒንግ እና እንደገና ጥቅም ላይ ለማዋል ግልጽ የሆነ ፈቃድ ያግኙ።

2

በተለያዩ የድምጽ ማጉያዎች እና የበስተጀርባ ሁኔታዎች ላይ ጥራትን ይሞክሩ።

3

አንድ ሰው መቼ ውጤቶችን መገምገም ወይም ማጽደቅ እንዳለበት ይግለጹ።

4

ሰው ሰራሽ ኦዲዮን ይሰይሙ እና ለተጠያቂነት የፕሮቨንስ መዝገቦችን ያስቀምጡ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the StyleTTS 2 Style Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

Riffusion Spectrogram ስርጭት

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is StyleTTS 2 Style Diffusion?

StyleTTS 2 የድምፅ 'ዘይቤ'ን - ፕሮሶዲ፣ ስሜትን እና ድምጽ ማጉያ ቲምበርን - እንደ የዘፈቀደ ተለዋዋጭ ከስርጭት ሞዴል ጋር የሚይዝ፣ ከዚያም ድምጽን ከትልቅ የንግግር ቋንቋ ሞዴል ጋር ከተቃራኒ ስልጠና ጋር የሚያዋህድ ከጽሑፍ ወደ ንግግር ሞዴል ነው። በነጠላ-ተናጋሪ መለኪያዎች ላይ በሰዎች ደረጃ ተፈጥሯዊነት ላይ ስለደረሰ አስፈላጊ ነው ምክንያቱም በማጣቀሻ ጊዜ የማጣቀሻ ቅንጥብ ሳያስፈልገው።

የማሰራጨት ሂደትን በመጠቀም StyleTTS 2 ሞዴል ምንድ ነው?

StyleTTS 2 ዝቅተኛ-ልኬት ቬክተር ከስርጭት ሞዴል ጋር ናሙናዎችን ያቀርባል፣ በፅሁፉ ያልተገለፁ ፕሮሶዲ፣ ስሜት እና የድምጽ ማጉያ ባህሪያትን ይይዛል።

በStyleTTS 2 ውስጥ የትኛው ቅድመ-የሰለጠነ የንግግር ሞዴል እንደ ተቃዋሚ አድልዎ ጥቅም ላይ ይውላል?

StyleTTS 2 ውጽዓቶችን ወደ ሰው ድምጽ ወደሚሰማ ድምጽ ለመግፋት በተቃዋሚ ስልጠና ላይ እንደ WavLM ያሉ ትላልቅ የንግግር ቋንቋ ሞዴሎችን ይጠቀማል።

ለምን StyleTTS 2 በብዙ ተፈጥሯዊ መንገዶች አንድ አይነት ዓረፍተ ነገር ሊናገር ይችላል?

ዘይቤ እንደ የዘፈቀደ ተለዋዋጭ ስለሚታይ እና በስርጭት ናሙና ስለሚወሰድ እያንዳንዱ ትውልድ ለተመሳሳይ ጽሁፍ የተለየ ነገር ግን ተፈጥሯዊ ፕሮሶዲ መፍጠር ይችላል።

ስታይልቲቲኤስ 2 በሰዎች የተቀዳው በአድማጭ ደረጃ የተቀዳው በየትኛው ነጠላ ተናጋሪ መለኪያ ላይ ነው?

በLJSpeech ቤንችማርክ ላይ፣ StyleTTS 2 ከሰው መሬት-እውነት ቅጂዎች የሚበልጡ የአድማጭ ተፈጥሯዊነት ደረጃዎችን አግኝቷል።

'ከጫፍ እስከ ጫፍ' ስልጠና ለStyleTTS 2 ምን ይሰጣል?

የጋራ ከጫፍ እስከ ጫፍ ያለው ስልጠና በመጨረሻው የድምጽ ጥራት ላይ ያለው ኪሳራ የቆይታ ጊዜ ትንበያን፣ የቅጥ ኢንኮደርን እና ዲኮደርን በተናጥል ደረጃዎች ሳይሆን በአንድ ላይ እንዲያዘምን ያስችለዋል።