የድምጽ AI መመሪያ

SoundStorm ትይዩ ኦዲዮ ትውልድ

ሳውንድ ስቶርም Google ኦዲዮ ትውልድ ሞዴል ሲሆን ንግግር እና ድምጽ በአንድ ጊዜ ከአንድ ቶከን ይልቅ በትይዩ የሚያሰራ ሲሆን ይህም ከፍተኛ ጥራት ያለው የድምጽ ውህደት በሚያስደንቅ ሁኔታ ፈጣን ያደርገዋል።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It matters because it cuts generation latency for long clips from minutes to seconds without sacrificing fidelity.

ጥልቅ ዳይቭ

በ2023 በGoogle የተዋወቀው ሳውንድ ስቶርም እንደ ዲስትሪክት አኮስቲክ ቶከኖች SoundStream ተብሎ ከሚጠራው የነርቭ ኮዴክ ድምጽ ያመነጫል። እንደ AudioLM ያሉ ቀደምት ሞዴሎች እነዚህን ቶከኖች በራስ-ሰር በማዘጋጀት እያንዳንዱን ማስመሰያ በቅደም ተከተል ይተነብያሉ፣ ይህም ለረጅም ድምጽ ቀርፋፋ ነው። SoundStorm ይልቁንስ እንደ MaskGIT ካሉ የምስል ማመንጨት ሞዴሎች የተበደረው ራስ-ሰር ያልሆነ፣ ጭንብል ላይ የተመሰረተ አካሄድ ይጠቀማል። በአብዛኛዎቹ ጭንብል በተሸፈኑ ቶከኖች ይጀምራል እና በትይዩ ብዙ ምልክቶችን በአንድ ጊዜ በመተንበይ በጥቂት የዲኮዲንግ ደረጃዎች ውስጥ ደጋግሞ ይሞላል። በትርጉም ቶከኖች (እንደ AudioLM ወይም SPEAR-TTS ካለው ሞዴል) የ 30 ሰከንድ የተፈጥሮ ውይይት በግማሽ ሰከንድ TPU ላይ ማዋሃድ ይችላል፣ ከአውቶሬግረስሲቭ መነሻ መስመሮች በግምት በ100 እጥፍ ፍጥነት ያለው ጥራቱን እና የተናጋሪውን ወጥነት በማዛመድ።

ቴክኒካዊ ግንዛቤ

SoundStorm ከSoundStream የቀሪ ቬክተር መለኪያ (RVQ) ደረጃዎች ተዋረድን ሞዴል ያደርጋል። በስልጠና ወቅት የዘፈቀደ ቶከኖች ተሸፍነዋል እና ሞዴሉ እነሱን ለመተንበይ ይማራል። በመተማመን ላይ የተመሰረተ ትይዩ ኮድ ማውጣትን ያካሂዳል፡ በእያንዳንዱ ድግግሞሽ ሁሉንም የተሸፈኑ ቶከኖች ይተነብያል፣ በጣም የሚተማመኑትን ይጠብቃል እና የቀረውን እንደገና ጭምብል ያደርጋል። በመጀመሪያ ሻካራ የRVQ ደረጃዎችን ይፈታዋል፣ ከዚያም ጥሩ የሆኑትን፣ ከቶከን-ቶከን ትውልድ በጣም ባነሰ ደረጃዎች ወደ ሙሉ ኦዲዮ ይደርሳል።

ስልታዊ ተጽእኖ

መድረስ እና መድረስ

በጽሑፍ፣ በትረካ እና በድምፅ በይነገጾች ተደራሽነትን ያሻሽላል።

ወጪ እና በጀት

የሚዲያ ቡድኖች በትንሽ በጀቶች የተጣራ ድምጽ በፍጥነት መላክ ይችላሉ።

ፍጥነት እና ልኬት

ከደንበኛ ጋር የሚገናኙ ስርዓቶች የንግግር ግንኙነቶችን በትልቁ ደረጃ ማካሄድ ይችላሉ።

የSoundStorm ትይዩ ኦዲዮ ትውልድ የወደፊት ዕጣ

ትይዩ ጭንብል ላይ የተመሰረተ ዲኮዲንግ ለፈጣን እና ቁጥጥር ለሚደረግ ድምጽ መደበኛ መሳሪያ እየሆነ ነው። የአሁናዊ የውይይት ወኪሎችን፣ የፈጣን የድምጽ ውህደትን እና የረዥም ጊዜ ፖድካስት ወይም ኦዲዮ መጽሐፍ ትውልድን በማዘግየት አንድ ጊዜ አውቶማቲካሊቭ ሞዴሎችን ተግባራዊ ለማድረግ እንዲችል ጠብቅ። ከጠንካራ የትርጉም ማስተካከያ እና የውሃ ምልክት ጋር በማጣመር የውይይት እውነታን እና የመከታተያ ችሎታን ያሻሽላል። ተመሳሳዩ የመድገም-ማጣራት ሃሳብ ከስርጭት አቀራረቦች ጋር ሊዋሃድ ይችላል, በኮዴክ-ቶከን እና በተከታታይ-ድምጽ ማመንጫዎች መካከል ያለውን መስመር ያደበዝዛል.

የእውነተኛ-ዓለም አተገባበር

ከአንድ ሰከንድ በታች ለኤአይአይ ድምጽ ረዳቶች የ30 ሰከንድ የንግግር ንግግሮችን መፍጠር

የባለብዙ-ዙር ንግግሮችን ከወጥነት የተናጋሪ ድምፆች ጋር ለፕሮቶቲፕ ማቀናጀት

ዝቅተኛ መዘግየት ጽሑፍ-ወደ-ንግግር አውቶማቲክ ሞዴሎች በሚዘገዩባቸው በይነተገናኝ ወኪሎች ውስጥ ኃይል መስጠት

በትይዩ የአኮስቲክ ቶከኖችን በመሙላት ረጅም ቅርጽ ያለው የተተረከ ኦዲዮን በፍጥነት ማምረት

አደጋዎች እና የጥበቃ መንገዶች

ስምምነት ሲጠፋ የድምፅ አላግባብ መጠቀም እና የማስመሰል አደጋዎች ይጨምራሉ።

ትክክለኛነት በአነጋገር ዘዬዎች፣ ቀበሌኛዎች ወይም ጫጫታ አካባቢዎች ላይ ሊወድቅ ይችላል።

ሰራሽ ኦዲዮ ግልጽ ምልክት ሳይደረግበት ለትክክለኛ ንግግር ሊሳሳት ይችላል።

የትግበራ ፍኖተ ካርታ

1

ለድምጽ ቀረጻ፣ ክሎኒንግ እና እንደገና ጥቅም ላይ ለማዋል ግልጽ የሆነ ፈቃድ ያግኙ።

2

በተለያዩ የድምጽ ማጉያዎች እና የበስተጀርባ ሁኔታዎች ላይ ጥራትን ይሞክሩ።

3

አንድ ሰው መቼ ውጤቶችን መገምገም ወይም ማጽደቅ እንዳለበት ይግለጹ።

4

ሰው ሰራሽ ኦዲዮን ይሰይሙ እና ለተጠያቂነት የፕሮቨንስ መዝገቦችን ያስቀምጡ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SoundStorm Parallel Audio Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

የተረጋጋ የድምጽ ድብቅ ስርጭት

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is SoundStorm Parallel Audio Generation?

ሳውንድ ስቶርም Google ኦዲዮ ትውልድ ሞዴል ሲሆን ንግግር እና ድምጽ በአንድ ጊዜ ከአንድ ቶከን ይልቅ በትይዩ የሚያሰራ ሲሆን ይህም ከፍተኛ ጥራት ያለው የድምጽ ውህደት በሚያስደንቅ ሁኔታ ፈጣን ያደርገዋል። ታማኝነትን ሳይከፍል ለረጅም ክሊፖች ከደቂቃ ወደ ሰከንድ የትውልድ መዘግየትን ስለሚቀንስ ጠቃሚ ነው።

SoundStormን ከኦዲዮኤልኤም የበለጠ ፈጣን የሚያደርገው ቁልፍ ፈጠራ ምንድነው?

SoundStorm ቀርፋፋ አውቶሪግሬሲቭ፣ ማስመሰያ-በ-ቶከን ትዉልድ በራስ-ሰር-ማስተካከያ ባልሆነ ትይዩ ዲኮዲንግ ይተካል፣ በአንድ ጊዜ ብዙ ምልክቶችን ይተነብያል።

SoundStorm ከምስል ማመንጨት የትኛውን ዘዴ ይስማማል?

SoundStorm በምስል ውህድ ውስጥ በMaskGIT ታዋቂ የሆነውን በራስ መተማመን ላይ የተመሰረተ፣ ጭንብል-እና-መሙላ የመግለጫ ስልት ይበደራል።

SoundStorm ምን አይነት ውክልና ይፈጥራል?

SoundStorm በSoundStream ኮዴክ የሚመረተውን ልዩ የአኮስቲክ ቶከኖች ይተነብያል፣ እነዚህም በኋላ ወደ ሞገድ ቅርጽ ይገለጣሉ።

SoundStorm በTPU ላይ 30 ሰከንድ ኦዲዮ ለማመንጨት ምን ያህል ጊዜ ይወስዳል?

SoundStorm 30 ሰከንድ ኦዲዮን በግምት በ0.5 ሰከንድ ውስጥ ማዋሃድ ይችላል፣ ከራስ ሰር ሬግረስሲቭ መነሻ መስመሮች በ100x ፍጥነት።

SoundStorm በመፍታት ጊዜ የትኞቹ የተተነበዩ ቶከኖች እንደሚቆዩ እንዴት ይወስናል?

በእያንዳንዱ ድግግሞሹ ከፍተኛ በራስ የመተማመን ግምቱን ይይዛል እና ለቀጣዩ ማለፊያ እርግጠኛ ያልሆኑትን እንደገና ይሸፍናል።