VQGAN እና Codebook Image Synthesis
VQGAN ምስሎችን ከተማረው የኮድ ደብተር ወደተወሰዱ የዲስክ ቶከኖች ፍርግርግ ይጨምቃል፣ ይህም የቋንቋ ሞዴሎች ጽሑፍን በሚያመነጩበት መንገድ ትራንስፎርመር ምስሎችን እንዲያመነጭ ያስችለዋል።
ጥልቅ ዳይቭ
VQGAN፣ በ2021 ወረቀቱ 'Taming Transformers for High-Resolution Image Synthesis' አስተዋወቀ፣ የቬክተር-ኳንታይዝድ አውቶኢንኮደር (VQVAE) ከጠላት እና ከማስተዋል ስልጠና ጋር ያጣምራል። ኢንኮደር ምስልን ወደ ትንሽ የባህሪ ቬክተሮች ፍርግርግ ያዘጋጃል፤ እያንዳንዱ ቬክተር ምስሉን ወደ ተከታታይ የኢንቲጀር ቶከኖች በመቀየር በተማረው የኮድ ደብተር ውስጥ 1024 discrete ኮዶች እንበል። ዲኮደር ምስሉን ከእነዚያ ቶከኖች እንደገና ይገነባል፣ በGAN አድሎአዊ እና የአመለካከት ኪሳራ የሰለጠነ በመሆኑ መልሶ ግንባታዎች ከደበዘዙ ይልቅ ስለታም ይመስላሉ ። ምስሎች አሁን ልዩ የሆኑ የማስመሰያ ቅደም ተከተሎች ስለሆኑ፣ አውቶሪግሬሲቭ ትራንስፎርመር እንደ ቋንቋ ሊቀርባቸው ይችላል፣ ቶከኖችን አንድ በአንድ ይተነብያል። ከ CLIP መመሪያ ጋር ሲጣመሩ VQGAN በታዋቂነት ቀደምት የጽሑፍ-ወደ-ምስል የጥበብ መሳሪያዎች።
ቴክኒካዊ ግንዛቤ
ዋናው ክዋኔው የቬክተር መጠናዊ ነው፡ ቀጣይነት ያለው የመቀየሪያ ውፅዓቶች በአቅራቢያቸው ባሉ የኮድ ደብተር ቬክተር ይተካሉ፣ በ'ቀጥታ መንገድ' ግራዲየንት ገምጋሚ ምንም ልዩነት ባይኖረውም ኢንኮደሩ አሁንም መማር ይችላል። በ autoencoder ላይ በ patch-based GAN መድልዎ መጨመር VQGAN ከVQVAE በጣም ያነሰ የማስመሰያ ፍርግርግ (ለምሳሌ 16x16) ሸካራማነቶችን እየጠበቀ፣ ትራንስፎርመር ሞዴሊንግ ሊጎተት የሚችል ያደርገዋል።
ስልታዊ ተጽእኖ
ፍጥነት እና ልኬት
ቪዥዋል AI የመመርመሪያ፣ የማወቅ እና የመለያ ስራዎችን በሚዛን መጠን በራስ ሰር ሊያደርግ ይችላል።
ምርጫዎችን ይገንቡ
የፈጠራ ቡድኖች በጥቂት የእጅ ክለሳዎች ጽንሰ-ሀሳቦችን በፍጥነት መተየብ ይችላሉ።
ቡድን እና የስራ ፍሰት
ክዋኔዎች ከዚህ ቀደም ለማስኬድ አስቸጋሪ የነበሩትን የምስል እና የቪዲዮ ምልክቶችን መጠቀም ይችላሉ።
የወደፊት የVQGAN እና Codebook Image Synthesis
የVQGAN discrete-token የምግብ አሰራር በቶከን ላይ ለተመሰረቱ ምስሎች እና የቪዲዮ ሞዴሎች መሰረት ሆኖ ከMaskGIT እስከ መልቲሞዳል ሲስተም ምስሎችን እና የጽሁፍ ቶከኖችን በአንድ ትራንስፎርመር ውስጥ ይደባለቃሉ። ምርምር አሁን ወደ ትላልቅ፣ ውሱን ደረጃ ያላቸው ወይም ከፍለጋ ነጻ የሆኑ የኮድ ደብተሮች እና የኮድ ደብተር ውድቀትን እና ተመሳሳይ የቃላት ዝርዝር ምስሎችን፣ ኦዲዮ እና ቋንቋን ወደ ሚሸፍኑ ሞዴሎች ይገፋፋል፣ ይህም ለማንኛውም ትውልድ ያስችላል።
የእውነተኛ-ዓለም አተገባበር
ፎቶን ወደ 16x16 የኮድ ደብተር ቶከኖች በኮድ በማድረግ ትራንስፎርመር አምሳያ እንዲሰራ እና እንደገና እንዲያዳብር ማድረግ
እ.ኤ.አ. በ2021 በቫይረስ የታየውን እውነተኛ 'VQGAN+CLIP' AI ጥበብ ለመፍጠር VQGANን ከCLIP መመሪያ ጋር በማጣመር
ለተቀላጠፈ ማከማቻ ወይም የታችኛው ተፋሰስ አመንጪ ስልጠና ምስሎችን ወደ የታመቀ discrete ኮዶች መጭመቅ
እንደ MaskGIT እና መልቲ ሞዳል ትራንስፎርመሮች ባሉ ትላልቅ ማስመሰያ-ተኮር ጀነሬተሮች ውስጥ እንደ የምስል ማስመሰያ ማገልገል።
አደጋዎች እና የጥበቃ መንገዶች
የምስል መብቶች እና ፈቃድ ግልጽ ካልሆነ ህጋዊ አደጋዎች ሊሆኑ ይችላሉ።
የሞዴል አፈጻጸም በብርሃን፣ በስነ-ሕዝብ እና በአካባቢው ሊለያይ ይችላል።
የመተማመን ገደቦች ካልተቆጣጠሩ የውሸት አወንታዊ ነገሮች ላይታዩ ይችላሉ።
የትግበራ ፍኖተ ካርታ
ለትክክለኛነት፣ ለማስታወስ እና ለስህተት ወጪዎች የመቀበያ መስፈርቶችን ይግለጹ።
ከእውነተኛ የምርት ሁኔታዎች ጋር በሚዛመድ ውሂብ ይሞክሩ።
ለዝቅተኛ እምነት ወይም ከፍተኛ ተጽዕኖ ትንበያ የሰው ግምገማን ያክሉ።
ከካሜራ ወይም የውሂብ ስብስብ ለውጦች በኋላ የሞዴሉን ተንሸራታች ይከታተሉ እና እንደገና ያረጋግጡ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VQGAN and Codebook Image Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
SPADE የትርጉም ምስል ውህደት
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is VQGAN and Codebook Image Synthesis?
VQGAN ምስሎችን ከተማረው የኮድ ደብተር ወደተወሰዱ የዲስክ ቶከኖች ፍርግርግ ይጨምቃል፣ ይህም የቋንቋ ሞዴሎች ጽሑፍን በሚያመነጩበት መንገድ ትራንስፎርመር ምስሎችን እንዲያመነጭ ያስችለዋል።
ምስልን እንደ የተለየ ቶከን ለመወከል VQGAN ምን ይጠቀማል?
VQGAN የመቀየሪያ ባህሪያትን በተማረ የኮድ ደብተር ውስጥ ወደሚገኙ ምዝግቦች ይለካዋል፣ ምስሉን ወደ ተከታታይ የልዩ ኮድ ኢንዴክሶች ይቀይረዋል።
ለምንድነው VQGAN GAN አድልዎ በVQVAE ላይ የሚጨምረው?
ተቃራኒው እና የማስተዋል ኪሳራው VQGAN ጥርት ያሉ ምስሎችን ከኮምፓክት ቶከን ፍርግርግ እንደገና እንዲገነባ ያስችለዋል፣ ይህም VQVAE ብቻውን የማደብዘዝ ዝንባሌ ያለው ነው።
አንዴ ምስል የቶከኖች ቅደም ተከተል ከሆነ ምን ሞዴል አዲስ ምስሎችን ይፈጥራል?
ምስሎች ልዩ የሆኑ የማስመሰያ ቅደም ተከተሎች ስለሚሆኑ፣ ትራንስፎርመር ልክ ጽሑፍን እንደማመንጨት በራስ-ሰር ወደ ኋላ መቅረጽ ይችላል።
ቅልመት በሌለው የመጠን ደረጃ ውስጥ እንዲፈስ የሚያደርገው የትኛው ዘዴ ነው?
የቬክተር መጠን መለየት አይለይም፣ ስለዚህ VQGAN ኢንኮደሩን ለማሰልጠን ቀጥታ-በኩል ቀስ በቀስ ግምታዊ ይጠቀማል።
በ 2021 VQGAN ምን ታዋቂ የ AI ጥበብ አዝማሚያ ረድቷል?
VQGANን ከCLIP መመሪያ ጋር ማጣመር በፅሁፍ የሚመራ ምስል ማመንጨትን ያስፋፋውን በስፋት የተጋራውን 'VQGAN+CLIP' ጥበብን አፍርቷል።