ቪዥዋል AI መመሪያ

VQGAN እና Codebook Image Synthesis

VQGAN ምስሎችን ከተማረው የኮድ ደብተር ወደተወሰዱ የዲስክ ቶከኖች ፍርግርግ ይጨምቃል፣ ይህም የቋንቋ ሞዴሎች ጽሑፍን በሚያመነጩበት መንገድ ትራንስፎርመር ምስሎችን እንዲያመነጭ ያስችለዋል።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

ጥልቅ ዳይቭ

VQGAN፣ በ2021 ወረቀቱ 'Taming Transformers for High-Resolution Image Synthesis' አስተዋወቀ፣ የቬክተር-ኳንታይዝድ አውቶኢንኮደር (VQVAE) ከጠላት እና ከማስተዋል ስልጠና ጋር ያጣምራል። ኢንኮደር ምስልን ወደ ትንሽ የባህሪ ቬክተሮች ፍርግርግ ያዘጋጃል፤ እያንዳንዱ ቬክተር ምስሉን ወደ ተከታታይ የኢንቲጀር ቶከኖች በመቀየር በተማረው የኮድ ደብተር ውስጥ 1024 discrete ኮዶች እንበል። ዲኮደር ምስሉን ከእነዚያ ቶከኖች እንደገና ይገነባል፣ በGAN አድሎአዊ እና የአመለካከት ኪሳራ የሰለጠነ በመሆኑ መልሶ ግንባታዎች ከደበዘዙ ይልቅ ስለታም ይመስላሉ ። ምስሎች አሁን ልዩ የሆኑ የማስመሰያ ቅደም ተከተሎች ስለሆኑ፣ አውቶሪግሬሲቭ ትራንስፎርመር እንደ ቋንቋ ሊቀርባቸው ይችላል፣ ቶከኖችን አንድ በአንድ ይተነብያል። ከ CLIP መመሪያ ጋር ሲጣመሩ VQGAN በታዋቂነት ቀደምት የጽሑፍ-ወደ-ምስል የጥበብ መሳሪያዎች።

ቴክኒካዊ ግንዛቤ

ዋናው ክዋኔው የቬክተር መጠናዊ ነው፡ ቀጣይነት ያለው የመቀየሪያ ውፅዓቶች በአቅራቢያቸው ባሉ የኮድ ደብተር ቬክተር ይተካሉ፣ በ'ቀጥታ መንገድ' ግራዲየንት ገምጋሚ ​​ምንም ልዩነት ባይኖረውም ኢንኮደሩ አሁንም መማር ይችላል። በ autoencoder ላይ በ patch-based GAN መድልዎ መጨመር VQGAN ከVQVAE በጣም ያነሰ የማስመሰያ ፍርግርግ (ለምሳሌ 16x16) ሸካራማነቶችን እየጠበቀ፣ ትራንስፎርመር ሞዴሊንግ ሊጎተት የሚችል ያደርገዋል።

ስልታዊ ተጽእኖ

ፍጥነት እና ልኬት

ቪዥዋል AI የመመርመሪያ፣ የማወቅ እና የመለያ ስራዎችን በሚዛን መጠን በራስ ሰር ሊያደርግ ይችላል።

ምርጫዎችን ይገንቡ

የፈጠራ ቡድኖች በጥቂት የእጅ ክለሳዎች ጽንሰ-ሀሳቦችን በፍጥነት መተየብ ይችላሉ።

ቡድን እና የስራ ፍሰት

ክዋኔዎች ከዚህ ቀደም ለማስኬድ አስቸጋሪ የነበሩትን የምስል እና የቪዲዮ ምልክቶችን መጠቀም ይችላሉ።

የወደፊት የVQGAN እና Codebook Image Synthesis

የVQGAN discrete-token የምግብ አሰራር በቶከን ላይ ለተመሰረቱ ምስሎች እና የቪዲዮ ሞዴሎች መሰረት ሆኖ ከMaskGIT እስከ መልቲሞዳል ሲስተም ምስሎችን እና የጽሁፍ ቶከኖችን በአንድ ትራንስፎርመር ውስጥ ይደባለቃሉ። ምርምር አሁን ወደ ትላልቅ፣ ውሱን ደረጃ ያላቸው ወይም ከፍለጋ ነጻ የሆኑ የኮድ ደብተሮች እና የኮድ ደብተር ውድቀትን እና ተመሳሳይ የቃላት ዝርዝር ምስሎችን፣ ኦዲዮ እና ቋንቋን ወደ ሚሸፍኑ ሞዴሎች ይገፋፋል፣ ይህም ለማንኛውም ትውልድ ያስችላል።

የእውነተኛ-ዓለም አተገባበር

ፎቶን ወደ 16x16 የኮድ ደብተር ቶከኖች በኮድ በማድረግ ትራንስፎርመር አምሳያ እንዲሰራ እና እንደገና እንዲያዳብር ማድረግ

እ.ኤ.አ. በ2021 በቫይረስ የታየውን እውነተኛ 'VQGAN+CLIP' AI ጥበብ ለመፍጠር VQGANን ከCLIP መመሪያ ጋር በማጣመር

ለተቀላጠፈ ማከማቻ ወይም የታችኛው ተፋሰስ አመንጪ ስልጠና ምስሎችን ወደ የታመቀ discrete ኮዶች መጭመቅ

እንደ MaskGIT እና መልቲ ሞዳል ትራንስፎርመሮች ባሉ ትላልቅ ማስመሰያ-ተኮር ጀነሬተሮች ውስጥ እንደ የምስል ማስመሰያ ማገልገል።

አደጋዎች እና የጥበቃ መንገዶች

የምስል መብቶች እና ፈቃድ ግልጽ ካልሆነ ህጋዊ አደጋዎች ሊሆኑ ይችላሉ።

የሞዴል አፈጻጸም በብርሃን፣ በስነ-ሕዝብ እና በአካባቢው ሊለያይ ይችላል።

የመተማመን ገደቦች ካልተቆጣጠሩ የውሸት አወንታዊ ነገሮች ላይታዩ ይችላሉ።

የትግበራ ፍኖተ ካርታ

1

ለትክክለኛነት፣ ለማስታወስ እና ለስህተት ወጪዎች የመቀበያ መስፈርቶችን ይግለጹ።

2

ከእውነተኛ የምርት ሁኔታዎች ጋር በሚዛመድ ውሂብ ይሞክሩ።

3

ለዝቅተኛ እምነት ወይም ከፍተኛ ተጽዕኖ ትንበያ የሰው ግምገማን ያክሉ።

4

ከካሜራ ወይም የውሂብ ስብስብ ለውጦች በኋላ የሞዴሉን ተንሸራታች ይከታተሉ እና እንደገና ያረጋግጡ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VQGAN and Codebook Image Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

SPADE የትርጉም ምስል ውህደት

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is VQGAN and Codebook Image Synthesis?

VQGAN ምስሎችን ከተማረው የኮድ ደብተር ወደተወሰዱ የዲስክ ቶከኖች ፍርግርግ ይጨምቃል፣ ይህም የቋንቋ ሞዴሎች ጽሑፍን በሚያመነጩበት መንገድ ትራንስፎርመር ምስሎችን እንዲያመነጭ ያስችለዋል።

ምስልን እንደ የተለየ ቶከን ለመወከል VQGAN ምን ይጠቀማል?

VQGAN የመቀየሪያ ባህሪያትን በተማረ የኮድ ደብተር ውስጥ ወደሚገኙ ምዝግቦች ይለካዋል፣ ምስሉን ወደ ተከታታይ የልዩ ኮድ ኢንዴክሶች ይቀይረዋል።

ለምንድነው VQGAN GAN አድልዎ በVQVAE ላይ የሚጨምረው?

ተቃራኒው እና የማስተዋል ኪሳራው VQGAN ጥርት ያሉ ምስሎችን ከኮምፓክት ቶከን ፍርግርግ እንደገና እንዲገነባ ያስችለዋል፣ ይህም VQVAE ብቻውን የማደብዘዝ ዝንባሌ ያለው ነው።

አንዴ ምስል የቶከኖች ቅደም ተከተል ከሆነ ምን ሞዴል አዲስ ምስሎችን ይፈጥራል?

ምስሎች ልዩ የሆኑ የማስመሰያ ቅደም ተከተሎች ስለሚሆኑ፣ ትራንስፎርመር ልክ ጽሑፍን እንደማመንጨት በራስ-ሰር ወደ ኋላ መቅረጽ ይችላል።

ቅልመት በሌለው የመጠን ደረጃ ውስጥ እንዲፈስ የሚያደርገው የትኛው ዘዴ ነው?

የቬክተር መጠን መለየት አይለይም፣ ስለዚህ VQGAN ኢንኮደሩን ለማሰልጠን ቀጥታ-በኩል ቀስ በቀስ ግምታዊ ይጠቀማል።

በ 2021 VQGAN ምን ታዋቂ የ AI ጥበብ አዝማሚያ ረድቷል?

VQGANን ከCLIP መመሪያ ጋር ማጣመር በፅሁፍ የሚመራ ምስል ማመንጨትን ያስፋፋውን በስፋት የተጋራውን 'VQGAN+CLIP' ጥበብን አፍርቷል።