ቪዥዋል AI መመሪያ

ጭምብል ያደረጉ አውቶኢንኮደሮች

Masked Autoencoders (MAE) አብዛኛው ሥዕል ከተደበቀ በኋላ ምስሎችን እንደገና ለመገንባት የእይታ ሞዴልን የሚያስተምር በራስ ቁጥጥር የሚደረግበት ዘዴ ነው።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

By learning to fill in the blanks, the model builds rich visual understanding without any human labels.

ጥልቅ ዳይቭ

Masked Autoencoders፣ በ Kaiming He እና ባልደረቦቹ በMeta AI በ2021 አስተዋውቀዋል፣ ምስል ያንሱ፣ ወደ ትናንሽ ፕላስተሮች ከፋፍለው እና በጣም ትልቅ የሆነውን ክፍልፋይ በዘፈቀደ ይደብቁ፣ ብዙ ጊዜ 75%። ቪዥን ትራንስፎርመር ኢንኮደር የታዩትን ጥገናዎች ብቻ ይሰራል፣ ቀላል ክብደት ያለው ዲኮደር የጎደሉትን የመጀመሪያ ፒክሰሎች መልሶ ለመገንባት ይሞክራል። ብዙ የተደበቀ ስለሆነ ሞዴሉ በቀላሉ በአቅራቢያ ያሉ ፒክሰሎችን መቅዳት አይችልም እና እንደ ቅርጾች እና የቁስ አካላት ያሉ ትርጉም ያለው መዋቅር መማር አለበት። ኢንኮደር ጭምብል የተሸፈኑ ፕላቶችን መዝለል ስልጠና ፈጣን እና ውጤታማ ያደርገዋል። ከቅድመ ስልጠና በኋላ ዲኮደሩ ይጣላል እና ኢንኮደሩ በጥብቅ ወደ ምደባ፣ ፍለጋ እና ክፍፍል ተግባራት ያስተላልፋል።

ቴክኒካዊ ግንዛቤ

ቁልፉ ብልሃቱ asymmetry ነው፡ ከባድ ኢንኮደር የሚያየው ጭምብል ያልተደረገውን 25% ጥገና ብቻ ሲሆን ትንሽ ዲኮደር ቀሪውን እንደገና ይገነባል። ንጣፎች ጠፍጣፋ፣ በመስመራዊ የተከተቱ እና የአቀማመጥ ኢንኮዲንግ የተሰጡ ናቸው። የመልሶ ግንባታው መጥፋት ማለት አራት ማዕዘን ቅርጽ ያለው ስህተት በተሸፈኑ ፕላቶች ላይ ብቻ ይሰላል፣ በተለይም በተለመደው የፒክሰል ዋጋዎች። ከፍተኛ የመሸፈኛ ሬሾዎች ከዝቅተኛ ደረጃ መስተጋብር ይልቅ የትርጓሜ ትምህርትን ያስገድዳሉ፣ እና ጭምብል የተደረገባቸው ምልክቶችን በመቀየሪያው ውስጥ መዝለል ሙሉውን ምስል ከማቀናበር ጋር በሚያስደንቅ ሁኔታ ይሰላል።

ስልታዊ ተጽእኖ

ፍጥነት እና ልኬት

ቪዥዋል AI የመመርመሪያ፣ የማወቅ እና የመለያ ስራዎችን በሚዛን መጠን በራስ ሰር ሊያደርግ ይችላል።

ምርጫዎችን ይገንቡ

የፈጠራ ቡድኖች በጥቂት የእጅ ክለሳዎች ጽንሰ-ሀሳቦችን በፍጥነት መተየብ ይችላሉ።

ቡድን እና የስራ ፍሰት

ክዋኔዎች ከዚህ ቀደም ለማስኬድ አስቸጋሪ የነበሩትን የምስል እና የቪዲዮ ምልክቶችን መጠቀም ይችላሉ።

የፊት ጭንብል አውቶኢንኮደሮች

የMAE-style ጭንብል መልሶ መገንባት በሁሉም የሥልጠና ዘዴዎች ውስጥ ነባሪ የቅድመ ሥልጠና አዘገጃጀት እየሆነ ነው። ተመራማሪዎች በቪዲዮ (የመደበቅ የስፔስታይም ኪዩብ)፣ የኦዲዮ ስፔክትሮግራሞች፣ የህክምና ስካን እና የሳተላይት ምስሎች፣ መለያዎች እምብዛም እና ውድ ወደሆኑበት እያራዘሙት ነው። ለመልቲሞዳል ፋውንዴሽን ሞዴሎች፣ የበለጠ ቀልጣፋ ዲኮደሮች እና መረጃ ሰጭ ክልሎችን የሚያነጣጥር ጭንብል ከቋንቋ ጋር ጥብቅ ውህደትን ይጠብቁ። ኮምፒዩት እያደገ ሲሄድ፣ በትልቅ መለያ ባልተደረገባቸው የምስል ስብስቦች ላይ ጭምብል ማድረጉ የታችኛ ተፋሰስ ትክክለኛነትን ማሻሻል እና ውድ በሆነ የሰው ልጅ ማብራሪያ ላይ ያለውን ጥገኛነት እየቀነሰ መቀጠል አለበት።

የእውነተኛ-ዓለም አተገባበር

በሚሊዮኖች በሚቆጠሩ ያልተሰየሙ ፎቶዎች ላይ የእይታ ትራንስፎርመርን ቀድመው ማሰልጠን፣ በመቀጠልም ለImageNet ምደባ በጠንካራ ትክክለኛነት ማስተካከል

የባለሙያ ማብራሪያ ውድ እና የተገደበ ከሆነ መለያ ከሌለው የሕክምና ስካን (ኤክስሬይ፣ ኤምአርአይ) የመማሪያ ባህሪያት

የድርጊት ማወቂያ ሞዴሎችን (VideoMAE) ለማሰልጠን የspacetime ጥገናዎችን በመደበቅ ዘዴውን ከቪዲዮ ጋር ማላመድ።

የመሬት አጠቃቀምን ካርታ ለመደገፍ በሳተላይት እና በአየር ምስሎች ላይ ቅድመ ስልጠና መስጠት እና በእጅ መለያዎች መለየትን መለወጥ

አደጋዎች እና የጥበቃ መንገዶች

የምስል መብቶች እና ፈቃድ ግልጽ ካልሆነ ህጋዊ አደጋዎች ሊሆኑ ይችላሉ።

የሞዴል አፈጻጸም በብርሃን፣ በስነ-ሕዝብ እና በአካባቢው ሊለያይ ይችላል።

የመተማመን ገደቦች ካልተቆጣጠሩ የውሸት አወንታዊ ነገሮች ላይታዩ ይችላሉ።

የትግበራ ፍኖተ ካርታ

1

ለትክክለኛነት፣ ለማስታወስ እና ለስህተት ወጪዎች የመቀበያ መስፈርቶችን ይግለጹ።

2

ከእውነተኛ የምርት ሁኔታዎች ጋር በሚዛመድ ውሂብ ይሞክሩ።

3

ለዝቅተኛ እምነት ወይም ከፍተኛ ተጽዕኖ ትንበያ የሰው ግምገማን ያክሉ።

4

ከካሜራ ወይም የውሂብ ስብስብ ለውጦች በኋላ የሞዴሉን ተንሸራታች ይከታተሉ እና እንደገና ያረጋግጡ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Masked Autoencoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

ቀጣይ መመሪያ

የሙሴ ጭምብል ጀነሬቲቭ ኢሜጂንግ

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is Masked Autoencoders?

Masked Autoencoders (MAE) አብዛኛው ሥዕል ከተደበቀ በኋላ ምስሎችን እንደገና ለመገንባት የእይታ ሞዴልን የሚያስተምር በራስ ቁጥጥር የሚደረግበት ዘዴ ነው። ባዶውን መሙላት በመማር ሞዴሉ ያለ ምንም የሰው መለያዎች የበለፀገ የእይታ ግንዛቤን ይገነባል።

ጭምብል በሚደረግ አውቶኢንኮደር ውስጥ ዋናው በራስ የሚቆጣጠር ተግባር ምንድነው?

MAE አብዛኞቹን የምስል መጠገኛዎች ይደብቃል እና ሞዴሉን የጎደሉትን ፒክሰሎች መልሶ ለመገንባት ያሠለጥናል፣ ምንም የሰው መለያ አያስፈልግም።

ኦሪጅናል MAE ምን ያህል ክፍልፋይ የምስል መጠገኛዎች በተለምዶ ይሸፍንላቸዋል?

የመጀመሪያው MAE 75% ጥገናዎችን ይሸፍናል፣ ሞዴሉ ጎረቤቶችን ከመቅዳት ይልቅ ትርጉም ያለው መዋቅር እንዲማር የሚያስገድድ ከፍተኛ ሬሾ።

ለምንድነው የMAE ኢንኮደር የሚታዩትን (ያልተሸፈኑ) ንጣፎችን ብቻ ነው የሚሰራው?

በመቀየሪያው ውስጥ ጭምብል የተደረገባቸው ቶከኖችን መዝለል ትንሽ ክፍልፋዮችን ብቻ ስለሚይዝ ስሌት እና ማህደረ ትውስታን በእጅጉ ይቀንሳል።

የMAE ቅድመ ስልጠና ከተጠናቀቀ በኋላ ዲኮደር ምን ይሆናል?

ቀላል ክብደት ያለው ዲኮደር በቅድመ-ስልጠና ወቅት እንደገና ለመገንባት ብቻ ያስፈልጋል; ከዚያ በኋላ የተማረው ኢንኮደር ወደ ማወቂያ ላሉ ተግባራት ይሸጋገራል።

MAE በተለምዶ ለመልሶ ግንባታ የሚጠቀመው የትኛውን የኪሳራ ተግባር ነው?

MAE በተገመቱት እና በእውነተኛ የፒክሰል እሴቶች መካከል፣ ጭምብል በተሸፈኑ ጥገናዎች ላይ ብቻ የሚሰላ የአማካይ ካሬ ስሕተትን ይቀንሳል።