Visimbaji Kiotomatiki Vilivyofichwa
Masked Autoencoders (MAE) ni njia inayojisimamia ambayo hufunza muundo wa maono kuunda upya picha baada ya picha nyingi kufichwa.
Muhtasari
By learning to fill in the blanks, the model builds rich visual understanding without any human labels.
Dive ya kina
Visimbaji Kiotomatiki vilivyofichwa, vilivyoletwa na Kaiming He na wafanyakazi wenzake katika Meta AI mnamo 2021, huchukua picha, na kuigawanya katika mabaka madogo, na kuficha kwa nasibu sehemu kubwa sana, mara nyingi 75%. Kisimbaji cha Kibadilishaji Maono huchakata tu viraka vinavyoonekana, huku kipunguza sauti chepesi hujaribu kuunda upya saizi asili za zile ambazo hazipo. Kwa sababu mengi yamefichwa, modeli haiwezi kunakili saizi zilizo karibu na lazima ijifunze muundo wa maana, kama maumbo na sehemu za kitu. Kisimbaji kuruka viraka vilivyofunikwa hufanya mafunzo kuwa ya haraka na ya ufanisi wa kumbukumbu. Baada ya kufanya mazoezi ya awali, avkodare hutupwa na kisimbaji huhamishwa kwa nguvu hadi kwa uainishaji, ugunduzi na kazi za ugawaji.
Ufahamu wa Kiufundi
Ujanja muhimu ni asymmetry: kisimbaji kizito huona tu 25% ya viraka vilivyofichuliwa, wakati avkodare ndogo hutengeneza zingine. Viraka hubanwa, kupachikwa kimstari, na kupewa usimbaji mkao. Upotezaji wa uundaji upya ni maana ya hitilafu ya mraba iliyokokotwa tu kwenye viraka vilivyofunikwa, kwa kawaida kwenye thamani za pikseli zilizosawazishwa. Uwiano wa juu wa ufunikaji hulazimisha ujifunzaji wa kisemantiki badala ya ufasiri wa kiwango cha chini, na kuruka tokeni zilizofichwa kwenye vipunguzo vya kisimbaji hukusanya kwa kiasi kikubwa dhidi ya kuchakata picha kamili.
Athari za kimkakati
Kasi na kiwango
Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.
Tengeneza chaguzi
Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.
Timu na mtiririko wa kazi
Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.
Mustakabali wa Visimbaji Kiotomatiki vilivyofichwa
Uundaji upya wenye vinyago vya mtindo wa MAE unakuwa kichocheo chaguo-msingi cha mafunzo ya awali katika mbinu zote. Watafiti wanaipanua hadi video (kuficha cubes za muda), spectrogramu za sauti, uchunguzi wa kimatibabu, na picha za setilaiti, ambapo lebo ni chache na za gharama kubwa. Tarajia muunganisho mkali zaidi wa lugha kwa miundo ya msingi ya moduli nyingi, avkodare bora zaidi na ufunikaji unaoweza kubadilika unaolenga maeneo yenye taarifa. Kadiri hesabu inavyokua, mafunzo ya awali yaliyofichwa kwenye mikusanyiko mikubwa ya picha isiyo na lebo inapaswa kuendelea kuboresha usahihi wa mkondo huku ikipunguza kutegemea ufafanuzi wa gharama kubwa wa kibinadamu.
Utekelezaji wa Ulimwengu Halisi
Kuandaa Kibadilishaji Maono mapema kwenye mamilioni ya picha zisizo na lebo, kisha kuisanikisha kwa uainishaji wa ImageNet kwa usahihi mkubwa.
Vipengele vya kujifunzia kutoka kwa uchunguzi wa kimatibabu usio na lebo (X-rays, MRIs) ambapo ufafanuzi wa kitaalamu ni ghali na mdogo.
Kurekebisha mbinu kwa video kwa kuficha viraka vya muda wa angani ili kutoa mafunzo ya awali ya vielelezo vya utambuzi wa vitendo (VideoMAE)
Kujizoeza mapema kuhusu picha za setilaiti na angani ili kusaidia uchoraji wa ramani ya matumizi ya ardhi na ugunduzi wa mabadiliko bila lebo za mikono
Hatari & Walinzi
Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.
Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.
Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.
Ramani ya Utekelezaji
Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.
Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.
Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.
Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Masked Autoencoders quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Muse Mask Generative Imaging
Maswali yanayoulizwa mara kwa mara
What is Masked Autoencoders?
Masked Autoencoders (MAE) ni njia inayojisimamia ambayo hufunza muundo wa maono kuunda upya picha baada ya picha nyingi kufichwa. Kwa kujifunza kujaza nafasi zilizoachwa wazi, modeli hujenga uelewa mzuri wa kuona bila lebo zozote za kibinadamu.
Je, ni kazi gani kuu ya kujisimamia katika Kisimbo Kiotomatiki kilichofichwa?
MAE huficha alama nyingi za picha na kufundisha muundo kuunda upya pikseli ambazo hazipo, bila kuhitaji lebo za kibinadamu.
Takriban ni sehemu gani ya viraka vya picha ambavyo MAE asili huficha kwa kawaida?
Mask asilia ya MAE hufunika takriban 75% ya mabaka, uwiano wa juu unaolazimisha kielelezo kujifunza muundo wa maana badala ya kunakili majirani.
Kwa nini kisimbaji cha MAE huchakata tu viraka vinavyoonekana (vilivyofichwa)?
Kuruka ishara zilizofichwa kwenye kisimbaji hupunguza sana hesabu na kumbukumbu, kwani inashughulikia sehemu ndogo tu ya viraka.
Nini kinatokea kwa avkodare baada ya mafunzo ya awali ya MAE kukamilika?
Avkodare nyepesi inahitajika tu kwa ajili ya ujenzi upya wakati wa mafunzo ya awali; baadaye kisimbaji kilichojifunza huhamishwa hadi kwa kazi kama vile utambuzi.
Ni kazi gani ya upotezaji ambayo MAE hutumia kwa ujenzi upya?
MAE hupunguza maana ya hitilafu ya mraba kati ya thamani za pikseli zilizotabiriwa na za kweli, zinazokokotwa tu kwenye mabaka yaliyofunikwa.