Mwongozo wa AI unaoonekana

Visimbaji Kiotomatiki Vilivyofichwa

Masked Autoencoders (MAE) ni njia inayojisimamia ambayo hufunza muundo wa maono kuunda upya picha baada ya picha nyingi kufichwa.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

By learning to fill in the blanks, the model builds rich visual understanding without any human labels.

Dive ya kina

Visimbaji Kiotomatiki vilivyofichwa, vilivyoletwa na Kaiming He na wafanyakazi wenzake katika Meta AI mnamo 2021, huchukua picha, na kuigawanya katika mabaka madogo, na kuficha kwa nasibu sehemu kubwa sana, mara nyingi 75%. Kisimbaji cha Kibadilishaji Maono huchakata tu viraka vinavyoonekana, huku kipunguza sauti chepesi hujaribu kuunda upya saizi asili za zile ambazo hazipo. Kwa sababu mengi yamefichwa, modeli haiwezi kunakili saizi zilizo karibu na lazima ijifunze muundo wa maana, kama maumbo na sehemu za kitu. Kisimbaji kuruka viraka vilivyofunikwa hufanya mafunzo kuwa ya haraka na ya ufanisi wa kumbukumbu. Baada ya kufanya mazoezi ya awali, avkodare hutupwa na kisimbaji huhamishwa kwa nguvu hadi kwa uainishaji, ugunduzi na kazi za ugawaji.

Ufahamu wa Kiufundi

Ujanja muhimu ni asymmetry: kisimbaji kizito huona tu 25% ya viraka vilivyofichuliwa, wakati avkodare ndogo hutengeneza zingine. Viraka hubanwa, kupachikwa kimstari, na kupewa usimbaji mkao. Upotezaji wa uundaji upya ni maana ya hitilafu ya mraba iliyokokotwa tu kwenye viraka vilivyofunikwa, kwa kawaida kwenye thamani za pikseli zilizosawazishwa. Uwiano wa juu wa ufunikaji hulazimisha ujifunzaji wa kisemantiki badala ya ufasiri wa kiwango cha chini, na kuruka tokeni zilizofichwa kwenye vipunguzo vya kisimbaji hukusanya kwa kiasi kikubwa dhidi ya kuchakata picha kamili.

Athari za kimkakati

Kasi na kiwango

Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.

Tengeneza chaguzi

Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.

Timu na mtiririko wa kazi

Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.

Mustakabali wa Visimbaji Kiotomatiki vilivyofichwa

Uundaji upya wenye vinyago vya mtindo wa MAE unakuwa kichocheo chaguo-msingi cha mafunzo ya awali katika mbinu zote. Watafiti wanaipanua hadi video (kuficha cubes za muda), spectrogramu za sauti, uchunguzi wa kimatibabu, na picha za setilaiti, ambapo lebo ni chache na za gharama kubwa. Tarajia muunganisho mkali zaidi wa lugha kwa miundo ya msingi ya moduli nyingi, avkodare bora zaidi na ufunikaji unaoweza kubadilika unaolenga maeneo yenye taarifa. Kadiri hesabu inavyokua, mafunzo ya awali yaliyofichwa kwenye mikusanyiko mikubwa ya picha isiyo na lebo inapaswa kuendelea kuboresha usahihi wa mkondo huku ikipunguza kutegemea ufafanuzi wa gharama kubwa wa kibinadamu.

Utekelezaji wa Ulimwengu Halisi

Kuandaa Kibadilishaji Maono mapema kwenye mamilioni ya picha zisizo na lebo, kisha kuisanikisha kwa uainishaji wa ImageNet kwa usahihi mkubwa.

Vipengele vya kujifunzia kutoka kwa uchunguzi wa kimatibabu usio na lebo (X-rays, MRIs) ambapo ufafanuzi wa kitaalamu ni ghali na mdogo.

Kurekebisha mbinu kwa video kwa kuficha viraka vya muda wa angani ili kutoa mafunzo ya awali ya vielelezo vya utambuzi wa vitendo (VideoMAE)

Kujizoeza mapema kuhusu picha za setilaiti na angani ili kusaidia uchoraji wa ramani ya matumizi ya ardhi na ugunduzi wa mabadiliko bila lebo za mikono

Hatari & Walinzi

Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.

Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.

Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.

Ramani ya Utekelezaji

1

Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.

2

Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.

3

Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.

4

Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Masked Autoencoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Muse Mask Generative Imaging

Maswali yanayoulizwa mara kwa mara

What is Masked Autoencoders?

Masked Autoencoders (MAE) ni njia inayojisimamia ambayo hufunza muundo wa maono kuunda upya picha baada ya picha nyingi kufichwa. Kwa kujifunza kujaza nafasi zilizoachwa wazi, modeli hujenga uelewa mzuri wa kuona bila lebo zozote za kibinadamu.

Je, ni kazi gani kuu ya kujisimamia katika Kisimbo Kiotomatiki kilichofichwa?

MAE huficha alama nyingi za picha na kufundisha muundo kuunda upya pikseli ambazo hazipo, bila kuhitaji lebo za kibinadamu.

Takriban ni sehemu gani ya viraka vya picha ambavyo MAE asili huficha kwa kawaida?

Mask asilia ya MAE hufunika takriban 75% ya mabaka, uwiano wa juu unaolazimisha kielelezo kujifunza muundo wa maana badala ya kunakili majirani.

Kwa nini kisimbaji cha MAE huchakata tu viraka vinavyoonekana (vilivyofichwa)?

Kuruka ishara zilizofichwa kwenye kisimbaji hupunguza sana hesabu na kumbukumbu, kwani inashughulikia sehemu ndogo tu ya viraka.

Nini kinatokea kwa avkodare baada ya mafunzo ya awali ya MAE kukamilika?

Avkodare nyepesi inahitajika tu kwa ajili ya ujenzi upya wakati wa mafunzo ya awali; baadaye kisimbaji kilichojifunza huhamishwa hadi kwa kazi kama vile utambuzi.

Ni kazi gani ya upotezaji ambayo MAE hutumia kwa ujenzi upya?

MAE hupunguza maana ya hitilafu ya mraba kati ya thamani za pikseli zilizotabiriwa na za kweli, zinazokokotwa tu kwenye mabaka yaliyofunikwa.