Mwongozo wa AI unaoonekana

CLIP na Vision-Lugha Models

CLIP ni kielelezo kutoka OpenAI ambacho hujifunza kuunganisha picha na maandishi kwa kuweka zote mbili katika nafasi sawa ya hisabati.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.

Dive ya kina

Iliyotolewa mwaka wa 2021, CLIP (Mafunzo ya Awali ya Lugha-Taswira) ilifunzwa kwa takribani jozi za manukuu milioni 400 zilizoondolewa kwenye wavuti. Inatumia encoders mbili: moja hugeuza picha kuwa vekta, nyingine inageuza maandishi kuwa vekta, na zote mbili zinatua katika nafasi ya pamoja ya kupachika. Mfano hujifunza ili picha ya mbwa na maneno "picha ya mbwa" kukaa karibu, wakati jozi zisizofaa zinakaa mbali. Hii inafungua uainishaji wa picha sifuri: kuweka lebo kwenye picha, unailinganisha dhidi ya maelezo ya maandishi ya kategoria za watahiniwa na kuchagua iliyo karibu zaidi, bila kufundisha kiainishaji aliyejitolea. CLIP ikawa miundombinu ya kimsingi, inayoongoza jenereta za picha, kuwezesha utafutaji wa taswira ya kisemantiki, kuchuja hifadhidata, na kupanda miundo mikubwa ya kisasa ya lugha ya maono kama vile Flamingo, LLaVA, na GPT-4V.

Ufahamu wa Kiufundi

CLIP imefunzwa kwa lengo la kutofautisha. Katika kundi la jozi za maandishi-picha, hukusanya ufanano (kupitia ufanano wa cosine) kati ya kila picha na kila nukuu, kisha hurekebisha visimbaji ili kuongeza alama kwa jozi sahihi na kupunguza alama kwa michanganyiko yote isiyo sahihi. Kisimbaji cha picha kwa kawaida ni Kibadilishaji Maono ambacho hugawanya picha katika viraka; kisimbaji maandishi ni Transformer juu ya tokeni. Kwa sababu zote mbili hutoa vekta kulinganishwa, unaweza kulinganisha picha yoyote na maandishi yoyote juu ya kuruka.

Athari za kimkakati

Kasi na kiwango

Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.

Tengeneza chaguzi

Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.

Timu na mtiririko wa kazi

Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.

Mustakabali wa CLIP na Vielelezo vya Lugha-Lugha

Mpangilio wa mtindo wa CLIP sasa ni mhimili wa miundo ndani ya miundo mikubwa zaidi ambayo inaweza pia kupiga gumzo, kusababu na kujibu maswali kuhusu picha. Tarajia seti kubwa na safi za mafunzo, usaidizi wa lugha nyingi, na upanuzi wa video na sauti. Watafiti wanafanya kazi ili kupunguza upendeleo wa kijamii na idadi ya watu CLIP unaofyonzwa kutoka kwa data ya wavuti, na kuboresha uelewa mzuri (kuhesabu vitu, maandishi ya kusoma, uhusiano wa anga) ambapo miundo tofauti inabaki dhaifu. Kadiri matoleo ya wazi kama vile OpenCLIP yanavyopevuka, gundi hii ya maandishi ya picha itaendelea kuenea katika utafutaji, robotiki na zana za ufikivu.

Utekelezaji wa Ulimwengu Halisi

Inatafuta maktaba ya picha yenye misemo ya asili kama "machweo juu ya milima" badala ya lebo za majina ya faili

Kuongoza jenereta za maandishi hadi picha ili matokeo yalingane na kidokezo kilichoombwa

Kuripoti picha zisizo salama au zisizo za sera kwa kuzilinganisha na maelezo ya maandishi ya maudhui yaliyopigwa marufuku

Kupanga kiotomatiki au kunukuu seti kubwa za picha zisizo na lebo kwa ajili ya utafiti au biashara ya mtandaoni

Hatari & Walinzi

Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.

Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.

Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.

Ramani ya Utekelezaji

1

Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.

2

Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.

3

Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.

4

Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CLIP and Vision-Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Vielelezo vya Vitendo vya Lugha-Maono kwa Roboti

Maswali yanayoulizwa mara kwa mara

What is CLIP and Vision-Language Models?

CLIP ni kielelezo kutoka OpenAI ambacho hujifunza kuunganisha picha na maandishi kwa kuweka zote mbili katika nafasi sawa ya hisabati. Ni farasi tulivu nyuma ya utafutaji wa picha, udhibiti wa maudhui, na jenereta nyingi za kubadilisha maandishi kwa picha.

Ni nini wazo kuu nyuma ya CLIP?

CLIP huweka picha na maandishi katika nafasi moja iliyoshirikiwa ya vekta ili mfanano wake uweze kupimwa moja kwa moja.

CLIP hutumia mbinu gani ya mafunzo?

CLIP hutumia lengo linganishi: jozi sahihi za manukuu ya picha husogezwa karibu huku jozi zisizolingana zikisukumwa kando.

'Uainishaji sifuri' na CLIP unamaanisha nini?

CLIP inaweza kuweka lebo kwenye picha ambazo haikufunzwa mahususi kuainisha kwa kuzilinganisha na maelezo ya maandishi ya kategoria za wagombea.

Je, CLIP hupima vipi ikiwa picha na manukuu yanalingana?

CLIP husimba kila moja kwenye vekta na kukokotoa kufanana kwa cosine; kufanana kwa juu kunamaanisha ulinganifu wa karibu wa kisemantiki.

Je, CLIP ilifunzwa kuhusu data ngapi?

CLIP ilijifunza kutoka kwa takribani jozi milioni 400 za manukuu ya picha zilizokusanywa kutoka kwenye mtandao, na kuipa maarifa mapana ya lugha inayoonekana.