Mwongozo wa AI unaoonekana

Manukuu ya Picha

Manukuu ya picha ni jukumu la kuunda sentensi ya lugha asili kiotomatiki inayoelezea kile kilicho kwenye picha.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It bridges vision and language, turning pixels into words that explain content, objects, and actions.

Dive ya kina

Mifumo ya manukuu ya picha huchukua picha na kutoa maelezo fasaha kama vile 'mbwa wa kahawia anayeshika nyuki kwenye nyasi.' Mifumo ya awali ilioanisha mtandao wa ushawishi ambao ulitoa vipengele vya kuona na mtandao unaojirudia (LSTM) ambao ulitokeza maneno moja baada ya nyingine, mara nyingi yakiongozwa na umakini ili modeli 'iangalie' maeneo husika kwa kila neno. Mifumo ya kisasa hutumia usimbaji wa transfoma kwa ajili ya kuona na visimbuaji vya kibadilishaji cha lugha, na miundo mikubwa ya lugha ya kuona kama BLIP-2 na GPT-4V inaweza kunukuu picha kwa ufasaha wa ajabu. Mafunzo hutegemea seti za data kama vile MS COCO, ambapo kila picha ina manukuu mengi yaliyoandikwa na binadamu. Ubora hupimwa kwa vipimo kama vile CIDER, BLEU, na CLIPScore kulingana na upachikaji.

Ufahamu wa Kiufundi

Vinukuu vingi hufuata mchoro wa kusimbua-kisimbaji. Kisimbaji hubadilisha picha kuwa seti ya vekta za kipengele; avkodare inazalisha maneno autoregressively, kutabiri kila ishara conditioned juu ya picha na maneno yaliyotolewa awali. Uangalifu huruhusu kisimamizi uzito wa maeneo tofauti ya picha kwa kila neno, kuboresha uwekaji msingi. Mafunzo hutumia maelezo mafupi kwenye manukuu ya ukweli, wakati mwingine ikifuatiwa na mafunzo ya uimarishaji ambayo huboresha kipimo cha ubora wa manukuu kama CIDER moja kwa moja ili kupunguza upendeleo wa kukaribia aliyeambukizwa.

Athari za kimkakati

Kasi na kiwango

Visual AI inaweza kufanya ukaguzi, ugunduzi na kazi za kuweka lebo kiotomatiki kwa kiwango.

Tengeneza chaguzi

Timu bunifu zinaweza kuiga dhana kwa haraka zaidi na masahihisho machache ya mikono.

Timu na mtiririko wa kazi

Uendeshaji unaweza kutumia ishara za picha na video ambazo hapo awali zilikuwa ngumu kuchakata.

Mustakabali wa Manukuu ya Picha

Manukuu ni kuunganishwa katika miundo ya jumla ya lugha ya maono ambayo sio tu inaelezea bali pia kujibu maswali, sababu, na kufuata maagizo kuhusu picha. Tarajia manukuu mnene, yanayoweza kudhibitiwa zaidi (urefu unaoweza kubadilishwa, mtindo, au mwelekeo), uwekaji msingi bora wa ukweli ili kuzuia vitu vilivyoangaziwa, na zana thabiti za ufikivu zinazosimulia ulimwengu unaoonekana kwa wakati halisi. Manukuu ya lugha nyingi na video yatapanuka, na miundo ya kifaa italeta maelezo ya faragha, ya papo hapo kwa simu na vifaa vya kuvaliwa kwa watumiaji vipofu na wasioona vizuri.

Utekelezaji wa Ulimwengu Halisi

Inazalisha maelezo ya maandishi ya ziada ya picha ili visoma skrini viweze kusaidia watumiaji wasioona na wasioona vizuri

Manukuu yanayopendekeza kiotomatiki na lebo zinazoweza kutafutwa kwa maktaba kubwa za picha na majukwaa ya picha za hisa

Kuelezea mazingira kwa sauti kupitia programu kama vile Microsoft Kuona AI au Kuwa Macho Yangu

Kuorodhesha fremu za video kwa maelezo ya maandishi ili kuwezesha utafutaji wa maudhui na udhibiti kwa kiwango

Hatari & Walinzi

Haki za picha na idhini zinaweza kuwa hatari za kisheria ikiwa asili haiko wazi.

Utendaji wa muundo unaweza kutofautiana katika mwangaza, idadi ya watu na mazingira.

Chanya za uwongo zinaweza kutotambuliwa isipokuwa viwango vya uaminifu vifuatiliwe.

Ramani ya Utekelezaji

1

Bainisha vigezo vya kukubalika vya usahihi, kumbukumbu na gharama za makosa.

2

Jaribu kwa kutumia data inayolingana na hali halisi ya uzalishaji.

3

Ongeza ukaguzi wa kibinadamu kwa utabiri wa chini au utabiri wa athari kubwa.

4

Fuatilia mtindo wa kuteleza na uthibitishe upya baada ya mabadiliko ya kamera au mkusanyiko wa data.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Image Captioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Mifano ya Picha za FLUX

Maswali yanayoulizwa mara kwa mara

What is Image Captioning?

Manukuu ya picha ni jukumu la kuunda sentensi ya lugha asili kiotomatiki inayoelezea kile kilicho kwenye picha. Huunganisha maono na lugha, na kugeuza saizi kuwa maneno yanayoelezea yaliyomo, vitu na vitendo.

Je, mfumo wa manukuu ya picha hutoa nini kama pato?

Manukuu ya picha hutengeneza sentensi ya maandishi inayoelezea yaliyomo kwenye picha.

Katika muundo wa kawaida wa manukuu, kisimbaji cha kusimba kinacheza jukumu gani?

Kisimbaji (mara nyingi CNN au kibadilishaji maono) hugeuza picha kuwa vivekta vya vipengele ambavyo kisimbuaji lugha hutumia kisha.

Kwa nini umakini ni muhimu katika manukuu ya picha?

Uangalifu husaidia avkodare 'kuangalia' sehemu muhimu zaidi za picha wakati wa kutengeneza kila neno, kuboresha msingi.

Ni mkusanyiko gani wa data unaotumika sana kwa mafunzo na kutathmini manukuu ya picha?

MS COCO hutoa picha kila moja iliyooanishwa na manukuu mengi yaliyoandikwa na binadamu, na kuifanya iwe alama ya kawaida ya manukuu.

Inamaanisha nini kwa avkodare ya nukuu kutoa maneno 'autoregressively'?

Kizazi kiotomatiki hutoa tokeni moja baada ya nyingine, kila moja ikiwekwa kwenye tokeni za awali na picha.