GHID AI vizual

Subtitrărea imaginii

Subtitrărea imaginilor este sarcina de a genera automat o propoziție în limbaj natural care descrie ceea ce este într-o imagine.

2 minute de lecturăUltima actualizare

Prezentare generală

It bridges vision and language, turning pixels into words that explain content, objects, and actions.

Scufundare în profunzime

Sistemele de subtitrări preiau o imagine și scot o descriere fluentă, cum ar fi „un câine maro care prinde un frisbee pe iarbă”. Sistemele timpurii au asociat o rețea convoluțională care extragea caracteristici vizuale cu o rețea recurentă (un LSTM) care genera cuvinte pe rând, adesea ghidate de atenție, astfel încât modelul „se uită” la regiunile relevante pentru fiecare cuvânt. Sistemele moderne folosesc codificatoare cu transformator pentru viziune și decodoare cu transformator pentru limbaj, iar modelele mari cu limbaj vizual precum BLIP-2 și GPT-4V pot subtitra imagini cu o fluență remarcabilă. Formarea se bazează pe seturi de date precum MS COCO, în care fiecare imagine are mai multe subtitrări scrise de oameni. Calitatea este măsurată cu valori precum CIDEr, BLEU și CLIPScore bazat pe încorporare.

Perspectivă tehnică

Majoritatea subtitrarilor urmează un model de codificator-decodor. Codificatorul convertește imaginea într-un set de vectori caracteristici; decodorul generează cuvinte în mod autoregresiv, prezicând fiecare simbol condiționat de imagine și cuvintele generate anterior. Atenția permite decodorului să cântărească diferite regiuni ale imaginii pe cuvânt, îmbunătățind împământarea. Antrenamentul folosește entropia încrucișată pe subtitrările adevărului de bază, uneori urmată de învățare prin consolidare care optimizează o măsurătoare de calitate a subtitrărilor, cum ar fi CIDEr, direct pentru a reduce părtinirea expunerii.

Impact strategic

Viteză și scară

Visual AI poate automatiza sarcinile de inspecție, detectare și etichetare la scară.

Alegeri de construcție

Echipele creative pot crea prototipuri mai rapid cu mai puține revizuiri manuale.

Echipa și fluxul de lucru

Operațiunile pot utiliza semnale de imagine și video care anterior erau greu de procesat.

Viitorul subtitrării imaginilor

Subtitrarea se contopește în modele generale de viziune-limbaj care nu numai că descriu, ci și răspund la întrebări, motivează și urmează instrucțiuni despre imagini. Așteptați-vă subtitrări mai dense și mai controlabile (lungime, stil sau focalizare ajustabile), o mai bună fundamentare faptică pentru a reduce obiectele halucinate și instrumente de accesibilitate mai puternice care povestesc lumea vizuală în timp real. Subtitrările multilingve și video se vor extinde, iar modelele de pe dispozitiv vor aduce descrieri private, instantanee, pe telefoane și articole portabile pentru utilizatorii nevăzători și cu vedere redusă.

Implementare în lumea reală

Generarea de descrieri alt-text ale fotografiilor, astfel încât cititoarele de ecran să poată ajuta utilizatorii nevăzători și cu vedere redusă

Subtitrări cu sugestie automată și etichete care pot fi căutate pentru biblioteci mari de fotografii și platforme de imagini stoc

Descrierea împrejurimilor cu voce tare prin aplicații precum Microsoft Seeing AI sau Be My Eyes

Indexarea cadrelor video cu descrieri de text pentru a permite căutarea și moderarea conținutului la scară

Riscuri și balustrade

Drepturile de imagine și consimțământul pot deveni riscuri legale dacă proveniența este neclară.

Performanța modelului poate varia în funcție de iluminare, demografie și mediu.

Falsele pozitive pot trece neobservate dacă nu sunt monitorizate pragurile de încredere.

Foaia de parcurs de implementare

1

Definiți criteriile de acceptare pentru costurile de precizie, rechemare și erori.

2

Testați cu date care corespund condițiilor reale de producție.

3

Adăugați o recenzie umană pentru predicții cu încredere scăzută sau cu impact ridicat.

4

Urmăriți derapajul modelului și revalidați după modificarea camerei sau a setului de date.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Image Captioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Modele de imagine FLUX

Întrebări frecvente

What is Image Captioning?

Subtitrărea imaginilor este sarcina de a genera automat o propoziție în limbaj natural care descrie ceea ce este într-o imagine. Face legătura între viziune și limbaj, transformând pixelii în cuvinte care explică conținutul, obiectele și acțiunile.

Ce produce un sistem de subtitrări pentru imagini ca rezultat?

Subtitrarea imaginii generează o propoziție text care descrie conținutul unei imagini.

Într-o conductă clasică de subtitrări, ce rol joacă codificatorul vizual?

Codificatorul (adesea un CNN sau un transformator de viziune) transformă imaginea în vectori caracteristici pe care decodorul de limbă îi folosește apoi.

De ce este utilă atenția în subtitrărea imaginilor?

Atenția îl ajută pe decodor să „privadă” cele mai relevante părți ale imaginii atunci când generează fiecare cuvânt, îmbunătățind împământarea.

Ce set de date este utilizat pe scară largă pentru instruirea și evaluarea subtitrării imaginilor?

MS COCO oferă imagini, fiecare asociată cu mai multe subtitrări scrise de oameni, făcându-l un standard de referință pentru subtitrări.

Ce înseamnă pentru un decodor de subtitrări să genereze cuvinte „autoregresiv”?

Generarea autoregresivă produce jetoane pe rând, fiecare condiționat de jetoanele anterioare și de imagine.