Vizuální průvodce AI

Modely CLIP a Vision-Language

CLIP je model od OpenAI, který se učí spojovat obrázky a text umístěním obou do stejného matematického prostoru.

2 minuty čteníNaposledy aktualizováno

Přehled

It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.

Hluboký ponor

CLIP (předběžné školení kontrastního jazyka a obrázku), vydané v roce 2021, trénovalo zhruba 400 milionů párů obrázků a titulků seškrábaných z webu. Používá dva kodéry: jeden změní obrázek na vektor, druhý změní text na vektor a oba přistanou do sdíleného prostoru pro vkládání. Model se učí tak, že fotka psa a slova „fotka psa“ sedí blízko u sebe, zatímco nesourodé páry sedí daleko od sebe. To odemkne klasifikaci zero-shot: chcete-li označit obrázek, porovnáte jej s textovými popisy kategorií kandidátů a vyberete nejbližší, aniž byste museli trénovat vyhrazený klasifikátor. CLIP se stal základní infrastrukturou, řídil generátory obrázků, poháněl sémantické vyhledávání obrázků, filtroval datové sady a nasazoval dnešní větší modely vizuálního jazyka, jako je Flamingo, LLaVA a GPT-4V.

Technický přehled

CLIP je trénován s kontrastním objektivem. V dávce párů obrázek-text vypočítá podobnost (prostřednictvím kosinové podobnosti) mezi každým obrázkem a každým titulkem, poté upraví kodéry tak, aby maximalizovaly skóre pro správné páry a minimalizovaly skóre pro všechny špatné kombinace. Kodér obrazu je typicky Vision Transformer, který rozděluje obraz na pole; kodér textu je Transformer přes tokeny. Protože oba vytvářejí srovnatelné vektory, můžete za běhu přiřadit jakýkoli obrázek k libovolnému textu.

Strategický dopad

Rychlost a měřítko

Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.

Volby sestavy

Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.

Tým a pracovní postup

Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.

Budoucnost CLIP a Vision-Language Models

Zarovnání ve stylu CLIP je nyní stavebním kamenem uvnitř větších multimodálních modelů, které mohou také chatovat, uvažovat a odpovídat na otázky týkající se obrázků. Očekávejte větší a čistší tréninkové sady, podporu mnoha jazyků a rozšíření na video a zvuk. Výzkumníci pracují na snížení sociálních a demografických předsudků, které CLIP absorbuje z webových dat, a na zlepšení jemného porozumění (počítání objektů, čtení textu, prostorové vztahy), kde kontrastní modely zůstávají slabé. Jak otevřené verze, jako je OpenCLIP, dozrávají, bude se toto lepidlo mezi obrázky a textem šířit mezi nástroje pro vyhledávání, robotiku a usnadnění.

Real-World Implementace

Vyhledávání v knihovně fotografií s přirozenými frázemi jako „západ slunce nad horami“ namísto značek souborů

Navádění generátorů textu na obrázek tak, aby výstupy odpovídaly požadované výzvě

Označování nebezpečných obrázků nebo obrázků, které nesplňují zásady, jejich porovnáním s textovými popisy zakázaného obsahu

Automatické uspořádání nebo titulkování velkých neoznačených obrazových datových sad pro výzkum nebo elektronický obchod

Rizika a zábradlí

Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.

Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.

Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.

Plán implementace

1

Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.

2

Testujte s daty, která odpovídají reálným výrobním podmínkám.

3

Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.

4

Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CLIP and Vision-Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Modely vidění-jazyk-akce pro robotiku

Často kladené otázky

What is CLIP and Vision-Language Models?

CLIP je model od OpenAI, který se učí spojovat obrázky a text umístěním obou do stejného matematického prostoru. Je to tichý dříč za vyhledáváním obrázků, moderováním obsahu a mnoha generátory převodu textu na obrázek.

Jaká je hlavní myšlenka CLIP?

CLIP mapuje obrázky i text do jednoho sdíleného vektorového prostoru, takže lze přímo měřit jejich podobnost.

Jaký tréninkový přístup používá CLIP?

CLIP používá kontrastní objektiv: správné páry obrázek-titulek jsou přitaženy k sobě, zatímco neshodné páry jsou od sebe oddělovány.

Co znamená „klasifikace nulového záběru“ pomocí CLIP?

CLIP může označovat obrázky, pro jejichž klasifikaci nebyl nikdy speciálně trénován, jejich porovnáním s textovými popisy kandidátských kategorií.

Jak CLIP měří shodu obrázku a titulku?

CLIP zakóduje každý do vektoru a vypočítá kosinusovou podobnost; vyšší podobnost znamená užší sémantickou shodu.

Na jakém množství dat byl přibližně CLIP trénován?

CLIP se učil ze zhruba 400 milionů párů obrázků a titulků shromážděných z internetu, což mu poskytlo široké znalosti vizuálního jazyka.