Modely CLIP a Vision-Language
CLIP je model od OpenAI, který se učí spojovat obrázky a text umístěním obou do stejného matematického prostoru.
Přehled
It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.
Hluboký ponor
CLIP (předběžné školení kontrastního jazyka a obrázku), vydané v roce 2021, trénovalo zhruba 400 milionů párů obrázků a titulků seškrábaných z webu. Používá dva kodéry: jeden změní obrázek na vektor, druhý změní text na vektor a oba přistanou do sdíleného prostoru pro vkládání. Model se učí tak, že fotka psa a slova „fotka psa“ sedí blízko u sebe, zatímco nesourodé páry sedí daleko od sebe. To odemkne klasifikaci zero-shot: chcete-li označit obrázek, porovnáte jej s textovými popisy kategorií kandidátů a vyberete nejbližší, aniž byste museli trénovat vyhrazený klasifikátor. CLIP se stal základní infrastrukturou, řídil generátory obrázků, poháněl sémantické vyhledávání obrázků, filtroval datové sady a nasazoval dnešní větší modely vizuálního jazyka, jako je Flamingo, LLaVA a GPT-4V.
Technický přehled
CLIP je trénován s kontrastním objektivem. V dávce párů obrázek-text vypočítá podobnost (prostřednictvím kosinové podobnosti) mezi každým obrázkem a každým titulkem, poté upraví kodéry tak, aby maximalizovaly skóre pro správné páry a minimalizovaly skóre pro všechny špatné kombinace. Kodér obrazu je typicky Vision Transformer, který rozděluje obraz na pole; kodér textu je Transformer přes tokeny. Protože oba vytvářejí srovnatelné vektory, můžete za běhu přiřadit jakýkoli obrázek k libovolnému textu.
Strategický dopad
Rychlost a měřítko
Vizuální AI může automatizovat úkoly inspekce, detekce a označování ve velkém měřítku.
Volby sestavy
Kreativní týmy mohou prototypovat koncepty rychleji s menším počtem ručních revizí.
Tým a pracovní postup
Operace mohou využívat obrazové a video signály, které bylo dříve obtížné zpracovat.
Budoucnost CLIP a Vision-Language Models
Zarovnání ve stylu CLIP je nyní stavebním kamenem uvnitř větších multimodálních modelů, které mohou také chatovat, uvažovat a odpovídat na otázky týkající se obrázků. Očekávejte větší a čistší tréninkové sady, podporu mnoha jazyků a rozšíření na video a zvuk. Výzkumníci pracují na snížení sociálních a demografických předsudků, které CLIP absorbuje z webových dat, a na zlepšení jemného porozumění (počítání objektů, čtení textu, prostorové vztahy), kde kontrastní modely zůstávají slabé. Jak otevřené verze, jako je OpenCLIP, dozrávají, bude se toto lepidlo mezi obrázky a textem šířit mezi nástroje pro vyhledávání, robotiku a usnadnění.
Real-World Implementace
Vyhledávání v knihovně fotografií s přirozenými frázemi jako „západ slunce nad horami“ namísto značek souborů
Navádění generátorů textu na obrázek tak, aby výstupy odpovídaly požadované výzvě
Označování nebezpečných obrázků nebo obrázků, které nesplňují zásady, jejich porovnáním s textovými popisy zakázaného obsahu
Automatické uspořádání nebo titulkování velkých neoznačených obrazových datových sad pro výzkum nebo elektronický obchod
Rizika a zábradlí
Obrazová práva a souhlas se mohou stát právním rizikem, pokud je původ nejasný.
Výkon modelu se může lišit podle osvětlení, demografických údajů a prostředí.
Falešně pozitivní mohou zůstat bez povšimnutí, pokud nejsou monitorovány prahové hodnoty spolehlivosti.
Plán implementace
Definujte kritéria přijatelnosti pro přesnost, stažení a náklady na chyby.
Testujte s daty, která odpovídají reálným výrobním podmínkám.
Přidejte lidskou kontrolu pro předpovědi s nízkou spolehlivostí nebo velkým dopadem.
Sledujte posun modelu a znovu ověřte po změnách kamery nebo datové sady.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CLIP and Vision-Language Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Modely vidění-jazyk-akce pro robotiku
Často kladené otázky
What is CLIP and Vision-Language Models?
CLIP je model od OpenAI, který se učí spojovat obrázky a text umístěním obou do stejného matematického prostoru. Je to tichý dříč za vyhledáváním obrázků, moderováním obsahu a mnoha generátory převodu textu na obrázek.
Jaká je hlavní myšlenka CLIP?
CLIP mapuje obrázky i text do jednoho sdíleného vektorového prostoru, takže lze přímo měřit jejich podobnost.
Jaký tréninkový přístup používá CLIP?
CLIP používá kontrastní objektiv: správné páry obrázek-titulek jsou přitaženy k sobě, zatímco neshodné páry jsou od sebe oddělovány.
Co znamená „klasifikace nulového záběru“ pomocí CLIP?
CLIP může označovat obrázky, pro jejichž klasifikaci nebyl nikdy speciálně trénován, jejich porovnáním s textovými popisy kandidátských kategorií.
Jak CLIP měří shodu obrázku a titulku?
CLIP zakóduje každý do vektoru a vypočítá kosinusovou podobnost; vyšší podobnost znamená užší sémantickou shodu.
Na jakém množství dat byl přibližně CLIP trénován?
CLIP se učil ze zhruba 400 milionů párů obrázků a titulků shromážděných z internetu, což mu poskytlo široké znalosti vizuálního jazyka.