РЪКОВОДСТВО за визуален AI

CLIP и Vision-Language модели

CLIP е модел от OpenAI, който се научава да свързва изображения и текст, като поставя и двете в едно и също математическо пространство.

2 min readПоследна актуализация

Преглед

It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.

Дълбоко гмуркане

Издаден през 2021 г., CLIP (предварително обучение за контрастен език-изображение) се обучава на приблизително 400 милиона двойки изображения-надписи, извлечени от мрежата. Той използва два енкодера: единият превръща изображение във вектор, другият превръща текст във вектор и двата се приземяват в споделено пространство за вграждане. Моделът се учи така, че снимка на куче и думите „снимка на куче“ да стоят близо една до друга, докато несъответстващите двойки са далеч една от друга. Това отключва нулева класификация: за да етикетирате изображение, вие го сравнявате с текстови описания на категории кандидати и избирате най-близката, без да тренирате специален класификатор. CLIP се превърна в основополагаща инфраструктура, насочвайки генераторите на изображения, задвижвайки семантичното търсене на изображения, филтрирайки набори от данни и зареждайки днешните по-големи модели на визуални езици като Flamingo, LLaVA и GPT-4V.

Техническа информация

CLIP се обучава с контрастна цел. В пакет от двойки изображение-текст, той изчислява сходството (чрез косинусово сходство) между всяко изображение и всеки надпис, след което настройва енкодерите, за да увеличи максимално резултатите за правилните двойки и да минимизира резултатите за всички грешни комбинации. Кодиращият образ обикновено е Vision Transformer, който разделя картината на части; текстовият енкодер е трансформатор над токени. Тъй като и двете произвеждат сравними вектори, можете да свържете всяко изображение с всеки текст в движение.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на моделите CLIP и Vision-Language

Подравняването в стил CLIP вече е градивен елемент в по-големи мултимодални модели, които също могат да чатят, разсъждават и отговарят на въпроси относно изображения. Очаквайте по-големи и по-чисти комплекти за обучение, поддръжка за много езици и разширение за видео и аудио. Изследователите работят за намаляване на социалните и демографски отклонения, абсорбирани от CLIP от уеб данни, и за подобряване на финото разбиране (броене на обекти, четене на текст, пространствени отношения), където контрастните модели остават слаби. Тъй като отворените версии като OpenCLIP стават зрели, това лепило за изображение и текст ще продължи да се разпространява в инструментите за търсене, роботика и достъпност.

Внедряване в реалния свят

Търсене във фотобиблиотека с естествени фрази като „залез над планините“ вместо тагове с имена на файлове

Насочване на генераторите на текст към изображение, така че резултатите да съответстват на заявената подкана

Маркиране на опасни или извън правилата изображения чрез сравняването им с текстови описания на забранено съдържание

Автоматично организиране или добавяне на надписи към големи набори от данни без етикети за изследвания или електронна търговия

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CLIP and Vision-Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Визия-език-действие модели за роботика

Frequently asked questions

What is CLIP and Vision-Language Models?

CLIP е модел от OpenAI, който се научава да свързва изображения и текст, като поставя и двете в едно и също математическо пространство. Това е тихият работен кон зад търсенето на изображения, модерирането на съдържание и много генератори на текст към изображение.

Каква е основната идея зад CLIP?

CLIP картографира както изображения, така и текст в едно споделено векторно пространство, така че тяхната прилика може да бъде измерена директно.

Какъв подход за обучение използва CLIP?

CLIP използва контрастираща цел: правилните двойки изображение-надпис се приближават, докато несъответстващите двойки се раздалечават.

Какво означава „класификация с нулев изстрел“ с CLIP?

CLIP може да етикетира изображения, които никога не е бил специално обучаван да класифицира, като ги сравнява с текстови описания на категории кандидати.

Как CLIP измерва дали изображение и надпис съвпадат?

CLIP кодира всеки във вектор и изчислява косинус подобие; по-голямото сходство означава по-близко семантично съвпадение.

Приблизително върху колко данни е обучен CLIP?

CLIP се учи от приблизително 400 милиона двойки изображения-надписи, събрани от интернет, което му дава широки визуално-езични познания.