視覺人工智慧指南

CLIP 和視覺語言模型

CLIP 是來自 OpenAI 的模型,它透過將圖像和文字放置在同一數學空間中來學習連接圖像和文字。

閱讀時間約2分鐘最後更新

概述

It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.

深入探討

CLIP(對比語言-圖像預訓練)於 2021 年發布,使用從網路上抓取的約 4 億個圖像-標題對進行訓練。它使用兩個編碼器:一個將圖像轉換為向量,另一個將文字轉換為向量,並且兩者都位於共享的嵌入空間中。該模型進行學習,以便將狗的照片和“狗的照片”一詞放在一起,而不匹配的配對則放在很遠的位置。這解鎖了零樣本分類:要標記圖像,您可以將其與候選類別的文字描述進行比較並選擇最接近的,而無需訓練專用的分類器。 CLIP 成為基礎設施,指導圖像生成器,支援語義圖像搜索,過濾資料集,並為當今更大的視覺語言模型(如 Flamingo、LLaVA 和 GPT-4V)提供種子。

技術洞察

CLIP 是按照對比目標進行訓練的。在一批圖像-文字對中,它計算每個圖像和每個標題之間的相似度(通過餘弦相似度),然後調整編碼器以最大化正確對的分數並最小化所有錯誤組合的分數。圖像編碼器通常是一個 Vision Transformer,它將圖片分割成多個區塊;文字編碼器是令牌上的轉換器。由於兩者都會產生可比較的向量,因此您可以將任何圖像與任何文字即時匹配。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

CLIP 和視覺語言模型的未來

CLIP 式對齊現在是大型多模態模型中的構建塊,這些模型還可以聊天、推理和回答有關圖像的問題。期待更大、更乾淨的訓練集、對多種語言的支援以及對視訊和音訊的擴展。研究人員正在努力減少 CLIP 從網路數據中吸收的社會和人口統計偏見,並提高對比模型仍然薄弱的細粒度理解(計算對象、閱讀文本、空間關係)。隨著 OpenCLIP 等開放版本的成熟,這種影像文字黏合將繼續在搜尋、機器人和輔助工具中傳播。

現實世界的實施

使用“山上日落”等自然短語而不是檔案名稱標籤搜尋照片庫

指導文字到圖像生成器,使輸出與請求的提示匹配

透過將不安全或不符合政策的圖像與禁止內容的文字描述進行比較來標記它們

自動組織大型未標記影像資料集或為其添加字幕,以用於研究或電子商務

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CLIP and Vision-Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

機器人視覺-語言-動作模型

常見問題

What is CLIP and Vision-Language Models?

CLIP 是來自 OpenAI 的模型,它透過將圖像和文字放置在同一數學空間中來學習連接圖像和文字。它是圖像搜尋、內容審核和許多文字到圖像生成器背後的安靜主力。

CLIP背後的核心思想是什麼?

CLIP 將圖像和文字映射到一個共享向量空間中,以便可以直接測量它們的相似性。

CLIP 使用什麼訓練方法?

CLIP 使用對比目標:正確的圖像標題對被拉近,而不匹配的圖像標題對被推開。

CLIP 中的「零樣本分類」是什麼意思?

CLIP 可以透過將圖像與候選類別的文字描述進行比較來標記從未經過專門訓練來分類的圖像。

CLIP 如何衡量圖像和標題是否匹配?

CLIP將每個編碼成向量並計算餘弦相似度;相似度越高意味著語義匹配越接近。

CLIP 大約使用了多少資料進行訓練?

CLIP 從互聯網上收集的大約 4 億個圖像標題對中學習,為其提供了廣泛的視覺語言知識。