技術指南

對比學習

對比學習教導模型將相似的事物放在一起,並將不同的事物在嵌入空間中分開。

閱讀時間約2分鐘最後更新

概述

It matters because it lets AI learn powerful representations from mostly unlabeled data, powering image search, recommendations, and multimodal models.

深入探討

對比學習不是預測標籤,而是透過比較來學習:給定一個錨點,對模型進行訓練,以便匹配的「正」落在向量空間中靠近它的位置,而不匹配的「負」落在遠處。常見的自我監督方法(如 SimCLR)透過對相同影像進行兩次隨機增強(裁剪、顏色抖動、模糊)來創造正面效果;該批次中的其他所有內容均為陰性。該模型將輸入映射到向量,並且損失獎勵該對的高相似性和其餘的低相似性。這會產生距離反映含義的嵌入,因此下游任務需要的標籤要少得多。 CLIP 在各種模式中應用了相同的想法,將圖像與其標題相匹配。

技術洞察

主力損失是InfoNCE(相似度分數的softmax),通常用餘弦相似度除以控制正值偏好程度的溫度。至關重要的是,效能會隨著許多負面因素而提高,因此大批量或記憶體庫/佇列(如 MoCo)可以提供這些負面影響。 BYOL 和 SimSiam 等一些方法會放棄顯式負數,而是使用動量或停止梯度目標網路來避免崩潰,其中所有嵌入都變得相同。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

對比學習的未來

對比學習正在與屏蔽式和生成式自我監督融合成混合目標,捕捉全局相似性和細節。其最大的影響是多模式的:對比對齊的圖像文字(現在是音訊和視訊)嵌入支撐搜尋、檢索增強生成和零樣本分類,並且足跡將會增長。預計會有更多工作來減少對大批量的需求,更好的增強和負挖掘策略,以及將該方法擴展到標籤稀缺和昂貴的醫學成像和時間序列等領域。

現實世界的實施

CLIP 學習共享圖像文字空間,以便您可以使用鍵入的短語(如「滑板上的狗」)搜尋照片庫。

使用 SimCLR 在未標記的照片上預先訓練視覺主幹,然後對其進行微調,僅使用少量標記集進行疾病檢測。

建立產品或歌曲推薦,其中使用者喜歡的項目嵌入緊密結合在一起,以便進行最近鄰居檢索。

人臉驗證系統可以訓練嵌入,使同一個人的兩張照片距離很近,而不同人的兩張照片距離很遠。

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Contrastive Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is Contrastive Learning?

對比學習教導模型將相似的事物放在一起,並將不同的事物在嵌入空間中分開。這很重要,因為它可以讓人工智慧從大多數未標記的數據中學習強大的表示,從而為圖像搜尋、推薦和多模態模型提供支援。

對比學習的核心目標是什麼?

對比學習塑造了一個嵌入空間,因此匹配對很近,不匹配對則相距很遠。

在 SimCLR 這樣的自監督影像方法中,通常如何建立正對?

SimCLR 從一幅影像的兩個增強視圖中形成正片,而批次中的其他影像則作為負片。

哪一種損失函數與對比學習最相關?

InfoNCE 是一個關於溫度相似度分數的 softmax,是標準的對比目標。

為什麼像 MoCo 這樣的方法使用記憶體庫或佇列?

對比學習有很多缺點。隊列提供它們,同時保持批量大小易於管理。

BYOL 和 SimSiam 在不使用明確否定的情況下特別防範什麼問題?

如果沒有負數,模型可以輕鬆地將所有內容映射到同一個向量;停止梯度和動量目標可以防止這種崩潰。