技術指南

BYOL 和非對比性自我監督

BYOL(Bootstrap Your Own Latent)可以在沒有任何標籤的情況下學習有用的圖像表示,而且令人驚訝的是,沒有負面例子。

閱讀時間約2分鐘最後更新

概述

It showed that self-supervised learning need not rely on pushing apart dissimilar images, sidestepping the need for huge batches of negatives.

深入探討

大多數早期的自我監督方法都是對比的:它們將同一圖像的兩個增強視圖拉在一起,同時將不同的圖像分開,這需要許多負樣本以避免崩潰(網路為所有內容輸出相同的向量)。 DeepMind 在 2020 年推出的 BYOL 完全消除了負面影響。它使用兩個網路:線上網路和目標網路。一個圖像的兩個增強視圖透過兩個網路;線上網路新增了一個預測頭,並經過訓練來預測目標網路對另一個視圖的表示。至關重要的是,目標網路的權重不是透過梯度下降來訓練的。相反,它們是在線權重的指數移動平均值 (EMA)。這種不對稱性加上 EMA 目標可以防止對比方法擔心的微不足道的崩潰,匹配或擊敗 ImageNet 上的對比基準。

技術洞察

三種成分可以在沒有負數的情況下停止崩潰:在線分支上的額外預測器 MLP、目標分支上的停止梯度以及 EMA 更新的目標。該目標充當緩慢移動的回歸目標,因此線上網路追逐穩定的、滯後的目標,而不是其自身的行動副本。預測器的不對稱性打破了對稱性,否則會讓兩個分支平凡地輸出一個常數。投影機中的批量歸一化也有助於隱式正則化。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

BYOL 和非對比自我監督的未來

現在,非對比性的想法在很大程度上是自我監督的願景的基礎。 SimSiam 進一步剝離了 BYOL,表明如果保留停止梯度,則並不嚴格要求 EMA 目標,從而加深了對為何避免崩潰的理解。預計這些無標籤預訓練方法將繼續與蒙版影像建模和多模態訓練相結合,並擴展到標籤稀缺或昂貴的視訊、音訊、醫學成像和機器人領域,通常作為輕量級監督微調之前的預訓練階段。

現實世界的實施

在數百萬張未標記的照片上預先訓練視覺主幹,然後在缺乏專家註釋的小型標記醫學影像資料集上進行微調。

從原始相機流中學習機器人感知功能,無需手動標記,從而降低了教學操作任務的成本。

使用 BYOL 嵌入建立影像檢索和重複資料刪除系統,將視覺上相似的影像分組,而無需任何類別標籤。

在對土地利用或森林砍伐分類進行微調之前,在大量未標記的檔案上初始化衛星或航空影像模型。

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BYOL and Non-Contrastive Self-Supervision quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

偽標籤和自我訓練

常見問題

What is BYOL and Non-Contrastive Self-Supervision?

BYOL(Bootstrap Your Own Latent)可以在沒有任何標籤的情況下學習有用的圖像表示,而且令人驚訝的是,沒有負面例子。它表明,自我監督學習不需要依賴於推開不同的圖像,從而避免了對大量底片的需求。

是什麼讓 BYOL 在當時的自我監督方法中脫穎而出?

BYOL 表明,在沒有負對的情況下,強表示學習是可能的,這打破了對比方法。

BYOL 中目標網路的權重如何更新?

目標網路是在線網路的 EMA(慢速移動副本),並且沒有透過梯度下降進行訓練。

人們擔心消除底片時會發生什麼問題?為什麼這很重要?

如果沒有底片,簡單的設定可能會崩潰為恆定的輸出; BYOL 的設計可以防止這種情況發生。

哪個組件僅添加到線上分支以打破對稱性?

線上分支有一個額外的預測器頭;它產生的不對稱性是避免崩潰的關鍵。

線上網路實際上被訓練用來做什麼?

BYOL 最大限度地減少了線上預測與目標的其他視圖表示之間的差異。