視覺變形金剛
視覺變換器 (ViTs) 將支援 ChatGPT 的變換器架構應用於影像,將圖片視為補丁序列而不是像素網格。
概述
They proved that you do not need convolutions to achieve state-of-the-art image recognition.
深入探討
多年來,卷積神經網路(CNN)透過掃描影像上的小濾鏡主導了電腦視覺。 Google 的 2020 年論文「一張圖像值得 16x16 個字」對此提出了挑戰,方法是將圖像切成固定的塊(通常為 16x16 像素),將每個塊展平為向量,並將生成的序列輸入標準轉換器。每個補丁都成為一個“令牌”,就像句子中的單字一樣。然後,該模型使用自註意力,因此每個補丁都可以直接與其他每個補丁相關,並捕獲小型捲積濾波器一步無法看到的遠端關係。問題是:ViT 需要大量數據,因為它們缺乏 CNN 的內建假設。在 JFT-300M 等龐大資料集上進行訓練後,它們匹配或擊敗了最好的 CNN,重塑了現代視覺研究。
技術洞察
ViT 將影像分割為不重疊的補丁,將每個補丁線性投影到嵌入中,並新增位置編碼,以便模型知道每個補丁位於原始影像中的位置。前面有一個特殊的可學習的「類別標記」;它的最終表示驅動分類。堆疊的自註意力層讓每個補丁權衡來自所有其他補丁的訊息,從第一層給出全局感受野。由於注意力隨塊的數量呈二次方縮放,因此高解析度圖像變得昂貴,這就是為什麼塊大小和有效的注意力變體很重要的原因。
戰略影響
速度與規模
視覺人工智慧可以大規模自動化檢查、檢測和標記任務。
配裝選擇
創意團隊可以透過更少的手動修改來更快地建立概念原型。
團隊與工作流程
操作可以使用以前難以處理的影像和視訊訊號。
視覺變形金剛的未來
ViT 和 CNN 變壓器混合體現在為領先的視覺系統提供動力,該架構支援將圖像與文字融合的多模態模型,例如 CLIP 和現代視覺語言助手。預計將繼續致力於降低高解析度和視訊的注意力,以及減少對標記資料的巨大需求的自我監督預訓練(例如掩模圖像建模)。隨著計算的成長,「語言模型」和「視覺模型」之間的界限不斷模糊,變壓器充當跨模式的共享骨幹,而不是單獨的專門設計。
現實世界的實施
ViT 證明與 CNN 具有競爭力後,Google 的圖像分類和搜尋排名系統採用了 Transformer 主幹
CLIP 和其他使用 ViT 對圖像進行編碼的圖像文字模型,以便可以在共享空間中匹配照片和標題
醫學影像研究使用 ViT 來發現整個掃描中的模式,而不僅僅是局部紋理
自動駕駛和機器人感知堆疊結合了 ViT 式註意力,可在整個視野範圍內進行場景理解
風險與防護欄
如果出處不明,肖像權和同意可能會成為法律風險。
模型表現可能因光照、人口統計和環境的不同而有所不同。
除非監控置信閾值,否則誤報可能會被忽略。
實施路線圖
定義精確度、召回率和錯誤成本的接受標準。
使用符合實際生產條件的數據進行測試。
為低置信度或高影響力的預測添加人工審核。
追蹤模型漂移並在相機或資料集變更後重新驗證。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Vision Transformers?
視覺變換器 (ViTs) 將支援 ChatGPT 的變換器架構應用於影像,將圖片視為補丁序列而不是像素網格。他們證明,不需要卷積即可實現最先進的影像辨識。
Vision Transformer 最初如何處理輸入影像?
ViT 將影像分割為固定的補丁(通常為 16x16 像素),將每個補丁嵌入為令牌,並將序列輸入轉換器。
什麼關鍵機制可以讓 ViT 將影像的遠距離部分相互關聯?
自註意讓每個補丁直接權衡其他補丁的信息,從第一層提供全局視圖。
為什麼普通視覺變形金剛通常需要非常大的訓練資料集才能表現出色?
與 CNN 不同,ViT 不假設局部性或平移不變性,因此它們必須從大量資料中學習這些模式。
Vision Transformer 中位置編碼的目的是什麼?
自註意力與順序無關,因此位置編碼可以恢復每個補丁的空間位置。
哪一種說法最能體現 ViT 對電腦視覺的影響?
ViT 證明,具有足夠資料和規模的純 Transformer 可以與最佳的捲積網路相媲美或超越。