基礎知識指南

遷移學習

遷移學習重用已經在大型資料集上訓練的模型,並將其適應新的相關任務。

閱讀時間約2分鐘最後更新

概述

Instead of starting from scratch, you stand on the shoulders of a model that already learned useful general features, saving enormous time, data, and compute.

深入探討

從零開始訓練強大的模型通常需要數百萬個標記範例和強大的硬體。遷移學習迴避了這一點。在大型資料集上進行預先訓練的模型,例如在 ImageNet 上訓練的圖像網路或在網路文字上訓練的語言模型,已經學習了廣泛有用的模式:視覺的邊緣和形狀、文字的語法和含義。您採用此預訓練模型並使其知識適應您較小的特定問題。主要有兩種風格。在特徵提取中,您凍結大部分網路並僅在頂部訓練一個新的輸出層。在微調過程中,您還可以解凍一些更深的層,並繼續以低學習率訓練它們,以便模型輕輕地調整您的數據,而不會忘記它所知道的內容。

技術洞察

預先訓練的網路學習層次結構:早期層捕捉通用特徵(邊緣、紋理、基本單字關係),而後面的層則捕捉特定於任務的概念。遷移學習利用了這一點。如果您的任務與原始任務類似,請將早期層凍結為固定特徵提取器並僅重新訓練頭部。如果您的資料差異較大,請使用非常小的學習率微調更深的層,以便更新是溫和的。最大的風險是領域轉移:如果新資料看起來與預訓練資料差異太大,那麼借用的特徵就不太適合。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

遷移學習的未來

遷移學習已成為建立人工智慧的預設方式。如今,幾乎沒有人從頭開始訓練大型視覺或語言模型;團隊改為採用預先訓練的基礎模型。最前沿的是 LoRA 和適配器等參數高效的方法,它們只需調整一小部分權重即可以低成本自訂巨型模型。預計這種趨勢將會加深:從大型模型中提取和微調的更小的、專業的模型,加上人們越來越關注在模型反覆調整時減輕領域轉移和避免「災難性遺忘」。

現實世界的實施

微調 ImageNet 預訓練網絡,僅用數千張照片即可偵測工廠生產線上的特定缺陷

透過對較小的專業語料庫進行微調,採用大型預訓練語言模型來起草法律或醫學摘要

使用一般語音訓練的模型作為起點來建構特定口音或方言的辨識器

重新訓練視覺模型的最後一層,以根據農業應用程式的葉子圖像對植物病害進行分類

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄遷移學習在哪些方面有幫助以及哪些更簡單的方法更好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Transfer Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

半監督學習

常見問題

What is Transfer Learning?

遷移學習重用已經在大型資料集上訓練的模型,並將其適應新的相關任務。您無需從頭開始,而是站在已經學習了有用的一般特徵的模型的肩膀上,從而節省大量時間、數據和計算。

遷移學習的核心概念是什麼?

遷移學習採用已經學習了一般特徵的模型並對其進行調整,從而節省資料、時間和計算。

為什麼在微調更深層時使用非常低的學習率?

小資料集上的大更新可能會覆蓋有價值的預訓練特徵並快速過度擬合,因此更新保持較小。

哪種情況最適合簡單特徵提取(凍結基礎)?

當目標任務接近原始任務且資料有限時,凍結的特徵已經相關,因此只需要一個新的頭。

「領域轉移」描述了遷移學習中的什麼問題?

如果目標域看起來與模型預先訓練的領域非常不同,則重用的特徵可能無法很好地傳輸並且準確性會下降。

為什麼預訓練網路的早期層通常比後面的層更容易重複使用?

早期的层捕获广泛有用的低级模式,而后面的层则更专门用于原始任务。