基礎知識指南

數據增強

数据增强通过创建现有示例的修改副本(例如翻转或裁剪图像)来人为地扩展训练集。

閱讀時間約2分鐘最後更新

概述

It matters because more varied data reduces overfitting and helps models generalize to inputs they have not seen.

深入探討

資料增強透過對現有的資料應用標籤保留轉換來產生新的訓練範例。對於圖像來說,這意味著旋轉、翻轉、裁剪、色彩偏移、模糊和添加雜訊——這些改變會改變像素,但不會改變正確的答案(翻轉的貓仍然是貓)。對於文本,技術包括同義詞替換、反向翻譯(翻譯成另一種語言並返回)以及隨機單字刪除或交換。對於音頻,您可以添加背景噪音、移調音高或時間拉伸剪輯。目標是讓模型了解重要的不變性-物件的身分不依賴它的位置、光照或措詞。這使得模型更加穩健,並且在標記資料稀缺時尤其有價值,因為每個真實範例實際上都會變得很多。現代管道通常會在每個訓練時期動態隨機增強。

技術洞察

增強之所以有效,是因為它將有關不變性的先驗知識直接注入訓練中:透過向模型顯示範例的許多轉換版本,您可以鼓勵它學習忽略不相關變化的特徵。至關重要的是,轉換必須保留標籤——將“6”翻轉為“9”會教出錯誤的東西。高級方法不僅僅是簡單的編輯:Mixup 混合兩個圖像及其標籤、剪切蒙版區域以及學習策略(例如 AutoAugment 搜尋給定資料集的最佳轉換組合)。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

數據增強的未來

前沿是生成和學習增強:使用擴散模型或 GAN 來合成全新的、現實的訓練範例,而不僅僅是改造舊的訓練範例。自動增強搜尋(AutoAugment、RandAugment)正在減少手動調整,增強現在是自監督學習的核心,其中模型透過識別同一輸入的兩個增強視圖應該匹配來進行學習。預計增強技術與合成資料產生的界限將變得越來越模糊,特別是對於收集真實資料很困難的稀有類別和隱私敏感領域。

現實世界的實施

影像分類器對隨機旋轉、裁剪和顏色抖動的照片進行訓練,因此無論角度或光照如何,它都能識別物件。

NLP 團隊使用反向翻譯(英語到德語再反向翻譯)來釋義句子並擴展小型情緒分析資料集。

語音模型會添加背景咖啡館噪音並改變錄音的音高,以便在嘈雜的現實環境中保持準確。

醫療人工智慧應用彈性變形並翻轉到一組有限的 MRI 掃描,以在沒有新患者的情況下增加稀缺的標記範例。

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄資料增強在哪些方面有幫助以及在哪些方面更簡單的方法更好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Data Augmentation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

人工智慧與數據

常見問題

What is Data Augmentation?

数据增强通过创建现有示例的修改副本(例如翻转或裁剪图像)来人为地扩展训练集。这很重要,因为更多样的数据可以减少过度拟合,并帮助模型泛化到他们没有见过的输入。

資料增強的主要目的是什麼?

增強會建立現有資料的各種修改副本,以減少過度擬合並幫助模型處理看不見的輸入。

下列哪一項是常見的影像增強技術?

翻轉、裁切、旋轉和顏色偏移是標準的影像增強功能,可在保留標籤的同時變更像素。

反向翻譯在文字增強中扮演什麼角色?

回譯將文本通過另一種語言運行並返回,產生保留含義的改寫版本。

為什麼增強必須「保留標籤」?

轉換不應改變正確的答案 - 例如,將“6”翻轉為“9”會錯誤地標記範例。

Mixup 技術有什麼作用?

Mixup 透過線性組合輸入對及其標籤來建立新樣本,從而鼓勵更平滑的決策邊界。