主動學習
主動學習是一種訓練策略,模型本身會選擇人類接下來應該標記哪些未標記的範例。
概述
這很重要,因為標註資料成本高昂,而智慧選擇能用極少的註解達到高準確度。
深入探討
大多數監督學習假設您已經擁有大量標記資料。主動學習翻轉了這一點:你從一個小的標記集和大量未標記的示例開始,然後反复要求人類(“預言家”)僅標記信息最豐富的示例。該模型經過訓練,用於對未標記的池進行評分,並且發送最高值的範例進行標記 - 然後重複循環。常見的選擇策略包括不確定性抽樣(選擇模型最不自信的範例)、委員會查詢(選擇整體不同意的地方)和多樣性抽樣(涵蓋資料的不同區域)。如果做得好,主動學習可以使用更少的標籤來匹配完整資料集的準確性,這就是為什麼它在醫學影像、自然語言處理以及專家註釋緩慢或昂貴的任何領域流行的原因。
技術洞察
核心思想是在付費標記每個未標記點之前估計其「價值」。不確定性取樣使用模型本身的機率 - 例如,選擇頂級類別機率最接近機會的點,或選擇前兩類之間具有最高熵或最小間隔的點。委員會詢問訓練多個模型並選擇他們最不同意的點。一個關鍵的風險是抽樣偏差:貪婪地追逐不確定性可能會忽略整個區域,因此通常會結合多樣性或批量感知方法。
戰略影響
更明確的決策
它可以幫助您將清晰的技術聲明與行銷語言分開。
成本與預算
在花費金錢或時間之前,您可以提出更好的實施問題。
團隊與工作流程
具有共同理解的團隊可以做出更好的產品、政策和學習決策。
主動學習的未來
主動學習越來越多地與大型預訓練和基礎模型相結合,其目標從標記所有內容轉變為對一些高價值範例進行廉價的微調。預計與弱監督、自監督預訓練和人機循環工具的更緊密整合,為審閱者提供標籤以供確認而不是創建。由於標籤成本在許多實際部署中占主導地位,因此自動選擇加上高效的註釋介面仍將是在醫學和法律等資料稀缺的專業領域中建立模型的核心。
現實世界的實施
放射學團隊透過讓模型標記最模糊的掃描供放射專家進行標記來訓練腫瘤檢測器,從而大大減少註釋時間。
垃圾郵件或內容審核系統會顯示人類審查者最不確定的邊界訊息,在硬邊界情況下改進得最快。
語音辨識公司選擇其模型最不確定的音訊剪輯(口音、噪音)來發送轉錄,而不是標記隨機剪輯。
電子商務目錄使用委員會查詢來挑選多個分類器不同意的產品圖像,並優先考慮它們以進行手動類別標記。
風險與防護欄
不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。
基準測試可能看起來很強大,但實際效能卻參差不齊。
忽視數據品質和評估計劃通常會產生脆弱的結果。
實施路線圖
從您需要的結果的簡單語言定義開始。
在測試之前選擇一種成功指標和一種失敗條件。
使用代表性資料運行小型試點,而不是完善的演示集。
記錄主動學習在哪些方面有幫助以及在哪些方面更簡單的方法更好。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Active Learning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
什麼是主動學習?
主動學習是一種訓練策略,模型本身會選擇人類接下來應該標記哪些未標記的範例。這很重要,因為標記資料非常昂貴,而智慧選擇可以透過一小部分註釋達到高精度。
主動學習的主要目標是什麼?
主動學習的目的是透過選擇資訊最豐富的點供人類註釋,從而最大限度地提高每個標記範例的模型效能。
在主動學習中,什麼是「神諭」?
預言機是標籤來源(通常是人類專家),模型在選定的範例上查詢真實標籤。
哪種策略選擇模型最不自信的範例?
不確定性採樣選擇模型的預測機率最接近猜測的點,例如高熵或頂級類別之間的小差距。
委員會詢問如何決定標記哪些範例?
委員會詢問會訓練一個整體,並優先考慮成員不同意的點,因為分歧標誌著資訊豐富的區域。
僅依賴不確定性抽樣的主要風險是什麼?
貪婪地追逐不確定點可能會過度關註一個區域而錯過其他區域,因此通常會添加多樣性或批量感知方法。