基礎知識指南

少樣本學習

少樣本學習是指從少數而不是數千個範例中學習新任務的能力。

閱讀時間約2分鐘最後更新

概述

It matters because it mirrors how humans generalize and lets modern AI adapt instantly without expensive retraining.

深入探討

傳統的機器學習需要巨大的標記資料集,但少樣本學習的目標是在每個類別僅看到幾個範例後表現良好。大型語言模型普及了上下文中的小樣本學習:您直接在提示中放置一些輸入輸出範例,模型會推斷出模式並將其應用於新的輸入,所有這些都無需更新其權重。這個術語來自對顯示的範例進行計數,通常寫為 N-way K-shot(N 個類,每個類有 K 個範例)。零樣本意味著沒有例子,一樣本意味著一個,而少樣本通常意味著兩個到幾十個。這是有效的,因為模型在預訓練期間已經吸收了廣泛的模式,因此一些範例主要提示要使用哪些現有技能。

技術洞察

上下文中的小樣本學習依賴 Transformer 閱讀提示中的範例並使用注意力來匹配模式,沒有梯度更新或權重變化。這些範例限制了模型對新輸入的下一個標記預測。一個單獨的系列、基於度量的方法(例如原型網路和匹配網路)會學習嵌入空間,在其中將新樣本與每個類別的幾個範例的平均值進行比較並選擇最接近的。兩條路線都利用了先前的學習,因此稀缺標籤大有幫助。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

少樣本學習的未來

小樣本學習正在成為人們使用大型模型的預設方式,因此前沿技術正在使其變得更加可靠:更好的範例選擇、排序和檢索,因此提示會自動選擇最有用的演示。期望與檢索更緊密地集成,以及適合更多示例的更長上下文窗口,以及對示例順序和格式擺動準確性為何如此之高的研究。隨著模型的改進,零樣本和少樣本之間的差距縮小了,以完成簡單的任務,而少樣本對於特殊格式和邊緣情況仍然很有價值。

現實世界的實施

在提示中顯示模型後,將客戶支援票證分類為每個類別的三個或四個標籤的範例。

透過提供兩個或三個範例輸入輸出對來教導聊天機器人特定的輸出格式(例如帶有命名欄位的 JSON)。

使用視覺系統中的原型網路從少數拍攝的樣本中識別出罕見的製造缺陷。

透過在請求中包含幾個前後範例,調整翻譯或摘要風格以匹配品牌的聲音。

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄少樣本學習在哪些方面有幫助以及在哪些方面更簡單的方法更好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Few-Shot Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is Few-Shot Learning?

少樣本學習是指從少數而不是數千個範例中學習新任務的能力。這很重要,因為它反映了人類的概括方式,並讓現代人工智慧能夠立即適應,而無需昂貴的再培訓。

在「N-way K-shot」符號中,K 指的是什麼?

K 是每個類別給出的範例數量,而 N 是類別數量(「方式」)。

當大型語言模型根據提示進行上下文中的幾次學習時,其權重會發生什麼?

上下文學習不執行梯度更新;提示中的範例只是指導模型的下一個標記預測。

零次提示和少次提示之間的主要差異是什麼?

零樣本僅提供說明,沒有範例,而少樣本則包含少量演示。

為什麼幾個例子就足以讓大型預訓練模型很好地執行新任務?

預訓練中的廣泛知識意味著一些演示主要表明可以使用哪些現有能力,而不是從頭開始教學。

其中描述了像原型網路這樣基於度量的小樣本方法?

原型網路為每個類別形成一個原型(平均嵌入),並透過學習空間中最近的原型對新點進行分類。