技術指南

知識蒸餾

知識蒸餾訓練一個小型的「學生」模型來模仿一個大型的、準確的「教師」模型。

閱讀時間約2分鐘最後更新

概述

It matters because it shrinks powerful models so they run cheaply on phones and servers while keeping much of the accuracy.

深入探討

大模型很準確,但部署緩慢且昂貴。知识蒸馏通过让学生从教师的输出中学习而不仅仅是从硬标签中学习,将他们的能力转移到一个紧凑的模型中。 Hinton 及其同事的关键见解是,教师的完整概率分布带有“暗知识”:即使它预测“狗”,“狼”与“汽车”的相对概率也揭示了教师如何看待相似之处。用溫度軟化這些機率會暴露該結構,學生會接受訓練來匹配它,通常與真實的標籤一起。結果是一個更小、更快的模型,比僅根據標籤訓練的模型具有更好的泛化能力。 DistilBERT 和 TinyBERT 是著名的蒸餾語言模型。

技術洞察

經典損失將蒸餾項(學生和教師的軟化機率之間的 KL 散度)與真實標籤上的標準交叉熵結合。软化在 softmax 中使用温度 T:较高的 T 会使分布变得平坦,因此小的类间相似性会变成可学习的信号;蒸馏梯度通常按 T 平方缩放。變體超越輸出:基於特徵的蒸餾匹配中間隱藏層,基於關係的蒸餾匹配示例之間的關係。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

知識蒸餾的未來

蒸餾現在是交付高效模型的標準步驟,也是當今小型、功能強大的開放模型浪潮的核心。一个快速增长的趋势是从大型语言模型中进行序列级蒸馏,其中强大的模型生成训练数据或推理轨迹(包括思维链)来教授较小的学生,从而模糊了与合成数据的界限。当从输出成为竞争对手训练信号的专有模型中提取时,预计会与量化和修剪进行更紧密的配对,更多的设备上部署,以及有关许可和质量的持续争论。

現實世界的實施

DistilBERT 將 BERT 的參數壓縮了約 40%,同時保留了大部分語言理解,以實現更快的推理。

縮小大型視覺模型,以便影像分類器可以在智慧型手機相機應用程式上即時運行。

將大模型的思維鏈推理提煉成更小的模型,使其更便宜地回答數學或編碼問題。

將模型集合壓縮為單一學生,從而降低生產服務成本和延遲,而不會失去太多準確性。

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Knowledge Distillation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

人工智慧知識管理

常見問題

What is Knowledge Distillation?

知識蒸餾訓練一個小型的「學生」模型來模仿一個大型的、準確的「教師」模型。这很重要,因为它缩小了强大的模型,因此它们可以在手机和服务器上以较低的成本运行,同时保持大部分准确性。

知識蒸餾的目標是什麼?

蒸餾將大教師的能力轉化為緊湊、更快的學生模型。

老師的「暗知識」是什麼意思?

暗知識是老師全機率分佈中的結構,就像「狼」和「狗」有多相似,而不僅僅是最上面的答案。

溫度 (T) 在蒸餾中扮演什麼角色?

較高的溫度使機率分佈變得平坦,揭示了學生應該學習的相對相似性。

經典的蒸餾損失結合了哪兩個組成部分?

學生配對老師的軟化分佈(KL 項),同時也擬合真實標籤(交叉熵)。

哪一個是蒸餾語言模型的範例?

DistilBERT 是從 BERT 中提煉出來的著名模型,以更少的參數保留了大部分效能。