Műszaki ÚTMUTATÓ

Tudáslepárlás

A tudás lepárlása egy kis „diák” modellt képez ki, hogy utánozzon egy nagy, pontos „tanár” modellt.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it shrinks powerful models so they run cheaply on phones and servers while keeping much of the accuracy.

Mély merülés

A nagy modellek pontosak, de lassúak és költségesek. A tudás lepárlása a képességeiket egy kompakt modellbe ülteti át azáltal, hogy a tanuló a tanári eredményekből tanul, nem csak a kemény címkékből. Hinton és munkatársai szerint a tanár teljes valószínűségi eloszlása ​​„sötét tudást” hordoz: még akkor is, ha „kutyát” jósol, a „farkas” és az „autó” relatív valószínűsége felfedi, hogy a tanár hogyan látja a hasonlóságokat. E valószínűségek hőmérséklettel való lágyítása feltárja ezt a struktúrát, és a tanulót megtanítják ennek megfeleltetésére, gyakran a valódi címkék mellett. Az eredmény egy kisebb, gyorsabb modell, amely jobban általánosít, mint a címkékre oktatott modell. A DistilBERT és a TinyBERT jól ismert desztillált nyelvi modellek.

Technikai betekintés

A klasszikus veszteség egyesíti a desztillációs kifejezést (KL eltérés a tanuló és a tanár lágyított valószínűségei között) a valódi címkék standard keresztentrópiájával. A lágyítás T hőmérsékletet használ a softmax-ban: a magasabb T simítja az eloszlást, így a kis osztályok közötti hasonlóságok tanulható jelekké válnak; a desztillációs gradienst jellemzően T-négyzet skálázza. A változatok túlmutatnak a kimeneteken: a jellemző alapú desztilláció a közbenső rejtett rétegeket, a reláció alapú desztilláció pedig a példák közötti kapcsolatokat.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

A tudás lepárlásának jövője

A lepárlás ma már a hatékony modellek szállításának szokásos lépése, és központi szerepet játszik a mai kisméretű, nyitott modellek hullámában. Egy gyorsan növekvő tendencia a szekvencia szintű lepárlás a nagy nyelvi modellekből, ahol egy erős modell képzési adatokat vagy érvelési nyomokat generál (beleértve a gondolati láncot is) a kisebb tanulók tanítása érdekében, elmosva a határvonalat szintetikus adatokkal. Szorosabb párosításra számíthat a kvantálással és metszéssel, több eszközön történő telepítéssel, valamint folyamatos vitákkal az engedélyezésről és a minőségről, amikor olyan szabadalmaztatott modellekből desztillál, amelyek kimenetei a versenytárs edzési jeleivé válnak.

Valós megvalósítás

A DistilBERT nagyjából 40%-kal kevesebb paraméterre tömöríti a BERT-et, miközben a nyelvértés nagy részét megtartja a gyorsabb következtetés érdekében.

Egy nagy látószögű modell zsugorítása, hogy a képosztályozó valós időben futhasson egy okostelefonos kameraalkalmazáson.

Egy nagy modell gondolati láncolatát egy kisebb modellbe lepárolni, hogy olcsóbban válaszoljon a matematikai vagy kódolási kérdésekre.

Modellek együttesének egyetlen tanulóba tömörítése, így a gyártási kiszolgálási költségek és a késleltetés jelentősebb pontossági veszteség nélkül csökkennek.

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Knowledge Distillation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Knowledge Distillation?

A tudás lepárlása egy kis „diák” modellt képez ki, hogy utánozzon egy nagy, pontos „tanár” modellt. Ez azért fontos, mert csökkenti az erős modelleket, így olcsón futnak telefonokon és szervereken, miközben megőrzik a pontosság nagy részét.

Mi a tudásdesztilláció célja?

A desztilláció a nagy tanári képességeket egy kompakt, gyorsabb diákmodellbe helyezi át.

Mit jelent a tanár „sötét tudása”?

A sötét tudás a tanár teljes valószínűségi eloszlásának szerkezete, például, hogy a „farkas” mennyire hasonlít a „kutyához”, nem csak a legfelső válasz.

Milyen szerepet játszik a hőmérséklet (T) a desztillációban?

A magasabb hőmérséklet ellaposítja a valószínűségi eloszlást, felfedi azokat a relatív hasonlóságokat, amelyeket a tanulónak tanulnia kell.

Melyik két komponenst egyesíti a klasszikus desztillációs veszteség?

A tanuló illeszkedik a tanár lágyított eloszlásához (KL-kifejezés), miközben illeszkedik az alapigazság címkéihez (keresztentrópia).

Melyik a desztillált nyelvi modell példa?

A DistilBERT egy jól ismert, a BERT-től desztillált modell, amely megőrzi a legtöbb teljesítményt sokkal kevesebb paraméterrel.