GHID tehnic

Distilarea cunoștințelor

Distilarea cunoștințelor antrenează un model mic de „elev” să imite un model mare și precis de „profesor”.

2 minute de lecturăUltima actualizare

Prezentare generală

It matters because it shrinks powerful models so they run cheaply on phones and servers while keeping much of the accuracy.

Scufundare în profunzime

Modelele mari sunt precise, dar lente și costisitoare de implementat. Distilarea cunoștințelor transferă capacitatea lor într-un model compact, făcându-l pe elev să învețe din rezultatele profesorului, mai degrabă decât doar din etichetele dure. Perspectiva cheie, de la Hinton și colegii, este că distribuția completă de probabilitate a unui profesor poartă „cunoștințe întunecate”: chiar și atunci când prezice „câine”, probabilitățile relative pentru „lup” versus „mașină” dezvăluie modul în care profesorul vede asemănările. Înmuierea acestor probabilități cu o temperatură expune acea structură, iar elevul este antrenat să o potrivească, adesea alături de etichetele adevărate. Rezultatul este un model mai mic, mai rapid, care se generalizează mai bine decât unul antrenat doar pe etichete. DistilBERT și TinyBERT sunt modele de limbaj distilat bine-cunoscute.

Perspectivă tehnică

Pierderea clasică combină un termen de distilare (divergența KL între probabilitățile diminuate ale elevului și profesorului) cu o entropie încrucișată standard pe etichete adevărate. Înmuierea folosește o temperatură T în softmax: T mai mare aplatizează distribuția, astfel încât micile asemănări între clase devin semnale care pot fi învățate; gradientul de distilare este de obicei scalat cu T-pătrat. Variantele merg dincolo de rezultate: distilarea bazată pe caracteristici se potrivește cu straturile ascunse intermediare, iar distilarea bazată pe relații se potrivește cu relațiile dintre exemple.

Impact strategic

Cost și buget

Deciziile de arhitectură generează performanța și costurile de operare de ani de zile.

Decizii mai clare

Educația tehnică ajută echipele să aleagă stiva potrivită, nu doar cea mai nouă.

Controlul calității

Opțiuni de inginerie mai bune reduc incidentele de fiabilitate în producție.

Viitorul distilarii cunoasterii

Distilarea este acum o etapă standard în transportul de modele eficiente și este esențială pentru valul de modele deschise mici și capabile de astăzi. O tendință în creștere rapidă este distilarea la nivel de secvență din modele de limbaj mari, în care un model puternic generează date de antrenament sau urme de raționament (inclusiv lanțul de gândire) pentru a-i preda pe studenții mai mici, estompând linia cu date sintetice. Așteptați-vă la o asociere mai strânsă cu cuantificare și tăiere, mai multă implementare pe dispozitiv și dezbatere continuă despre licențiere și calitate atunci când distilați din modele proprietare ale căror rezultate devin semnalul de antrenament al concurentului.

Implementare în lumea reală

DistilBERT comprimând BERT la aproximativ 40% mai puțini parametri, păstrând în același timp cea mai mare parte a înțelegerii limbajului pentru o inferență mai rapidă.

Reducerea unui model de viziune mare, astfel încât un clasificator de imagini să poată rula în timp real pe o aplicație de cameră pentru smartphone.

Distilarea raționamentului în lanț de gândire al unui model mare într-un model mai mic pentru a-l face să răspundă la întrebările de matematică sau de codificare mai ieftin.

Comprimarea unui ansamblu de modele într-un singur student, astfel încât costurile de producție și latența să scadă fără pierderi mari de precizie.

Riscuri și balustrade

Optimizarea unui punct de referință poate ascunde slăbiciunile mai largi ale sistemului.

Costurile de infrastructură și întreținere sunt adesea subestimate.

Lacunele de securitate și observabilitate pot crește pe măsură ce sistemele devin mai complexe.

Foaia de parcurs de implementare

1

Definiți obiectivele de latență, calitate și cost înainte de implementare.

2

Benchmark în condiții realiste de încărcare și date.

3

Monitorizarea instrumentelor pentru erori, deriva și impactul utilizatorului.

4

Pregătiți căile de retragere și răspuns la incident înainte de scalare.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Knowledge Distillation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Managementul cunoștințelor AI

Întrebări frecvente

What is Knowledge Distillation?

Distilarea cunoștințelor antrenează un model mic de „elev” să imite un model mare și precis de „profesor”. Contează pentru că micșorează modelele puternice, astfel încât acestea să funcționeze ieftin pe telefoane și servere, păstrând în același timp o mare parte din precizie.

In knowledge distillation, what is the student model trained to do?

Distilarea transferă capacitatea unui profesor mare într-un model de elev compact și mai rapid.

Ce se înțelege prin „cunoașterea întunecată” a profesorului?

Cunoașterea întunecată este structura în distribuția completă de probabilitate a profesorului, cum ar fi cât de asemănător este „lupul” cu „câine”, nu doar răspunsul de top.

Ce rol joacă temperatura (T) în distilare?

O temperatură mai mare aplatizează distribuția probabilității, dezvăluind asemănările relative pe care elevul ar trebui să le învețe.

Pierderea clasică prin distilare combină care două componente?

Elevul se potrivește cu distribuția atenuată a profesorului (termen KL), în timp ce se potrivește și etichetele de adevăr de bază (entropie încrucișată).

Care este un exemplu de model de limbaj distilat?

DistilBERT este un model binecunoscut distilat de la BERT, păstrând cea mai mare performanță cu mult mai puțini parametri.