GUIDA TECNICA

KL Divergenza

La divergenza di Kullback-Leibler (KL) misura il costo informativo aggiuntivo previsto derivante dall'utilizzo di una distribuzione di probabilità per rappresentarne un'altra.

  • 3 minuti di lettura
  • Ultimo aggiornamento
In questa pagina3 minuti di lettura
  1. Panoramica
  2. Immersione profonda
  3. Impatto strategico
  4. Il futuro della divergenza di KL
  5. Implementazione nel mondo reale
  6. Rischi e guardrail
  7. Tabella di marcia per l'implementazione
  8. Continua a esplorare
  9. Domande frequenti

Panoramica

È non negativo ma asimmetrico, quindi lo scambio delle distribuzioni di riferimento e di confronto generalmente modifica il risultato e può cambiare la scelta di modellazione che appare preferibile.

Immersione profonda

Per distribuzioni discrete p e q sugli stessi risultati, la divergenza KL è D_KL(p||q) = somma sui risultati p(x) log(p(x)/q(x)). Confronta q con un riferimento p, ponderando ciascun rapporto logaritmico in base alla frequenza con cui il risultato si verifica sotto p. Nella teoria dell'informazione, può essere interpretato come un costo aggiuntivo di codifica previsto quando un codice è ottimizzato per q ma la distribuzione reale è p. La base logaritmica imposta l'unità: i logaritmi naturali danno nat e la base due dà bit. La divergenza KL non è negativa ed è uguale a zero quando le distribuzioni corrispondono su risultati con probabilità positiva sotto p, fatte salve considerazioni di supporto. È asimmetrico: D_KL(p||q) generalmente non è D_KL(q||p). Ciò lo rende inadatto come distanza geometrica convenzionale. La direzione è importante in applicazioni come l'inferenza variazionale, dove una distribuzione viene trattata come un obiettivo e un'altra come un'approssimazione. Nell'esempio della moneta equa rispetto a quella distorta, p=(0,5,0,5) e q=(0,9,0,1). I contributi con valori in bit sono 0,5 log2(0,5/0,9), circa -0,424 e 0,5 log2(0,5/0,1), circa 1,161. La loro somma è di circa 0,737 bit. Sono consentiti termini individuali negativi anche se la divergenza totale non è negativa. L'inversione di p e q produce un valore diverso perché cambiano anche i pesi. Le mancate corrispondenze del supporto sono importanti. Se p assegna una probabilità positiva a un risultato in cui q assegna zero, la corrispondente divergenza diretta è infinita. Se entrambi assegnano zero, quel risultato contribuisce per convenzione con zero nella somma discreta. Per le distribuzioni continue, KL è scritto come integrale del rapporto di densità logaritmica sotto P; la finitezza richiede che P sia assolutamente continuo rispetto a Q. La funzione entropica di SciPy calcola l'entropia di Shannon con una distribuzione e l'entropia relativa quando viene fornito q; verificare la normalizzazione e la direzione dell'input. KL è utile per confrontare le distribuzioni, ma di per sé non dice se un modello è utile per una decisione a valle.

Impatto strategico

Costo e budget

Le decisioni relative all'architettura determinano prestazioni e costi operativi per anni.

Decisioni più chiare

La formazione tecnica aiuta i team a scegliere lo stack giusto, non solo quello più nuovo.

Controllo di qualità

Migliori scelte ingegneristiche riducono gli incidenti legati all’affidabilità nella produzione.

Il futuro della divergenza di KL

I confronti tra distribuzioni saranno più interpretabili quando i report indicheranno quale distribuzione è il riferimento, la base del log e come vengono gestiti gli eventi a probabilità zero. Nell'addestramento del modello, i team dovrebbero collegare la direzione KL al comportamento che desiderano: coprire tutte le modalità target è diverso dal concentrare un'approssimazione vicino a una modalità dominante. Valutare le decisioni a valle così come i valori di divergenza, poiché un basso disallineamento della distribuzione non è di per sé una garanzia di utilità pratica. Le pipeline future possono includere controlli di supporto e sensibilità allo smussamento, rendendo visibili i casi limite numerici anziché alterare silenziosamente le probabilità.

Implementazione nel mondo reale

Un'ipotetica distribuzione equa delle monete p=(0,5,0,5) viene confrontata con q=(0,9,0,1). In bit, D_KL(p||q)=0,5 log2(0,5/0,9)+0,5 log2(0,5/0,1), circa 0,737 bit.

Un modello linguistico viene addestrato per ridurre al minimo KL dalla distribuzione del token di destinazione alla distribuzione prevista. Se la probabilità prevista per un evento target è zero, il costo KL futuro può diventare infinito, richiedendo un accurato livellamento o il supporto del modello.

Un ricercatore confronta D_KL(p||q) con D_KL(q||p) per due distribuzioni e trova valori diversi. L'asimmetria significa che la metrica non è una distanza ordinaria e non ha una disuguaglianza generale del triangolo.

Un analista utilizza scipy.stats.entropy(pk, qk) e conferma quale argomento rappresenta la distribuzione target perché la direzione dell'entropia relativa dell'API segue pk rispetto a qk.

Rischi e guardrail

  • L'ottimizzazione di un benchmark può nascondere debolezze di sistema più ampie.

  • I costi delle infrastrutture e della manutenzione sono spesso sottostimati.

  • Le lacune in termini di sicurezza e osservabilità possono aumentare man mano che i sistemi diventano più complessi.

Tabella di marcia per l'implementazione

  1. Definire obiettivi di latenza, qualità e costi prima dell'implementazione.

  2. Benchmark in condizioni di carico e dati realistiche.

  3. Monitoraggio dello strumento per errori, deriva e impatto sull'utente.

  4. Preparare percorsi di rollback e risposta agli incidenti prima della scalabilità.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the KL Divergence quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Domande frequenti

Cos'è la divergenza KL?

La divergenza di Kullback-Leibler (KL) misura il costo informativo aggiuntivo previsto derivante dall'utilizzo di una distribuzione di probabilità per rappresentarne un'altra. È non negativo ma asimmetrico, quindi lo scambio delle distribuzioni di riferimento e di confronto generalmente modifica il risultato e può cambiare la scelta di modellazione che appare preferibile.

In D_KL(p||q), quale distribuzione pesa i termini del rapporto logaritmico?

La somma è ponderata con p(x), la distribuzione di riferimento in questa direzione.

Perché la divergenza KL non è una distanza simmetrica ordinaria?

La ponderazione e il rapporto cambiano quando le distribuzioni vengono scambiate.

Per p(x)>0 e q(x)=0, cosa succede al corrispondente contributo KL diretto?

Il rapporto logaritmico ha un numeratore positivo e un denominatore pari a zero, producendo una divergenza infinita.

Nell'esempio della moneta equa rispetto a quella distorta, perché un addendo può essere negativo mentre il KL totale rimane non negativo?

Alcune probabilità q superano p, fornendo termini logaritmici negativi, mentre la divergenza completa obbedisce alla non negatività.

Quale unità risulta dall'utilizzo dei logaritmi in base due?

La base due misura le informazioni in bit; i tronchi naturali producono nat.