Il prossimoProssima guida
Correzione di confronti multipli
Tecnico
GUIDA TECNICA
La divergenza di Kullback-Leibler (KL) misura il costo informativo aggiuntivo previsto derivante dall'utilizzo di una distribuzione di probabilità per rappresentarne un'altra.
È non negativo ma asimmetrico, quindi lo scambio delle distribuzioni di riferimento e di confronto generalmente modifica il risultato e può cambiare la scelta di modellazione che appare preferibile.
Per distribuzioni discrete p e q sugli stessi risultati, la divergenza KL è D_KL(p||q) = somma sui risultati p(x) log(p(x)/q(x)). Confronta q con un riferimento p, ponderando ciascun rapporto logaritmico in base alla frequenza con cui il risultato si verifica sotto p. Nella teoria dell'informazione, può essere interpretato come un costo aggiuntivo di codifica previsto quando un codice è ottimizzato per q ma la distribuzione reale è p. La base logaritmica imposta l'unità: i logaritmi naturali danno nat e la base due dà bit. La divergenza KL non è negativa ed è uguale a zero quando le distribuzioni corrispondono su risultati con probabilità positiva sotto p, fatte salve considerazioni di supporto. È asimmetrico: D_KL(p||q) generalmente non è D_KL(q||p). Ciò lo rende inadatto come distanza geometrica convenzionale. La direzione è importante in applicazioni come l'inferenza variazionale, dove una distribuzione viene trattata come un obiettivo e un'altra come un'approssimazione. Nell'esempio della moneta equa rispetto a quella distorta, p=(0,5,0,5) e q=(0,9,0,1). I contributi con valori in bit sono 0,5 log2(0,5/0,9), circa -0,424 e 0,5 log2(0,5/0,1), circa 1,161. La loro somma è di circa 0,737 bit. Sono consentiti termini individuali negativi anche se la divergenza totale non è negativa. L'inversione di p e q produce un valore diverso perché cambiano anche i pesi. Le mancate corrispondenze del supporto sono importanti. Se p assegna una probabilità positiva a un risultato in cui q assegna zero, la corrispondente divergenza diretta è infinita. Se entrambi assegnano zero, quel risultato contribuisce per convenzione con zero nella somma discreta. Per le distribuzioni continue, KL è scritto come integrale del rapporto di densità logaritmica sotto P; la finitezza richiede che P sia assolutamente continuo rispetto a Q. La funzione entropica di SciPy calcola l'entropia di Shannon con una distribuzione e l'entropia relativa quando viene fornito q; verificare la normalizzazione e la direzione dell'input. KL è utile per confrontare le distribuzioni, ma di per sé non dice se un modello è utile per una decisione a valle.
Le decisioni relative all'architettura determinano prestazioni e costi operativi per anni.
La formazione tecnica aiuta i team a scegliere lo stack giusto, non solo quello più nuovo.
Migliori scelte ingegneristiche riducono gli incidenti legati all’affidabilità nella produzione.
I confronti tra distribuzioni saranno più interpretabili quando i report indicheranno quale distribuzione è il riferimento, la base del log e come vengono gestiti gli eventi a probabilità zero. Nell'addestramento del modello, i team dovrebbero collegare la direzione KL al comportamento che desiderano: coprire tutte le modalità target è diverso dal concentrare un'approssimazione vicino a una modalità dominante. Valutare le decisioni a valle così come i valori di divergenza, poiché un basso disallineamento della distribuzione non è di per sé una garanzia di utilità pratica. Le pipeline future possono includere controlli di supporto e sensibilità allo smussamento, rendendo visibili i casi limite numerici anziché alterare silenziosamente le probabilità.
Un'ipotetica distribuzione equa delle monete p=(0,5,0,5) viene confrontata con q=(0,9,0,1). In bit, D_KL(p||q)=0,5 log2(0,5/0,9)+0,5 log2(0,5/0,1), circa 0,737 bit.
Un modello linguistico viene addestrato per ridurre al minimo KL dalla distribuzione del token di destinazione alla distribuzione prevista. Se la probabilità prevista per un evento target è zero, il costo KL futuro può diventare infinito, richiedendo un accurato livellamento o il supporto del modello.
Un ricercatore confronta D_KL(p||q) con D_KL(q||p) per due distribuzioni e trova valori diversi. L'asimmetria significa che la metrica non è una distanza ordinaria e non ha una disuguaglianza generale del triangolo.
Un analista utilizza scipy.stats.entropy(pk, qk) e conferma quale argomento rappresenta la distribuzione target perché la direzione dell'entropia relativa dell'API segue pk rispetto a qk.
L'ottimizzazione di un benchmark può nascondere debolezze di sistema più ampie.
I costi delle infrastrutture e della manutenzione sono spesso sottostimati.
Le lacune in termini di sicurezza e osservabilità possono aumentare man mano che i sistemi diventano più complessi.
Definire obiettivi di latenza, qualità e costi prima dell'implementazione.
Benchmark in condizioni di carico e dati realistiche.
Monitoraggio dello strumento per errori, deriva e impatto sull'utente.
Preparare percorsi di rollback e risposta agli incidenti prima della scalabilità.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
La divergenza di Kullback-Leibler (KL) misura il costo informativo aggiuntivo previsto derivante dall'utilizzo di una distribuzione di probabilità per rappresentarne un'altra. È non negativo ma asimmetrico, quindi lo scambio delle distribuzioni di riferimento e di confronto generalmente modifica il risultato e può cambiare la scelta di modellazione che appare preferibile.
La somma è ponderata con p(x), la distribuzione di riferimento in questa direzione.
La ponderazione e il rapporto cambiano quando le distribuzioni vengono scambiate.
Il rapporto logaritmico ha un numeratore positivo e un denominatore pari a zero, producendo una divergenza infinita.
Alcune probabilità q superano p, fornendo termini logaritmici negativi, mentre la divergenza completa obbedisce alla non negatività.
La base due misura le informazioni in bit; i tronchi naturali producono nat.
Continua a imparare
Altre guide selezionate per questo argomento
Il prossimoProssima guida
Correzione di confronti multipli
Tecnico