GUIDA ALL'AI linguistica

Miscela di profondità

Mixture of Depths (MoD) consente a un trasformatore di spendere quantità diverse di calcolo su token diversi, instradando solo i token "importanti" attraverso il calcolo pesante di ciascun livello.

2 minuti di letturaUltimo aggiornamento

Panoramica

It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.

Immersione profonda

I trasformatori standard applicano ogni livello a ogni token, anche quelli banali come la punteggiatura. Mixture of Depths, introdotto da Google DeepMind nel 2024, aggiunge un piccolo router su ciascun blocco che seleziona una frazione top-k fissa di token per sottoporsi all'autoattenzione completa e al calcolo MLP; il resto salta il blocco tramite una connessione residua. Poiché vengono elaborati solo k token per livello, il calcolo totale (FLOP) è limitato e noto in anticipo, a differenza dei precedenti metodi di profondità dinamica che variavano in modo imprevedibile. Ciò rende efficiente l'utilizzo in batch e dell'hardware. I modelli addestrati MoD possono eguagliare la qualità di un trasformatore di base utilizzando meno FLOP per passaggio in avanti o raggiungere una qualità superiore con lo stesso calcolo e l'idea si combina naturalmente con Mixture-of-Experts per fornire modelli "ModE" che instradano sia in profondità che in larghezza.

Approfondimento tecnico

Ad ogni blocco MoD, un router lineare appreso assegna un punteggio a ogni token e mantiene il top-k in base al punteggio; i token selezionati passano attraverso l'attenzione e il MLP, mentre i token non selezionati vengono portati avanti inalterati dal percorso residuo. L'utilizzo di un top-k fisso (anziché una soglia per token) rende il grafico di calcolo statico e le forme tensoriali costanti, il che è intuitivo per l'hardware. Il router viene addestrato con il resto della rete e la generazione causale utilizza predittori ausiliari in modo che le decisioni di routing non tengano conto dei token futuri.

Impatto strategico

Velocità e scala

I flussi di lavoro linguistici possono muoversi più velocemente senza sacrificare la coerenza.

Accedere e raggiungere

Espande l'accesso attraverso lingue e stili di comunicazione.

Decisioni più chiare

I team possono dedicare più tempo al giudizio mentre l'automazione gestisce la ripetizione.

Il futuro della miscela di profondità

Il calcolo condizionale è una leva importante per l’efficienza man mano che i modelli scalano e il MoD ne è un primo esempio chiaro. Aspettatevi un'integrazione più profonda con Mixture-of-Experts (instradamento sia sulla profondità che sugli esperti), budget adattivi che si riducono per input facili e router appresi che identificano meglio quali token necessitano veramente di un'elaborazione approfondita. Poiché i costi di inferenza dominano l’economia di implementazione, è probabile che le tecniche che consentono ai modelli di “pensare più intensamente” solo dove necessario, mantenendo una latenza prevedibile, diventino standard nelle architetture su larga scala.

Implementazione nel mondo reale

Riduzione dei FLOP necessari per elaborare documenti lunghi saltando il calcolo approfondito sui token di riempimento

Addestramento di un modello che corrisponda alla qualità di base con un calcolo inferiore, riducendo i costi di servizio

Combinazione con Mixture-of-Experts (MoDE) per instradare sia la profondità del livello che la scelta dell'esperto

Mantenere una latenza prevedibile e fissa per token perché il budget di elaborazione per livello è fissato in anticipo

Rischi e guardrail

Fatti allucinati possono tranquillamente entrare nei rapporti, nei flussi di supporto o nei risultati della ricerca.

La sensibilità tempestiva può creare risultati incoerenti tra richieste simili.

I dati di testo sensibili potrebbero essere esposti se i controlli di accesso sono deboli.

Tabella di marcia per l'implementazione

1

Definisci il formato di output, il tono e gli standard di qualità prima dell'implementazione.

2

Risposte concrete con fonti attendibili ogni volta che la precisione è importante.

3

Mantenere un checkpoint di revisione umana per i risultati ad alto rischio.

4

Tieni traccia dei modelli di errore e riqualifica regolarmente le richieste o i flussi di lavoro.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Depths quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Aggregazione di miscele di agenti

Domande frequenti

What is Mixture of Depths?

Mixture of Depths (MoD) consente a un trasformatore di spendere quantità diverse di calcolo su token diversi, instradando solo i token "importanti" attraverso il calcolo pesante di ciascun livello. Riduce i costi di elaborazione dei token semplici mantenendo un budget di elaborazione fisso e prevedibile.

Cosa varia la Miscela di profondità tra i token?

MoD instrada solo alcuni token attraverso il calcolo pesante di ciascun livello, quindi token diversi ottengono effettivamente profondità diverse.

In che modo il Ministero della Difesa mantiene prevedibile il proprio budget di elaborazione?

La scelta di un top-k fisso di token per blocco limita i FLOP e mantiene costanti le forme dei tensori, il che è intuitivo per l'hardware.

Cosa succede ai token che il router NON seleziona in un dato blocco?

I token non selezionati ignorano il calcolo del blocco e vengono portati avanti invariati dal percorso residuo.

Chi ha introdotto Miscela di Profondità?

Mixture of Depths è stato introdotto da Google DeepMind in un articolo del 2024 sul calcolo del trasformatore dinamico.

Cosa produce la combinazione del MoD con il Mixture-of-Experts?

La combinazione del routing approfondito con il routing esperto produce modelli "ModE" che condizionano il calcolo sia sui livelli che sugli esperti.