Miscela di profondità
Mixture of Depths (MoD) consente a un trasformatore di spendere quantità diverse di calcolo su token diversi, instradando solo i token "importanti" attraverso il calcolo pesante di ciascun livello.
Panoramica
It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.
Immersione profonda
I trasformatori standard applicano ogni livello a ogni token, anche quelli banali come la punteggiatura. Mixture of Depths, introdotto da Google DeepMind nel 2024, aggiunge un piccolo router su ciascun blocco che seleziona una frazione top-k fissa di token per sottoporsi all'autoattenzione completa e al calcolo MLP; il resto salta il blocco tramite una connessione residua. Poiché vengono elaborati solo k token per livello, il calcolo totale (FLOP) è limitato e noto in anticipo, a differenza dei precedenti metodi di profondità dinamica che variavano in modo imprevedibile. Ciò rende efficiente l'utilizzo in batch e dell'hardware. I modelli addestrati MoD possono eguagliare la qualità di un trasformatore di base utilizzando meno FLOP per passaggio in avanti o raggiungere una qualità superiore con lo stesso calcolo e l'idea si combina naturalmente con Mixture-of-Experts per fornire modelli "ModE" che instradano sia in profondità che in larghezza.
Approfondimento tecnico
Ad ogni blocco MoD, un router lineare appreso assegna un punteggio a ogni token e mantiene il top-k in base al punteggio; i token selezionati passano attraverso l'attenzione e il MLP, mentre i token non selezionati vengono portati avanti inalterati dal percorso residuo. L'utilizzo di un top-k fisso (anziché una soglia per token) rende il grafico di calcolo statico e le forme tensoriali costanti, il che è intuitivo per l'hardware. Il router viene addestrato con il resto della rete e la generazione causale utilizza predittori ausiliari in modo che le decisioni di routing non tengano conto dei token futuri.
Impatto strategico
Velocità e scala
I flussi di lavoro linguistici possono muoversi più velocemente senza sacrificare la coerenza.
Accedere e raggiungere
Espande l'accesso attraverso lingue e stili di comunicazione.
Decisioni più chiare
I team possono dedicare più tempo al giudizio mentre l'automazione gestisce la ripetizione.
Il futuro della miscela di profondità
Il calcolo condizionale è una leva importante per l’efficienza man mano che i modelli scalano e il MoD ne è un primo esempio chiaro. Aspettatevi un'integrazione più profonda con Mixture-of-Experts (instradamento sia sulla profondità che sugli esperti), budget adattivi che si riducono per input facili e router appresi che identificano meglio quali token necessitano veramente di un'elaborazione approfondita. Poiché i costi di inferenza dominano l’economia di implementazione, è probabile che le tecniche che consentono ai modelli di “pensare più intensamente” solo dove necessario, mantenendo una latenza prevedibile, diventino standard nelle architetture su larga scala.
Implementazione nel mondo reale
Riduzione dei FLOP necessari per elaborare documenti lunghi saltando il calcolo approfondito sui token di riempimento
Addestramento di un modello che corrisponda alla qualità di base con un calcolo inferiore, riducendo i costi di servizio
Combinazione con Mixture-of-Experts (MoDE) per instradare sia la profondità del livello che la scelta dell'esperto
Mantenere una latenza prevedibile e fissa per token perché il budget di elaborazione per livello è fissato in anticipo
Rischi e guardrail
Fatti allucinati possono tranquillamente entrare nei rapporti, nei flussi di supporto o nei risultati della ricerca.
La sensibilità tempestiva può creare risultati incoerenti tra richieste simili.
I dati di testo sensibili potrebbero essere esposti se i controlli di accesso sono deboli.
Tabella di marcia per l'implementazione
Definisci il formato di output, il tono e gli standard di qualità prima dell'implementazione.
Risposte concrete con fonti attendibili ogni volta che la precisione è importante.
Mantenere un checkpoint di revisione umana per i risultati ad alto rischio.
Tieni traccia dei modelli di errore e riqualifica regolarmente le richieste o i flussi di lavoro.
Continua a esplorare
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixture of Depths quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Prossima guida
Aggregazione di miscele di agenti
Domande frequenti
What is Mixture of Depths?
Mixture of Depths (MoD) consente a un trasformatore di spendere quantità diverse di calcolo su token diversi, instradando solo i token "importanti" attraverso il calcolo pesante di ciascun livello. Riduce i costi di elaborazione dei token semplici mantenendo un budget di elaborazione fisso e prevedibile.
Cosa varia la Miscela di profondità tra i token?
MoD instrada solo alcuni token attraverso il calcolo pesante di ciascun livello, quindi token diversi ottengono effettivamente profondità diverse.
In che modo il Ministero della Difesa mantiene prevedibile il proprio budget di elaborazione?
La scelta di un top-k fisso di token per blocco limita i FLOP e mantiene costanti le forme dei tensori, il che è intuitivo per l'hardware.
Cosa succede ai token che il router NON seleziona in un dato blocco?
I token non selezionati ignorano il calcolo del blocco e vengono portati avanti invariati dal percorso residuo.
Chi ha introdotto Miscela di Profondità?
Mixture of Depths è stato introdotto da Google DeepMind in un articolo del 2024 sul calcolo del trasformatore dinamico.
Cosa produce la combinazione del MoD con il Mixture-of-Experts?
La combinazione del routing approfondito con il routing esperto produce modelli "ModE" che condizionano il calcolo sia sui livelli che sugli esperti.