Mélange de profondeurs
Le mélange de profondeurs (MoD) permet à un transformateur de dépenser différentes quantités de calcul sur différents jetons, en acheminant uniquement les jetons « importants » à travers le calcul lourd de chaque couche.
Aperçu
It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.
Plongée profonde
Les transformateurs standard appliquent chaque couche à chaque jeton, même les plus triviaux comme la ponctuation. Mixture of Depths, introduit par Google DeepMind en 2024, ajoute un petit routeur à chaque bloc qui sélectionne une fraction top-k fixe de jetons pour subir l'auto-attention complète et le calcul MLP ; le reste saute le bloc via une connexion résiduelle. Étant donné que seuls k jetons sont traités par couche, le calcul total (FLOP) est plafonné et connu à l'avance, contrairement aux méthodes de profondeur dynamique antérieures qui variaient de manière imprévisible. Cela rend le traitement par lots et l’utilisation du matériel efficaces. Les modèles formés par le MoD peuvent correspondre à la qualité d'un transformateur de base en utilisant moins de FLOP par passage avant, ou atteindre une qualité supérieure avec le même calcul, et l'idée se compose naturellement avec un mélange d'experts pour donner des modèles « MoDE » qui acheminent à la fois la profondeur et la largeur.
Aperçu technique
À chaque bloc MoD, un routeur linéaire appris note chaque jeton et conserve le top-k par score ; les jetons sélectionnés passent par l'attention et le MLP, tandis que les jetons non sélectionnés sont reportés inchangés par le chemin résiduel. L'utilisation d'un top-k fixe (plutôt qu'un seuil par jeton) rend le graphique de calcul statique et les formes du tenseur constantes, ce qui est respectueux du matériel. Le routeur est formé avec le reste du réseau et la génération causale utilise des prédicteurs auxiliaires afin que les décisions de routage ne regardent pas les futurs jetons.
Impact stratégique
Vitesse et échelle
Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.
Accès et portée
Il étend l’accès à toutes les langues et styles de communication.
Décisions plus claires
Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.
L’avenir du mélange de profondeurs
Le calcul conditionnel est un levier majeur d’efficacité à mesure que les modèles évoluent, et le MoD en est un exemple précoce et clair. Attendez-vous à une intégration plus approfondie avec un mélange d'experts (routage à la fois en profondeur et en experts), à des budgets adaptatifs qui diminuent pour faciliter les entrées et à des routeurs appris qui identifient mieux les jetons qui nécessitent réellement un traitement approfondi. Alors que les coûts d'inférence dominent l'économie du déploiement, les techniques permettant aux modèles de « réfléchir plus sérieusement » uniquement lorsque cela est nécessaire, tout en conservant une latence prévisible, sont susceptibles de devenir la norme dans les architectures à grande échelle.
Mise en œuvre dans le monde réel
Réduire les FLOP nécessaires au traitement de documents longs en ignorant les calculs approfondis sur les jetons de remplissage
Entraîner un modèle qui correspond à la qualité de base avec un calcul inférieur, réduisant ainsi le coût de diffusion
Combinaison avec le mélange d'experts (MoDE) pour tracer à la fois la profondeur des couches et le choix des experts
Conserver une latence prévisible et fixe par jeton, car le budget de calcul par couche est fixé à l'avance
Risques et garde-fous
Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.
La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.
Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.
Feuille de route de mise en œuvre
Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.
Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.
Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.
Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixture of Depths quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Agrégation de mélange d'agents
Questions fréquemment posées
What is Mixture of Depths?
Le mélange de profondeurs (MoD) permet à un transformateur de dépenser différentes quantités de calcul sur différents jetons, en acheminant uniquement les jetons « importants » à travers le calcul lourd de chaque couche. Il réduit le coût de traitement des jetons simples tout en conservant un budget de calcul fixe et prévisible.
Qu'est-ce que le mélange de profondeurs varie selon les jetons ?
Le MoD n'achemine que quelques jetons à travers les calculs lourds de chaque couche, de sorte que différents jetons obtiennent effectivement une profondeur différente.
Comment le ministère de la Défense assure-t-il la prévisibilité de son budget de calcul ?
Le choix d'un top-k fixe de jetons par bloc limite les FLOP et maintient les formes de tenseurs constantes, ce qui est respectueux du matériel.
Qu'arrive-t-il aux jetons que le routeur ne sélectionne PAS à un bloc donné ?
Les jetons non sélectionnés contournent le calcul du bloc et sont reportés inchangés par le chemin résiduel.
Which lab published the Mixture of Depths technique?
Le mélange de profondeurs a été introduit par Google DeepMind dans un article de 2024 sur le calcul des transformateurs dynamiques.
Que produit la combinaison du MoD avec le Mixture-of-Experts ?
La combinaison du routage en profondeur avec le routage expert donne des modèles « MoDE » qui conditionnent le calcul sur les couches et les experts.