GUIDE IA du langage

Mélange de profondeurs

Le mélange de profondeurs (MoD) permet à un transformateur de dépenser différentes quantités de calcul sur différents jetons, en acheminant uniquement les jetons « importants » à travers le calcul lourd de chaque couche.

2 minutes de lectureDernière mise à jour

Aperçu

It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.

Plongée profonde

Les transformateurs standard appliquent chaque couche à chaque jeton, même les plus triviaux comme la ponctuation. Mixture of Depths, introduit par Google DeepMind en 2024, ajoute un petit routeur à chaque bloc qui sélectionne une fraction top-k fixe de jetons pour subir l'auto-attention complète et le calcul MLP ; le reste saute le bloc via une connexion résiduelle. Étant donné que seuls k jetons sont traités par couche, le calcul total (FLOP) est plafonné et connu à l'avance, contrairement aux méthodes de profondeur dynamique antérieures qui variaient de manière imprévisible. Cela rend le traitement par lots et l’utilisation du matériel efficaces. Les modèles formés par le MoD peuvent correspondre à la qualité d'un transformateur de base en utilisant moins de FLOP par passage avant, ou atteindre une qualité supérieure avec le même calcul, et l'idée se compose naturellement avec un mélange d'experts pour donner des modèles « MoDE » qui acheminent à la fois la profondeur et la largeur.

Aperçu technique

À chaque bloc MoD, un routeur linéaire appris note chaque jeton et conserve le top-k par score ; les jetons sélectionnés passent par l'attention et le MLP, tandis que les jetons non sélectionnés sont reportés inchangés par le chemin résiduel. L'utilisation d'un top-k fixe (plutôt qu'un seuil par jeton) rend le graphique de calcul statique et les formes du tenseur constantes, ce qui est respectueux du matériel. Le routeur est formé avec le reste du réseau et la génération causale utilise des prédicteurs auxiliaires afin que les décisions de routage ne regardent pas les futurs jetons.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L’avenir du mélange de profondeurs

Le calcul conditionnel est un levier majeur d’efficacité à mesure que les modèles évoluent, et le MoD en est un exemple précoce et clair. Attendez-vous à une intégration plus approfondie avec un mélange d'experts (routage à la fois en profondeur et en experts), à des budgets adaptatifs qui diminuent pour faciliter les entrées et à des routeurs appris qui identifient mieux les jetons qui nécessitent réellement un traitement approfondi. Alors que les coûts d'inférence dominent l'économie du déploiement, les techniques permettant aux modèles de « réfléchir plus sérieusement » uniquement lorsque cela est nécessaire, tout en conservant une latence prévisible, sont susceptibles de devenir la norme dans les architectures à grande échelle.

Mise en œuvre dans le monde réel

Réduire les FLOP nécessaires au traitement de documents longs en ignorant les calculs approfondis sur les jetons de remplissage

Entraîner un modèle qui correspond à la qualité de base avec un calcul inférieur, réduisant ainsi le coût de diffusion

Combinaison avec le mélange d'experts (MoDE) pour tracer à la fois la profondeur des couches et le choix des experts

Conserver une latence prévisible et fixe par jeton, car le budget de calcul par couche est fixé à l'avance

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Depths quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Agrégation de mélange d'agents

Questions fréquemment posées

What is Mixture of Depths?

Le mélange de profondeurs (MoD) permet à un transformateur de dépenser différentes quantités de calcul sur différents jetons, en acheminant uniquement les jetons « importants » à travers le calcul lourd de chaque couche. Il réduit le coût de traitement des jetons simples tout en conservant un budget de calcul fixe et prévisible.

Qu'est-ce que le mélange de profondeurs varie selon les jetons ?

Le MoD n'achemine que quelques jetons à travers les calculs lourds de chaque couche, de sorte que différents jetons obtiennent effectivement une profondeur différente.

Comment le ministère de la Défense assure-t-il la prévisibilité de son budget de calcul ?

Le choix d'un top-k fixe de jetons par bloc limite les FLOP et maintient les formes de tenseurs constantes, ce qui est respectueux du matériel.

Qu'arrive-t-il aux jetons que le routeur ne sélectionne PAS à un bloc donné ?

Les jetons non sélectionnés contournent le calcul du bloc et sont reportés inchangés par le chemin résiduel.

Which lab published the Mixture of Depths technique?

Le mélange de profondeurs a été introduit par Google DeepMind dans un article de 2024 sur le calcul des transformateurs dynamiques.

Que produit la combinaison du MoD avec le Mixture-of-Experts ?

La combinaison du routage en profondeur avec le routage expert donne des modèles « MoDE » qui conditionnent le calcul sur les couches et les experts.