GUIDE Technique

Gate et routage dans le calcul conditionnel

Le gate et le routage permettent à un réseau neuronal d'activer uniquement les parties dont il a besoin pour chaque entrée au lieu d'exécuter l'intégralité du modèle à chaque fois.

2 minutes de lectureDernière mise à jour

Aperçu

This decouples model size from compute cost, enabling enormous models that stay fast and cheap to run.

Plongée profonde

Le calcul conditionnel signifie que le réseau prend des décisions en fonction des données concernant les sous-modules à utiliser. Un petit réseau de « gating » ou de « routeur » instruit examine chaque entrée (souvent chaque jeton) et produit des scores en sélectionnant les « experts » auxquels les envoyer. Dans une couche de mélange d'experts (MoE), des dizaines ou des centaines de sous-réseaux d'experts existent, mais le routeur ne sélectionne que le ou les deux premiers par jeton, de sorte que la plupart des experts restent inactifs pour une entrée donnée. Le résultat est un modèle avec un nombre total de paramètres énorme mais un petit nombre d'actifs, donnant la puissance de représentation d'un modèle géant au coût d'exécution d'un modèle beaucoup plus petit. C'est ainsi que des modèles tels que Switch Transformer, GLaM et de nombreux modèles de langages à grande échelle s'adaptent à des milliards de paramètres à un prix abordable.

Aperçu technique

Le routeur calcule généralement un softmax par rapport aux experts et sélectionne le top-k, puis combine leurs sorties pondérées par les scores de porte. L’équilibrage de charge constitue un défi : les routeurs ont tendance à privilégier quelques experts, laissant les autres sans formation. La formation ajoute donc une perte d'équilibrage de charge auxiliaire pour répartir les jetons de manière uniforme, ainsi que des limites de capacité qui suppriment ou redirigent les jetons de débordement. Étant donné que la sélection top-k est discrète et non différenciable, les gradients passent uniquement par les experts choisis et leurs poids de porte.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir du gate et du routage dans le calcul conditionnel

Le contrôle clairsemé est désormais essentiel à la mise à l'échelle des modèles frontières, et la tendance est à des experts plus fins, à des routeurs plus intelligents et à un routage sur plusieurs couches. Attendez-vous à de meilleures techniques pour une formation stable, à une réduction des frais de communication lorsque les experts sont répartis sur de nombreux accélérateurs et à une analyse de « spécialisation des experts » pour comprendre ce que chaque expert apprend. Le calcul conditionnel s’étend également au-delà du MoE dans les réseaux à sortie précoce et les modèles dynamiques en profondeur qui consacrent davantage de calculs uniquement à des entrées plus difficiles.

Mise en œuvre dans le monde réel

Le Switch Transformer achemine chaque jeton vers un seul expert, s'étendant à plus d'un billion de paramètres tout en maintenant un faible calcul par jeton.

Modèles de langage de grande taille Frontier utilisant des couches de mélange d'experts afin que seule une fraction des pondérations soit activée par jeton.

Classificateurs d'images à sortie anticipée qui s'arrêtent à une couche peu profonde pour les images faciles et s'étendent plus profondément uniquement pour les images difficiles.

Des modèles multilingues dont les routeurs apprennent à envoyer des tokens de différentes langues à différents experts spécialisés.

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Gating and Routing in Conditional Computation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Routage d'inférence LLM et équilibrage de charge

Questions fréquemment posées

What is Gating and Routing in Conditional Computation?

Le gate et le routage permettent à un réseau neuronal d'activer uniquement les parties dont il a besoin pour chaque entrée au lieu d'exécuter l'intégralité du modèle à chaque fois. Cela dissocie la taille du modèle du coût de calcul, permettant ainsi d’exécuter d’énormes modèles qui restent rapides et peu coûteux à exécuter.

Quelle est l’idée principale derrière le calcul conditionnel ?

Le calcul conditionnel effectue des choix dépendants des données concernant les sous-modules à exécuter, de sorte que la majeure partie du réseau peut rester inactive pour une entrée donnée.

Dans une couche Mixture-of-Experts, que fait le routeur ?

Le routeur est un petit réseau instruit qui note les experts et envoie chaque jeton aux meilleurs experts, laissant le reste inutilisé pour ce jeton.

Pourquoi les modèles MoE ont-ils un nombre total de paramètres énorme mais un petit nombre d'actifs ?

Étant donné que seuls un ou deux experts sont activés par jeton, le calcul d'exécution reflète uniquement ces experts, même si le modèle en stocke beaucoup plus.

Quel problème une perte d’équilibrage de charge auxiliaire résout-elle ?

Les routeurs ont naturellement tendance à envoyer la plupart des jetons à quelques experts populaires ; la perte d'équilibrage de charge favorise une répartition uniforme afin que tous les experts soient formés.

Pourquoi la sélection des experts top-k est-elle un défi pour la formation basée sur le gradient ?

Choisir les meilleurs experts est une décision difficile et discrète ; les gradients ne peuvent se propager qu'à travers les experts qui ont été réellement sélectionnés et leurs poids de porte.