GUIDE Technique

Routage d'inférence LLM et équilibrage de charge

La couche de contrôle qui décide quelle réplique de modèle, GPU ou backend doit gérer chaque requête LLM entrante et comment répartir le trafic afin qu'aucun serveur ne soit submergé.

2 minutes de lectureDernière mise à jour

Aperçu

Bien fait, cela réduit la latence et les coûts ; mal fait que cela provoque des délais d’attente et des GPU inactifs.

Plongée profonde

Servir un LLM à grande échelle signifie exécuter de nombreuses répliques sur de nombreux GPU, et le trafic d'inférence est rafale et inégal : les invites varient énormément en longueur et en difficulté. Un routeur se place devant et choisit une destination en utilisant des signaux bien plus riches que le round-robin classique. Les routeurs modernes compatibles LLM prennent en compte la profondeur de la file d'attente, l'occupation du cache KV et si une réplique contient déjà un préfixe d'invite correspondant (affinité préfixe-cache), de sorte qu'une demande de suivi atterrit là où se trouve son cache. Certains routeurs choisissent également le modèle à utiliser : ils envoient des requêtes simples à un petit modèle bon marché et des requêtes difficiles à un grand (routage de modèle). L'équilibrage de charge égalise ensuite la pression sur les réplicas pour éviter les points chauds, respecter les limites de débit et maintenir une latence de queue faible tout en maximisant l'utilisation globale du goodput et du GPU.

Aperçu technique

Les équilibreurs de charge naïfs supposent que les requêtes sont interchangeables et peu coûteuses à migrer – faux pour les LLM. Chaque jeton de sortie coûte une passe avant, et le cache KV d'une réplique le rend « collant » pour une session. Les routeurs intelligents optimisent donc les accès au cache : hachage ou épinglage de session afin que le préfixe croissant d'une conversation réutilise les clés/valeurs mises en cache au lieu de les recalculer. Ils lisent également la télémétrie back-end en direct (jetons en attente, remplissage des lots) plutôt que simplement le nombre de requêtes, car une requête longue peut l'emporter sur plusieurs requêtes courtes.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir du routage d'inférence LLM et de l'équilibrage de charge

Le routage devient une composante apprise de premier ordre. Des projets tels que l'extension d'inférence API Gateway de Kubernetes, la pile de production de vLLM et les routeurs basés sur LiteLLM/Envoy standardisent la planification tenant compte du cache et des coûts. Attendez-vous à un routage de modèles plus sémantique et basé sur la difficulté (style RouteLLM), à des files d'attente prioritaires basées sur les SLA, à une prise en compte de plusieurs régions et d'instances ponctuelles, ainsi qu'à des politiques apprises par renforcement qui équilibrent la latence, le débit et le coût en dollars en temps réel à mesure que les modèles, les prix et l'évolution du trafic.

Mise en œuvre dans le monde réel

Une plate-forme de chatbot épingle chaque conversation à la réplique contenant son cache KV, de sorte que les tours de suivi atteignent le cache de préfixe et répondent plus rapidement.

Les systèmes de type RouteLLM envoient des questions simples à un petit modèle bon marché et transmettent uniquement les questions difficiles à un modèle frontière, réduisant ainsi les coûts avec peu de perte de qualité.

L'extension d'inférence de l'API Kubernetes Gateway achemine en fonction de la profondeur de la file d'attente du GPU en direct et de l'état du cache au lieu d'un simple tourniquet entre les pods.

LiteLLM proxy le trafic sur OpenAI, Anthropic et les modèles auto-hébergés avec un repli et un équilibrage tenant compte des limites de débit lorsqu'un fournisseur limite.

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the LLM Inference Routing and Load Balancing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Seldon Core et graphiques d'inférence

Questions fréquemment posées

Qu’est-ce que le routage par inférence et l’équilibrage de charge des LLM ?

La couche de contrôle qui décide quelle réplique de modèle, GPU ou backend doit gérer chaque requête LLM entrante et comment répartir le trafic afin qu'aucun serveur ne soit submergé. Bien fait, cela réduit la latence et les coûts ; mal fait, cela provoque des délais d'attente et des GPU inactifs.

Pourquoi le round-robin simple est-il souvent une mauvaise stratégie d'équilibrage de charge pour l'inférence LLM ?

Les requêtes LLM diffèrent énormément en termes de longueur/coût, et le cache KV d'une réplique rend les sessions collantes, de sorte que les backends cycliques aveuglément ignorent l'affinité du cache et la charge réelle.

Qu'est-ce que le routage « affinité préfixe-cache » tente d'atteindre ?

Si une réplique contient déjà le cache KV pour un préfixe partagé, le routage du suivi à cet endroit réutilise ce cache au lieu de le recalculer, économisant ainsi le calcul et la latence.

Dans le routage de modèles basé sur la difficulté, qu'arrive-t-il généralement à une requête simple ?

Les routeurs modèles comme RouteLLM envoient des requêtes simples à un petit modèle bon marché et réservent les modèles frontières coûteux aux plus difficiles, réduisant ainsi les coûts avec une perte de qualité minimale.

Quel signal en direct est le plus utile pour un équilibreur de charge compatible LLM ?

La véritable télémétrie backend (jetons en attente, remplissage des lots, occupation du cache) reflète bien mieux la charge réelle que le simple décompte des requêtes.

Que fournit un outil comme LiteLLM dans une configuration multi-fournisseurs ?

LiteLLM agit comme un proxy de routage entre les fournisseurs (OpenAI, Anthropic, auto-hébergé), ajoutant un équilibrage de secours et tenant compte des limites de débit.