GUIDE IA du langage

Modèles de transformateur hybride Jamba-Mamba

Jamba est un grand modèle de langage d'AI21 Labs qui entrelace les couches d'attention de Transformer avec les couches d'espace d'état de Mamba (plus un mélange d'experts) pour obtenir une efficacité à long terme sans renoncer à la qualité de Transformer.

2 minutes de lectureDernière mise à jour

Aperçu

C’est important car cela montre que les architectures hybrides peuvent surpasser les Transformers purs en mémoire et en débit à de longues séquences.

Plongée profonde

Les transformateurs purs paient un coût quadratique en attention à mesure que le contexte grandit, et leurs ballons de cache clé-valeur avec la longueur de la séquence. Les modèles d'espace d'état purs comme Mamba évoluent de manière linéaire et conservent un état récurrent de taille fixe, mais sont historiquement en retard sur certaines tâches. Jamba mélange les deux : il empile des blocs dont la plupart des couches sont Mamba (bon marché, linéaires, idéales pour les longues séquences) et un plus petit nombre sont une attention standard (forte en rappel précis et en raisonnement contextuel). Il ajoute également des couches de mélange d'experts (MoE) pour augmenter la capacité tout en gardant les paramètres actifs modestes. Le premier Jamba a été publié avec une fenêtre contextuelle de 256 000 jetons et pouvait contenir beaucoup plus de contexte sur un seul GPU que des Transformers comparables, grâce à son cache KV considérablement plus petit.

Aperçu technique

Mamba est un modèle d'espace d'état sélectif : au lieu de s'occuper de chaque jeton passé, il maintient un état récurrent compressé mis à jour linéairement au cours de la séquence, avec un déclenchement dépendant de l'entrée qui décide de ce qu'il faut conserver ou oublier. Jamba intercale quelques couches d'attention totale parmi de nombreuses couches Mamba afin que le modèle conserve la recherche exacte à longue portée de l'attention tandis que la plupart du calcul et de la mémoire restent linéaires, et le routage MoE n'active qu'un sous-ensemble d'experts par jeton.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L'avenir des modèles hybrides Transformer-Mamba Jamba

Les conceptions hybrides d’attention et d’espace d’état apparaissent comme une recette phare pour des modèles efficaces à contexte long, et Jamba a contribué à populariser ce modèle. Attendez-vous à ce que des modèles plus ouverts et frontaliers adoptent des piles mixtes, affinent le rapport attention/SSM et les combinent avec des astuces MoE et KV-cache. À mesure que les exigences contextuelles atteignent des millions de jetons, l'avantage de la mémoire linéaire des couches d'espace d'état rend les hybrides particulièrement attrayants pour les déploiements sur appareil et sensibles aux coûts.

Mise en œuvre dans le monde réel

Traitement des entrées de 256 000 jetons, telles que de longs dépôts légaux ou de grands référentiels de code, sur un seul GPU qui ne pouvait pas contenir le cache KV d'un Transformer comparable.

Service de chat contextuel à haut débit dans lequel l'état fixe de Mamba maintient la mémoire à plat à mesure que les conversations se développent

Analyse de documents et génération augmentée par récupération sur de très grandes bases de connaissances insérées directement dans leur contexte

Exécution d'un LLM à contexte long et à poids ouvert (Jamba a été publié avec des poids ouverts) pour la recherche sur les architectures hybrides

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jamba Hybrid Transformer-Mamba Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Modèles spatiaux d’état et Mamba

Questions fréquemment posées

Qu’est-ce que les modèles Jamba Hybrid Transformer-Mamba ?

Jamba est un grand modèle de langage d'AI21 Labs qui entrelace les couches d'attention de Transformer avec les couches d'espace d'état de Mamba (plus un mélange d'experts) pour obtenir une efficacité à long terme sans renoncer à la qualité de Transformer. C’est important car cela montre que les architectures hybrides peuvent battre les Transformers purs en termes de mémoire et de débit sur de longues séquences.

Quels sont les deux types de couches principales que Jamba entrelace ?

La fonctionnalité déterminante de Jamba consiste à empiler les couches d'espace d'état Mamba avec un plus petit nombre de couches d'attention Transformer.

Quelle technique supplémentaire Jamba utilise-t-il pour augmenter la capacité tout en maintenant les paramètres actifs à un niveau bas ?

Jamba ajoute des couches MoE afin que seul un sous-ensemble d'experts soit actif par jeton, augmentant ainsi la capacité totale sans augmenter proportionnellement le calcul.

Pourquoi Mamba évolue-t-il mieux que l'attention pour les longues séquences ?

Mamba conserve un état compressé de taille fixe mis à jour de manière linéaire, évitant ainsi le coût d'attention quadratique et le cache clé-valeur toujours croissant.

Quelle fenêtre contextuelle le premier modèle Jamba prenait-il en charge ?

Jamba a été lancé avec une fenêtre contextuelle de 256 000 jetons, rendue possible en grande partie par sa petite empreinte de cache KV.

Pourquoi Jamba garde-t-il certaines couches d'attention plutôt que de devenir du pur Mamba ?

Quelques couches d'attention totale conservent les capacités de recherche exacte et en contexte là où les modèles d'espace d'état purs peuvent être à la traîne.