GUIDE IA du langage

Agrégation de mélange d'agents

Le mélange d'agents (MoA) est une technique dans laquelle plusieurs modèles de langage rédigent des réponses, puis un modèle d'agrégation fusionne leurs meilleures idées en une seule réponse améliorée.

2 minutes de lectureDernière mise à jour

Aperçu

It lets a team of open models rival or beat a single top-tier model.

Plongée profonde

Introduit dans un article de 2024 de Together AI, Mixture-of-Agents organise plusieurs LLM en couches. Dans la première couche, plusieurs modèles « proposants » répondent chacun indépendamment à l'invite. Leurs sorties sont ensuite concaténées et transmises à la couche suivante, où les modèles répondent à nouveau, désormais conditionnés par toutes les versions précédentes. Après un ou plusieurs tours de ce type, un modèle « agrégateur » final synthétise tout en une seule réponse. L'idée centrale, que les auteurs appellent le « caractère collaboratif des LLM », est que les modèles produisent de meilleures réponses lorsqu'on leur montre les réponses de leurs pairs, même imparfaites. Sur le benchmark AlpacaEval 2.0, un MoA entièrement construit à partir de modèles open source aurait dépassé le score de GPT-4 Omni, démontrant qu'une agrégation minutieuse de modèles divers et moins chers peut battre un système frontière unique.

Aperçu technique

Le MoA diffère du vote à la majorité simple : plutôt que de choisir une seule réponse, l'agrégateur lit toutes les réponses des candidats comme contexte et génère une nouvelle synthèse, mélangeant les points forts et filtrant les erreurs. La diversité parmi les proposants est utile, il est donc utile de mélanger différentes familles modèles. La structure est en couches, comme un réseau profond où les « neurones » de chaque couche sont des appels LLM entiers. Le compromis est la latence et le coût : chaque couche multiplie le nombre d'appels d'inférence, de sorte que MoA dépense plus de calcul pour améliorer la qualité.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L’avenir de l’agrégation de mélanges d’agents

Attendez-vous à ce que l’agrégation de type MoA se répande à mesure que l’inférence devient moins chère et que les cadres d’orchestration mûrissent. Les axes de recherche incluent l'apprentissage des proposants auxquels faire confiance par requête (routage), la réduction de la pénalité de latence en exécutant les proposants en parallèle et en éliminant les plus faibles plus tôt, et la combinaison du MoA avec des agents utilisant des outils afin que l'agrégateur fusionne non seulement le texte mais aussi les actions et les preuves récupérées. À mesure que les modèles ouverts prolifèrent, les assembler intelligemment devient une voie de plus en plus pratique vers une qualité de pointe sans un seul modèle géant.

Mise en œuvre dans le monde réel

Combiner trois modèles de chat ouvert différents en tant que proposants, puis utiliser un agrégateur puissant pour produire une réponse de support client soignée.

Améliorer les scores de suivi des instructions sur les benchmarks de style AlpacaEval en utilisant uniquement des modèles open source.

Fusionner diverses suggestions de code provenant de plusieurs modèles en une seule implémentation de fonction plus robuste.

Exécution d'un pipeline à pondération ouverte qui s'approche de la qualité frontière pour un déploiement sensible à la confidentialité où les données ne peuvent pas quitter les serveurs d'une entreprise.

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture-of-Agents Aggregation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Mélange de profondeurs

Questions fréquemment posées

What is Mixture-of-Agents Aggregation?

Le mélange d'agents (MoA) est une technique dans laquelle plusieurs modèles de langage rédigent des réponses, puis un modèle d'agrégation fusionne leurs meilleures idées en une seule réponse améliorée. Il permet à une équipe de modèles ouverts de rivaliser ou de battre un seul modèle de premier plan.

Dans Mixture-of-Agents, quel est le rôle du modèle agrégateur ?

L'agrégateur lit toutes les réponses des candidats et génère une réponse fusionnée de meilleure qualité.

Sur quelle propriété clé des LLM le document du MoA s'appuie-t-il ?

Les auteurs observent que les modèles améliorent leurs réponses lorsqu'ils sont conditionnés aux ébauches d'autres modèles, même imparfaites.

En quoi le MoA diffère-t-il du vote à la majorité simple ?

Contrairement au vote, le MoA ne sélectionne pas simplement une réponse existante ; cela génère une nouvelle réponse qui mélange les candidats.

Pourquoi la diversité parmi les modèles de proposants est-elle précieuse dans le MoA ?

Les propositions variées couvrent plus de terrain, donnant à l'agrégateur un ensemble plus riche d'idées à fusionner et d'erreurs à filtrer.

Quel est le principal coût pratique de l’approche MoA ?

Chaque couche ajoute plus d'appels LLM, de sorte que MoA échange des calculs et du temps supplémentaires contre une qualité de réponse améliorée.