GUÍA de IA en idiomas

Agregación de mezcla de agentes

La mezcla de agentes (MoA) es una técnica en la que varios modelos de lenguaje redactan respuestas y luego un modelo agregador fusiona sus mejores ideas en una respuesta mejorada.

2 minutos de lecturaÚltima actualización

Descripción general

It lets a team of open models rival or beat a single top-tier model.

Buceo profundo

Introducido en un artículo de 2024 de Together AI, Mixture-of-Agents organiza varios LLM en capas. En la primera capa, varios modelos de 'proponentes' responden cada uno de forma independiente a la pregunta. Luego, sus resultados se concatenan y se pasan a la siguiente capa, donde los modelos responden nuevamente, ahora condicionados a todos los borradores anteriores. Después de una o más rondas de este tipo, un modelo 'agregador' final sintetiza todo en una única respuesta. La idea central, que los autores denominan "colaboratividad de los LLM", es que los modelos producen mejores respuestas cuando se les muestran las respuestas de sus pares, incluso las imperfectas. En el punto de referencia AlpacaEval 2.0, un MoA construido enteramente a partir de modelos de código abierto superó la puntuación de GPT-4 Omni, lo que demuestra que la agregación cuidadosa de modelos diversos y más baratos puede superar un sistema de frontera única.

Información técnica

MoA difiere de la votación por mayoría simple: en lugar de elegir una respuesta, el agregador lee todas las respuestas de los candidatos como contexto y genera una nueva síntesis, combinando fortalezas y filtrando errores. La diversidad entre los proponentes ayuda, por lo que es valioso mezclar diferentes familias de modelos. La estructura tiene capas, como una red profunda donde las 'neuronas' de cada capa son llamadas completas de LLM. La compensación es la latencia y el costo: cada capa multiplica la cantidad de llamadas de inferencia, por lo que MoA gasta más computación para mejorar la calidad.

Impacto Estratégico

Speed and scale

Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.

Access and reach

Amplía el acceso a través de idiomas y estilos de comunicación.

Decisiones más claras

Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.

El futuro de la agregación de mezclas de agentes

Espere que la agregación estilo MoA se extienda a medida que la inferencia se vuelva más barata y los marcos de orquestación maduren. Las direcciones de investigación incluyen aprender en qué proponentes confiar por consulta (enrutamiento), reducir la penalización de latencia al ejecutar los proponentes en paralelo y eliminar los débiles temprano, y combinar MoA con agentes que usan herramientas para que el agregador fusione no solo texto sino acciones y evidencia recuperada. A medida que proliferan los modelos abiertos, ensamblarlos inteligentemente se convierte en un camino cada vez más práctico hacia una calidad de vanguardia sin un solo modelo gigante.

Implementación en el mundo real

Combinar tres modelos diferentes de chat abierto como proponentes y luego utilizar un agregador potente para producir una respuesta pulida de atención al cliente.

Aumentar las puntuaciones de seguimiento de instrucciones en puntos de referencia estilo AlpacaEval utilizando únicamente modelos de código abierto.

Fusionar diversas sugerencias de código de varios modelos en una implementación de función única y más sólida.

Ejecutar una canalización de peso abierto que se acerca a la calidad de frontera para una implementación sensible a la privacidad donde los datos no pueden salir de los servidores de una empresa.

Riesgos y barandillas

Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.

La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.

Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.

Hoja de ruta de implementación

1

Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.

2

Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.

3

Mantenga un punto de control de revisión humana para los resultados de alto riesgo.

4

Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture-of-Agents Aggregation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is Mixture-of-Agents Aggregation?

La mezcla de agentes (MoA) es una técnica en la que varios modelos de lenguaje redactan respuestas y luego un modelo agregador fusiona sus mejores ideas en una respuesta mejorada. Permite que un equipo de modelos abiertos rivalice o supere a un único modelo de primer nivel.

En la mezcla de agentes, ¿cuál es el papel del modelo agregador?

El agregador lee todas las respuestas de los candidatos y genera una respuesta fusionada y de mayor calidad.

¿En qué propiedad clave de los LLM se basa el documento del MoA?

Los autores observan que los modelos mejoran sus respuestas cuando están condicionados a los borradores de otros modelos, incluso los imperfectos.

¿En qué se diferencia el MoA de la votación por mayoría simple?

A diferencia de la votación, el MoA no selecciona simplemente una respuesta existente; genera una respuesta fresca que fusiona a los candidatos.

¿Por qué es valiosa la diversidad entre los modelos de proponentes en el MoA?

Los proponentes variados cubren más terreno, brindando al agregador un conjunto más rico de ideas para fusionar y errores para filtrar.

¿Cuál es el principal costo práctico del enfoque MoA?

Cada capa agrega más llamadas de LLM, por lo que MoA intercambia computación y tiempo adicionales por una mejor calidad de respuesta.