A continuaciónSiguiente guía
Mezcla de expertos de LoRA
Técnico
GUÍA Técnica
Mixture of Experts (MoE) es un diseño de modelo que divide una red en muchas subredes especializadas y activa solo unas pocas por entrada.
Permite que los modelos posean un enorme conocimiento y, al mismo tiempo, mantengan cada predicción rápida y económica.
Un transformador estándar hace pasar cada entrada a través de las mismas capas densas, por lo que hacer que el modelo sea más inteligente generalmente significa encarecer cada cálculo. Mezcla de Expertos rompe ese vínculo. Reemplaza la gran capa de retroalimentación con muchas redes "expertas" más pequeñas más un pequeño "enrutador" que decide qué expertos manejan cada token. Por lo general, solo los 1 o 2 mejores expertos activan, por lo que un modelo puede tener cientos de miles de millones de parámetros totales pero solo activar una pequeña fracción por token. Esta es la razón por la que modelos como Mixtral 8x7B y la rumoreada arquitectura detrás de GPT-4 alcanzan una alta calidad sin un costo de inferencia proporcionalmente alto. La desventaja es la complejidad: todos los expertos aún deben caber en la memoria y el enrutador puede desviar incorrectamente o sobrecargar a algunos expertos, por lo que la capacitación requiere un equilibrio cuidadoso.
Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.
La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.
Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.
El MoE se está convirtiendo en una herramienta predeterminada para los modelos a escala de frontera porque desvincula la capacidad del costo. Espere expertos más detallados, enrutamiento más inteligente que considere más contexto y mejores técnicas para atender modelos enormes y dispersos en hardware limitado. La investigación también está abordando el problema de la memoria, ya que todos los expertos deben cargarse aunque pocos se ejecuten, mediante la descarga y cuantificación de expertos. A medida que maduren modelos abiertos como Mixtral y DeepSeek-MoE, las arquitecturas dispersas probablemente impulsarán asistentes más eficientes con presupuestos de GPU más pequeños.
Mixtral 8x7B utiliza 8 expertos y activa 2 por token, lo que proporciona aproximadamente 47 mil millones de parámetros totales, pero solo ~13 mil millones activos por token para una inferencia más rápida y económica.
DeepSeek y Qwen ofrecen grandes modelos de lenguaje MoE que coinciden con modelos densos en puntos de referencia mientras se ejecutan con una computación por token más baja.
Los proveedores de LLM en la nube utilizan MoE para que un único modelo enorme pueda atender a muchos usuarios de forma asequible, ya que cada solicitud solo ilumina a unos pocos expertos.
El Switch Transformer anterior de Google se escaló a más de un billón de parámetros utilizando el enrutamiento principal para mantener manejable la computación de entrenamiento.
La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.
Los costos de infraestructura y mantenimiento a menudo se subestiman.
Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.
Defina objetivos de latencia, calidad y costos antes de la implementación.
Comparación en condiciones realistas de carga y datos.
Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.
Prepare rutas de reversión y respuesta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mixture of Experts (MoE) es un diseño de modelo que divide una red en muchas subredes especializadas y activa solo unas pocas por entrada. Permite que los modelos posean un enorme conocimiento y, al mismo tiempo, mantengan cada predicción rápida y económica.
Una pequeña red de control aprende a calificar a cada experto para obtener el token y lo dirige a los que obtienen la mayor puntuación. El enrutamiento se aprende, no es fijo ni aleatorio.
Debido a que solo los mejores k expertos disparan por token, el cálculo activo permanece aproximadamente constante incluso cuando el recuento total de parámetros crece al agregar más expertos.
Sin equilibrio, el enrutador tiende a favorecer a un puñado de expertos. La pérdida auxiliar penaliza el uso desigual por lo que todos los expertos reciben formación.
Con solo 2 de 8 expertos activos, los parámetros activos por token (~13 mil millones) son mucho más pequeños que el total de ~47 mil millones, lo que reduce el costo de inferencia.
Aunque solo unos pocos expertos calculan por token, los pesos de cada experto deben cargarse en la memoria, lo que hace que los modelos MoE necesiten mucha memoria para funcionar.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Mezcla de expertos de LoRA
Técnico