A continuaciónSiguiente guía
Paralelismo de modelo y canalización
Técnico
GUÍA Técnica
Mixtral es el modelo abierto de combinación de expertos de Mistral AI que ofrece calidad de modelo grande a la velocidad de un modelo pequeño.
Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.
Mixtral 8x7B, lanzado por Mistral AI a finales de 2023, popularizó el enfoque de mezcla dispersa de expertos (MoE) en modelos abiertos. Contiene ocho redes de retroalimentación 'expertas' separadas por capa, con alrededor de 47 mil millones de parámetros totales, pero un enrutador liviano selecciona solo dos expertos para cada token. Como resultado, sólo aproximadamente 13 mil millones de parámetros están activos por token, por lo que la inferencia se ejecuta tan rápido como un modelo denso de 13 mil millones y alcanza una calidad comparable a la de modelos mucho más grandes. Mixtral igualó o superó a GPT-3.5 y Llama 2 70B en muchos puntos de referencia y, al mismo tiempo, fue más rápido y económico de servir. Mistral lanzó más tarde Mixtral 8x22B. El modelo tiene licencia abierta bajo Apache 2.0, lo que impulsa una rápida adopción y ajuste en la comunidad de código abierto.
Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.
La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.
Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.
El escaso MoE es ahora fundamental para la IA de frontera. Espere lanzamientos de MoE más abiertos, enrutamiento más detallado con muchos pequeños expertos y diseños expertos compartidos o híbridos que mejoren aún más la eficiencia. A medida que los modelos escalan hacia billones de parámetros totales, la escasez es la principal palanca para mantener la inferencia asequible. La investigación está abordando los puntos débiles de MoE, el equilibrio de carga entre expertos, la sobrecarga de memoria y la estabilidad del entrenamiento, mientras que el hardware y las pilas de servicio se optimizan cada vez más específicamente para el enrutamiento de expertos.
Ofreciendo un chatbot de alta calidad al costo y la velocidad de un modelo denso mucho más pequeño
Autohospedaje de un modelo con licencia Apache-2.0 para productos comerciales sin tarifas de uso
Ajuste de comportamientos individuales en Mixtral para codificación, resúmenes o tareas multilingües
Ejecutar inferencia rápida en un único servidor multi-GPU donde un modelo denso de 70 B sería demasiado lento
La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.
Los costos de infraestructura y mantenimiento a menudo se subestiman.
Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.
Defina objetivos de latencia, calidad y costos antes de la implementación.
Comparación en condiciones realistas de carga y datos.
Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.
Prepare rutas de reversión y respuesta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mixtral es el modelo abierto de combinación de expertos de Mistral AI que ofrece calidad de modelo grande a la velocidad de un modelo pequeño. Los modelos dispersos como este activan solo una fracción de sus parámetros por token, lo que reduce la computación sin sacrificar la capacidad.
Mixtral utiliza el enrutamiento top-2: un enrutador selecciona dos de los ocho expertos para procesar cada token.
Una pequeña red de control, llamada enrutador, califica a los expertos y selecciona cuáles manejan cada token.
Debido a que sólo dos expertos ejecutan por token, aproximadamente 13 mil millones de parámetros están activos, lo que le da la velocidad de un modelo mucho más pequeño.
MoE ahorra cómputo por token, pero aún requiere que todos los expertos estén en VRAM, lo que aumenta las necesidades de memoria.
Mixtral se lanzó bajo la licencia permisiva Apache 2.0, lo que permite un uso comercial gratuito y ajustes.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Paralelismo de modelo y canalización
Técnico