A continuaciónSiguiente guía
Aprendizaje multitarea
Técnico
GUÍA Técnica
GPU de instancias múltiples (MIG) es una tecnología de NVIDIA que divide una única GPU física en múltiples particiones de hardware aisladas.
Es importante porque permite que un acelerador costoso atienda muchas cargas de trabajo pequeñas a la vez sin que interfieran entre sí.
Introducido con NVIDIA A100 (Ampere) y continuado en H100 y GPU de centro de datos más nuevas, MIG divide una GPU en hasta siete instancias independientes. A diferencia de la división de tiempo del software, MIG proporciona un verdadero aislamiento de hardware: cada instancia obtiene sus propios multiprocesadores (SM) de transmisión dedicados, porciones de caché L2, controladores de memoria y una porción fija de memoria de gran ancho de banda. Un A100 con 40 GB se puede dividir en siete instancias de 5 GB o menos instancias más grandes. Cada partición se comporta como una GPU independiente más pequeña, por lo que un trabajo ruidoso o que falla en una instancia no puede privar o corromper a otra. Esta calidad de servicio garantizada hace que MIG sea ideal para servicios de inferencia, clústeres multiinquilino y entornos de desarrollo donde muchos usuarios comparten una tarjeta.
Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.
La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.
Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.
A medida que las GPU crecen hasta 80 GB, 141 GB y más, la partición se vuelve más atractiva porque los modelos individuales rara vez necesitan una tarjeta completa para realizar inferencias. Espere una integración más estrecha de Kubernetes y la nube, reparticionamiento dinámico sin agotar el nodo y perfiles más detallados. Los proveedores competidores están buscando una virtualización de GPU similar al estilo SR-IOV, y las plataformas de inferencia sin servidor dependen cada vez más de la partición para empaquetar muchos modelos de manera densa y reducir el desperdicio inactivo.
Un proveedor de nube divide un A100 en siete instancias, de modo que cada uno de los siete clientes obtiene una porción de GPU aislada y garantizada para realizar inferencias.
Un grupo de investigación universitario ofrece a cada estudiante de doctorado una instancia MIG de 10 GB para crear prototipos en lugar de monopolizar tarjetas enteras.
Un servicio de inferencia incluye varios modelos pequeños de lenguaje y visión en un H100, cada uno en su propia partición con una latencia predecible.
Un clúster de Kubernetes anuncia instancias MIG como recursos programables, por lo que los pods solicitan 'nvidia.com/mig-1g.5gb' como cualquier otro recurso.
La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.
Los costos de infraestructura y mantenimiento a menudo se subestiman.
Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.
Defina objetivos de latencia, calidad y costos antes de la implementación.
Comparación en condiciones realistas de carga y datos.
Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.
Prepare rutas de reversión y respuesta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
GPU de instancias múltiples (MIG) es una tecnología de NVIDIA que divide una única GPU física en múltiples particiones de hardware aisladas. Es importante porque permite que un acelerador costoso atienda muchas cargas de trabajo pequeñas a la vez sin que interfieran entre sí.
MIG impone el aislamiento en el hardware, dedicando SM, segmentos de caché L2 y memoria a cada instancia para que las cargas de trabajo no puedan interferir.
MIG debutó con el A100 basado en Ampere y continuó con el H100 y GPU de centros de datos posteriores.
Una GPU compatible con MIG, como la A100, se puede dividir en hasta siete instancias independientes.
El perfil codifica segmentos de cálculo (1g) y la memoria dedicada (5 GB) asignada a la instancia.
MIG brilla cuando muchas cargas de trabajo pequeñas y aisladas (como la inferencia) comparten una tarjeta con calidad de servicio garantizada.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Aprendizaje multitarea
Técnico