GUÍA Técnica

Partición de GPU de instancias múltiples

GPU de instancias múltiples (MIG) es una tecnología de NVIDIA que divide una única GPU física en múltiples particiones de hardware aisladas.

  • 2 minutos de lectura
  • Última actualización
En esta pagina2 minutos de lectura
  1. Descripción general
  2. Buceo profundo
  3. Impacto Estratégico
  4. El futuro de la partición de GPU de instancias múltiples
  5. Implementación en el mundo real
  6. Riesgos y barandillas
  7. Hoja de ruta de implementación
  8. Sigue explorando
  9. Preguntas frecuentes

Descripción general

Es importante porque permite que un acelerador costoso atienda muchas cargas de trabajo pequeñas a la vez sin que interfieran entre sí.

Buceo profundo

Introducido con NVIDIA A100 (Ampere) y continuado en H100 y GPU de centro de datos más nuevas, MIG divide una GPU en hasta siete instancias independientes. A diferencia de la división de tiempo del software, MIG proporciona un verdadero aislamiento de hardware: cada instancia obtiene sus propios multiprocesadores (SM) de transmisión dedicados, porciones de caché L2, controladores de memoria y una porción fija de memoria de gran ancho de banda. Un A100 con 40 GB se puede dividir en siete instancias de 5 GB o menos instancias más grandes. Cada partición se comporta como una GPU independiente más pequeña, por lo que un trabajo ruidoso o que falla en una instancia no puede privar o corromper a otra. Esta calidad de servicio garantizada hace que MIG sea ideal para servicios de inferencia, clústeres multiinquilino y entornos de desarrollo donde muchos usuarios comparten una tarjeta.

Impacto Estratégico

Costo y presupuesto

Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.

Decisiones más claras

La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.

control de calidad

Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.

El futuro de la partición de GPU de instancias múltiples

A medida que las GPU crecen hasta 80 GB, 141 GB y más, la partición se vuelve más atractiva porque los modelos individuales rara vez necesitan una tarjeta completa para realizar inferencias. Espere una integración más estrecha de Kubernetes y la nube, reparticionamiento dinámico sin agotar el nodo y perfiles más detallados. Los proveedores competidores están buscando una virtualización de GPU similar al estilo SR-IOV, y las plataformas de inferencia sin servidor dependen cada vez más de la partición para empaquetar muchos modelos de manera densa y reducir el desperdicio inactivo.

Implementación en el mundo real

Un proveedor de nube divide un A100 en siete instancias, de modo que cada uno de los siete clientes obtiene una porción de GPU aislada y garantizada para realizar inferencias.

Un grupo de investigación universitario ofrece a cada estudiante de doctorado una instancia MIG de 10 GB para crear prototipos en lugar de monopolizar tarjetas enteras.

Un servicio de inferencia incluye varios modelos pequeños de lenguaje y visión en un H100, cada uno en su propia partición con una latencia predecible.

Un clúster de Kubernetes anuncia instancias MIG como recursos programables, por lo que los pods solicitan 'nvidia.com/mig-1g.5gb' como cualquier otro recurso.

Riesgos y barandillas

  • La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.

  • Los costos de infraestructura y mantenimiento a menudo se subestiman.

  • Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.

Hoja de ruta de implementación

  1. Defina objetivos de latencia, calidad y costos antes de la implementación.

  2. Comparación en condiciones realistas de carga y datos.

  3. Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.

  4. Prepare rutas de reversión y respuesta a incidentes antes de escalar.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Instance GPU Partitioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

¿Qué es la partición de GPU de instancias múltiples?

GPU de instancias múltiples (MIG) es una tecnología de NVIDIA que divide una única GPU física en múltiples particiones de hardware aisladas. Es importante porque permite que un acelerador costoso atienda muchas cargas de trabajo pequeñas a la vez sin que interfieran entre sí.

¿Qué tipo de aislamiento proporciona MIG entre instancias?

MIG impone el aislamiento en el hardware, dedicando SM, segmentos de caché L2 y memoria a cada instancia para que las cargas de trabajo no puedan interferir.

¿En qué arquitectura NVIDIA se introdujo MIG por primera vez?

MIG debutó con el A100 basado en Ampere y continuó con el H100 y GPU de centros de datos posteriores.

¿Cuál es la cantidad máxima de instancias en las que se puede dividir una GPU compatible con MIG?

Una GPU compatible con MIG, como la A100, se puede dividir en hasta siete instancias independientes.

En un perfil MIG como '1g.5gb', ¿qué representa el '5gb'?

El perfil codifica segmentos de cálculo (1g) y la memoria dedicada (5 GB) asignada a la instancia.

¿Para qué carga de trabajo es especialmente adecuado MIG?

MIG brilla cuando muchas cargas de trabajo pequeñas y aisladas (como la inferencia) comparten una tarjeta con calidad de servicio garantizada.