A seguirPróximo guia
Aprendizagem multitarefa
Técnico
GUIA Técnico
GPU multi-instância (MIG) é uma tecnologia NVIDIA que divide uma única GPU física em várias partições de hardware isoladas.
It matters because it lets one expensive accelerator serve many small workloads at once without them interfering with each other.
Introduzido com o NVIDIA A100 (Ampere) e continuado no H100 e nas GPUs de data center mais recentes, o MIG divide uma GPU em até sete instâncias independentes. Ao contrário do time-slicing de software, o MIG fornece verdadeiro isolamento de hardware: cada instância recebe seus próprios multiprocessadores de streaming (SMs) dedicados, fatias de cache L2, controladores de memória e uma fatia fixa de memória de alta largura de banda. Um A100 com 40 GB pode ser dividido em sete instâncias de 5 GB ou menos instâncias maiores. Cada partição se comporta como uma GPU autônoma menor, portanto, um trabalho barulhento ou com falha em uma instância não pode deixar outra instância sem vida ou corromper. Essa qualidade de serviço garantida torna o MIG ideal para serviço de inferência, clusters multilocatários e ambientes de desenvolvimento onde muitos usuários compartilham um cartão.
As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.
A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.
Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.
À medida que as GPUs crescem para 80 GB, 141 GB e além, o particionamento se torna mais atraente porque os modelos individuais raramente precisam de uma placa inteira para inferência. Espere uma integração mais estreita do Kubernetes e da nuvem, reparticionamento dinâmico sem esgotar o nó e perfis mais refinados. Os fornecedores concorrentes estão buscando uma virtualização de GPU semelhante ao estilo SR-IOV, e as plataformas de inferência sem servidor dependem cada vez mais do particionamento para compactar muitos modelos de forma densa e reduzir o desperdício ocioso.
Um provedor de nuvem divide um A100 em sete instâncias para que sete clientes obtenham, cada um, uma fatia de GPU isolada e garantida para inferência.
Um cluster de pesquisa universitário dá a cada estudante de doutorado uma instância MIG de 10 GB para prototipagem, em vez de monopolizar cartões inteiros.
Um serviço de inferência agrupa vários modelos pequenos de linguagem e visão em um H100, cada um em sua própria partição com latência previsível.
Um cluster Kubernetes anuncia instâncias MIG como recursos agendáveis para que os pods solicitem 'nvidia.com/mig-1g.5gb' como qualquer outro recurso.
A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.
Os custos de infraestrutura e manutenção são frequentemente subestimados.
As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.
Defina metas de latência, qualidade e custo antes da implementação.
Benchmark sob condições realistas de carga e dados.
Monitoramento de instrumentos para erros, desvios e impacto no usuário.
Prepare caminhos de reversão e resposta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
GPU multi-instância (MIG) é uma tecnologia NVIDIA que divide uma única GPU física em várias partições de hardware isoladas. É importante porque permite que um acelerador caro atenda a muitas pequenas cargas de trabalho ao mesmo tempo, sem que elas interfiram umas nas outras.
O MIG impõe isolamento no hardware, dedicando SMs, fatias de cache L2 e memória a cada instância para que as cargas de trabalho não possam interferir.
O MIG estreou com o A100 baseado em Ampere e continuou no H100 e em GPUs de data center posteriores.
Uma GPU compatível com MIG, como a A100, pode ser particionada em até sete instâncias independentes.
O perfil codifica fatias de computação (1g) e a memória dedicada (5GB) fornecidas à instância.
O MIG brilha quando muitas cargas de trabalho pequenas e isoladas (como inferência) compartilham um cartão com qualidade de serviço garantida.
Continue aprendendo
Mais guias escolhidos para este tópico
A seguirPróximo guia
Aprendizagem multitarefa
Técnico