A seguirPróximo guia
Pipelines de engenharia de recursos e controle de versão de dados
Técnico
GUIA Técnico
InfiniBand é uma interconexão de alta velocidade e baixa latência que conecta servidores e GPUs em clusters de IA, e o RDMA permite que uma máquina leia ou grave na memória de outra sem envolver a CPU.
Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.
Quando você treina um modelo em milhares de GPUs, a rede geralmente se torna o gargalo, e não os chips. InfiniBand é uma malha comutada criada especificamente para isso: oferece largura de banda por link de centenas de gigabits por segundo (NDR é executado a 400 Gb/s) e latência em escala de microssegundos. Seu truque principal é o Acesso Remoto Direto à Memória (RDMA), que move dados diretamente entre a memória de dois nós, ignorando o kernel do sistema operacional e as cópias da CPU que retardam o TCP/IP comum. Este 'desvio do kernel' libera ciclos de CPU e reduz a latência. O InfiniBand também fornece controle de fluxo de hardware para uma malha sem perdas, e os switches Quantum da NVIDIA e os adaptadores ConnectX dominam os supercomputadores de IA. RoCE (RDMA over Converged Ethernet) traz benefícios RDMA semelhantes para redes Ethernet.
As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.
A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.
Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.
A largura de banda continua subindo: XDR InfiniBand tem como meta 800 Gb/s por link, com roteiros em direção a 1,6 Tb/s. A concorrência está se intensificando à medida que o Ultra Ethernet Consortium projeta Ethernet que se adapta ao InfiniBand para cargas de trabalho de IA e à medida que a computação em rede (SHARP) transfere a matemática coletiva para os próprios switches. Espere uma integração mais estreita da GPU com a rede, interconexões ópticas para cortar energia e malhas dimensionadas para clusters de centenas de milhares de aceleradores à medida que os modelos de fronteira crescem.
Conectando milhares de GPUs em um supercomputador de IA para que os dados gradientes se movam entre nós em microssegundos durante o treinamento distribuído
Permitir que um servidor leia diretamente a memória de outro (RDMA) para acelerar sistemas de arquivos e bancos de dados distribuídos sem sobrecarga de CPU
Executando operações NCCL all-reduce em InfiniBand para sincronizar pesos de modelo em um cluster de GPU
Usando RoCE para trazer transferências de baixa latência estilo RDMA para redes de data center Ethernet existentes
A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.
Os custos de infraestrutura e manutenção são frequentemente subestimados.
As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.
Defina metas de latência, qualidade e custo antes da implementação.
Benchmark sob condições realistas de carga e dados.
Monitoramento de instrumentos para erros, desvios e impacto no usuário.
Prepare caminhos de reversão e resposta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
InfiniBand é uma interconexão de alta velocidade e baixa latência que conecta servidores e GPUs em clusters de IA, e o RDMA permite que uma máquina leia ou grave na memória de outra sem envolver a CPU. Juntos, eles são o encanamento que mantém milhares de GPUs alimentadas com dados durante o treinamento de modelos grandes.
O acesso remoto direto à memória move os dados diretamente entre a memória de dois nós, ignorando o kernel do sistema operacional e as cópias da CPU, o que reduz a latência e libera os ciclos da CPU.
Os adaptadores InfiniBand transferem dados diretamente de/para a memória fixada no hardware e ignoram o kernel do sistema operacional, eliminando interrupções de CPU e cópias de dados por pacote.
NDR (Next Data Rate) InfiniBand roda a 400 Gb/s por link, com XDR visando 800 Gb/s na próxima geração.
Os aplicativos postam solicitações de trabalho para enviar e receber filas (pares de filas); o adaptador de canal host os lê e executa as transferências diretas de memória.
RoCE significa RDMA sobre Ethernet Convergente, permitindo transferências de bypass de kernel de baixa latência em malhas Ethernet padrão em vez de InfiniBand nativo.
Continue aprendendo
Mais guias escolhidos para este tópico
A seguirPróximo guia
Pipelines de engenharia de recursos e controle de versão de dados
Técnico