GUIA Técnico

Rede InfiniBand e RDMA

InfiniBand é uma interconexão de alta velocidade e baixa latência que conecta servidores e GPUs em clusters de IA, e o RDMA permite que uma máquina leia ou grave na memória de outra sem envolver a CPU.

  • 2 minutos de leitura
  • Última atualização
Nesta página2 minutos de leitura
  1. Visão geral
  2. Mergulho profundo
  3. Impacto Estratégico
  4. O futuro da rede InfiniBand e RDMA
  5. Implementação no mundo real
  6. Riscos e guarda-corpos
  7. Roteiro de implementação
  8. Continue explorando
  9. Perguntas frequentes

Visão geral

Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.

Mergulho profundo

Quando você treina um modelo em milhares de GPUs, a rede geralmente se torna o gargalo, e não os chips. InfiniBand é uma malha comutada criada especificamente para isso: oferece largura de banda por link de centenas de gigabits por segundo (NDR é executado a 400 Gb/s) e latência em escala de microssegundos. Seu truque principal é o Acesso Remoto Direto à Memória (RDMA), que move dados diretamente entre a memória de dois nós, ignorando o kernel do sistema operacional e as cópias da CPU que retardam o TCP/IP comum. Este 'desvio do kernel' libera ciclos de CPU e reduz a latência. O InfiniBand também fornece controle de fluxo de hardware para uma malha sem perdas, e os switches Quantum da NVIDIA e os adaptadores ConnectX dominam os supercomputadores de IA. RoCE (RDMA over Converged Ethernet) traz benefícios RDMA semelhantes para redes Ethernet.

Impacto Estratégico

Custo e orçamento

As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.

Decisões mais claras

A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.

Controle de qualidade

Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.

O futuro da rede InfiniBand e RDMA

A largura de banda continua subindo: XDR InfiniBand tem como meta 800 Gb/s por link, com roteiros em direção a 1,6 Tb/s. A concorrência está se intensificando à medida que o Ultra Ethernet Consortium projeta Ethernet que se adapta ao InfiniBand para cargas de trabalho de IA e à medida que a computação em rede (SHARP) transfere a matemática coletiva para os próprios switches. Espere uma integração mais estreita da GPU com a rede, interconexões ópticas para cortar energia e malhas dimensionadas para clusters de centenas de milhares de aceleradores à medida que os modelos de fronteira crescem.

Implementação no mundo real

Conectando milhares de GPUs em um supercomputador de IA para que os dados gradientes se movam entre nós em microssegundos durante o treinamento distribuído

Permitir que um servidor leia diretamente a memória de outro (RDMA) para acelerar sistemas de arquivos e bancos de dados distribuídos sem sobrecarga de CPU

Executando operações NCCL all-reduce em InfiniBand para sincronizar pesos de modelo em um cluster de GPU

Usando RoCE para trazer transferências de baixa latência estilo RDMA para redes de data center Ethernet existentes

Riscos e guarda-corpos

  • A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.

  • Os custos de infraestrutura e manutenção são frequentemente subestimados.

  • As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.

Roteiro de implementação

  1. Defina metas de latência, qualidade e custo antes da implementação.

  2. Benchmark sob condições realistas de carga e dados.

  3. Monitoramento de instrumentos para erros, desvios e impacto no usuário.

  4. Prepare caminhos de reversão e resposta a incidentes antes de escalar.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InfiniBand and RDMA Networking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is InfiniBand and RDMA Networking?

InfiniBand é uma interconexão de alta velocidade e baixa latência que conecta servidores e GPUs em clusters de IA, e o RDMA permite que uma máquina leia ou grave na memória de outra sem envolver a CPU. Juntos, eles são o encanamento que mantém milhares de GPUs alimentadas com dados durante o treinamento de modelos grandes.

O que o RDMA permite fundamentalmente que um computador faça?

O acesso remoto direto à memória move os dados diretamente entre a memória de dois nós, ignorando o kernel do sistema operacional e as cópias da CPU, o que reduz a latência e libera os ciclos da CPU.

Por que o InfiniBand atinge uma latência muito menor do que a rede TCP/IP comum?

Os adaptadores InfiniBand transferem dados diretamente de/para a memória fixada no hardware e ignoram o kernel do sistema operacional, eliminando interrupções de CPU e cópias de dados por pacote.

Aproximadamente qual largura de banda por link o NDR InfiniBand fornece?

NDR (Next Data Rate) InfiniBand roda a 400 Gb/s por link, com XDR visando 800 Gb/s na próxima geração.

No RDMA, para que são usados os 'pares de filas'?

Os aplicativos postam solicitações de trabalho para enviar e receber filas (pares de filas); o adaptador de canal host os lê e executa as transferências diretas de memória.

O que é RoCE?

RoCE significa RDMA sobre Ethernet Convergente, permitindo transferências de bypass de kernel de baixa latência em malhas Ethernet padrão em vez de InfiniBand nativo.