GUÍA Técnica

Redes InfiniBand y RDMA

InfiniBand es una interconexión de alta velocidad y baja latencia que vincula servidores y GPU en clústeres de IA, y RDMA permite que una máquina lea o escriba la memoria de otra sin involucrar a la CPU.

  • 2 minutos de lectura
  • Última actualización
En esta pagina2 minutos de lectura
  1. Descripción general
  2. Buceo profundo
  3. Impacto Estratégico
  4. El futuro de las redes InfiniBand y RDMA
  5. Implementación en el mundo real
  6. Riesgos y barandillas
  7. Hoja de ruta de implementación
  8. Sigue explorando
  9. Preguntas frecuentes

Descripción general

Together they are the plumbing that keeps thousands of GPUs fed with data during large-model training.

Buceo profundo

Cuando entrenas un modelo en miles de GPU, la red suele convertirse en el cuello de botella, no los chips. InfiniBand es una estructura conmutada diseñada específicamente para esto: ofrece un ancho de banda por enlace de cientos de gigabits por segundo (NDR funciona a 400 Gb/s) y una latencia a escala de microsegundos. Su truco clave es el acceso remoto directo a la memoria (RDMA), que mueve datos directamente entre la memoria de dos nodos, evitando el kernel del sistema operativo y las copias de la CPU que ralentizan el TCP/IP normal. Este 'bypass del kernel' libera ciclos de CPU y reduce drásticamente la latencia. InfiniBand también proporciona control de flujo de hardware para una estructura sin pérdidas, y los conmutadores Quantum de NVIDIA más los adaptadores ConnectX dominan las supercomputadoras de IA. RoCE (RDMA sobre Ethernet convergente) aporta beneficios RDMA similares a las redes Ethernet.

Impacto Estratégico

Costo y presupuesto

Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.

Decisiones más claras

La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.

control de calidad

Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.

El futuro de las redes InfiniBand y RDMA

El ancho de banda sigue aumentando: XDR InfiniBand apunta a 800 Gb/s por enlace, con hojas de ruta hacia 1,6 Tb/s. La competencia se está intensificando a medida que el Consorcio Ultra Ethernet diseña Ethernet que coincide con InfiniBand para cargas de trabajo de IA, y a medida que la computación en red (SHARP) descarga matemáticas colectivas en los propios conmutadores. Espere una integración más estrecha de la GPU a la red, interconexiones ópticas para reducir la energía y estructuras escaladas a grupos de cientos de miles de aceleradores a medida que crecen los modelos de vanguardia.

Implementación en el mundo real

Conectar miles de GPU en una supercomputadora de IA para que los datos de gradiente se muevan entre nodos en microsegundos durante el entrenamiento distribuido

Permitir que un servidor lea la memoria de otro directamente (RDMA) para acelerar los sistemas de archivos distribuidos y las bases de datos sin sobrecarga de CPU

Ejecutar operaciones de reducción total de NCCL en InfiniBand para sincronizar los pesos de los modelos en un clúster de GPU

Uso de RoCE para llevar transferencias de baja latencia estilo RDMA a redes de centros de datos Ethernet existentes

Riesgos y barandillas

  • La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.

  • Los costos de infraestructura y mantenimiento a menudo se subestiman.

  • Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.

Hoja de ruta de implementación

  1. Defina objetivos de latencia, calidad y costos antes de la implementación.

  2. Comparación en condiciones realistas de carga y datos.

  3. Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.

  4. Prepare rutas de reversión y respuesta a incidentes antes de escalar.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InfiniBand and RDMA Networking quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is InfiniBand and RDMA Networking?

InfiniBand es una interconexión de alta velocidad y baja latencia que vincula servidores y GPU en clústeres de IA, y RDMA permite que una máquina lea o escriba la memoria de otra sin involucrar a la CPU. Juntos son la tubería que mantiene miles de GPU alimentadas con datos durante el entrenamiento de modelos grandes.

¿Qué permite RDMA fundamentalmente hacer a una computadora?

El acceso remoto directo a la memoria mueve datos directamente entre la memoria de dos nodos, sin pasar por el kernel del sistema operativo y las copias de la CPU, lo que reduce la latencia y libera ciclos de la CPU.

¿Por qué InfiniBand logra una latencia mucho menor que la red TCP/IP ordinaria?

Los adaptadores InfiniBand transfieren datos directamente hacia y desde la memoria fijada en el hardware y omiten el kernel del sistema operativo, lo que elimina las interrupciones de la CPU por paquete y las copias de datos.

¿Aproximadamente qué ancho de banda por enlace proporciona NDR InfiniBand?

NDR (Next Data Rate) InfiniBand funciona a 400 Gb/s por enlace, con XDR apuntando a 800 Gb/s en la próxima generación.

En RDMA, ¿para qué se utilizan los 'pares de colas'?

Las aplicaciones publican solicitudes de trabajo para enviar y recibir colas (pares de colas); el adaptador del canal host los lee y realiza las transferencias directas de memoria.

¿Qué es RoCE?

RoCE significa RDMA sobre Ethernet convergente, lo que permite transferencias de derivación del kernel de baja latencia en estructuras Ethernet estándar en lugar de InfiniBand nativo.