Volver a Noticias
IndustriaAI Understanding sesión informativa

NVIDIA presenta un avance del sistema de administración de energía para agregar capacidad de IA dentro de los presupuestos fijos del centro de datos

NVIDIA dice que su suite DSX MaxLPS puede recuperar energía de rack no utilizada, mejorar el rendimiento por vatio y admitir hasta un 40% más de capacidad de GPU Rubin dentro del mismo presupuesto de energía de la instalación. El software todavía se encuentra en Developer Preview y las cifras de rendimiento provienen de las evaluaciones de carga de trabajo representativas de NVIDIA.

Por 6 min read
Liquid-cooled server racks and facility piping in a data-center equipment room.
La versión corta

NVIDIA dice que su suite DSX MaxLPS puede recuperar energía de rack no utilizada, mejorar el rendimiento por vatio y admitir hasta un 40% más de capacidad de GPU Rubin dentro del mismo presupuesto de energía de la instalación. El software todavía se encuentra en Developer Preview y las cifras de rendimiento provienen de las evaluaciones de carga de trabajo representativas de NVIDIA.

que paso

NVIDIA presentó DSX MaxLPS, un sistema a nivel de sitio que combina asignación dinámica de energía, ajuste de GPU específico para cargas de trabajo y diseño de refrigeración líquida de 45 °C. Su software Dynamic Power está en versión preliminar para desarrolladores y está destinado a redistribuir la energía no utilizada entre racks y GPU administrados.

El 21 de agosto de 2026, NVIDIA publicó un blog técnico presentando DSX MaxLPS, que expande como Maximum Land Power Shell. El término se refiere a las tres limitaciones fijas que dan forma a una fábrica de IA: terreno, energía eléctrica y el edificio físico que contiene equipos de distribución de energía, refrigeración, redes y computación. NVIDIA presenta MaxLPS como una combinación de asignación dinámica de energía, técnicas de software para mejorar la salida a un nivel de potencia fijo y un diseño de sitio basado en una operación de entrada de refrigeración líquida a 45 °C. La empresa describe el sistema como una forma de aumentar el rendimiento dentro de una instalación existente, en lugar de como una forma de aumentar el suministro total de energía del sitio.

El software Dynamic Power de NVIDIA se encuentra actualmente en versión preliminar para desarrolladores. Según la fuente, modela la jerarquía del centro de datos desde la conexión de servicios públicos hasta grupos, bastidores, nodos y GPU. Los operadores establecen presupuestos de energía, grupos de recursos y políticas; Luego, el software compara la energía asignada con el consumo real y pone el espacio libre no utilizado a disposición de otros equipos dentro del mismo grupo administrado. También recopila telemetría de energía y puede responder a eventos a nivel del sitio, condiciones de mantenimiento o políticas de emergencia en el mejor esfuerzo posible. NVIDIA dice que DSX Exchange, un bus de eventos de código abierto que también está en Developer Preview, puede conectar el software de energía con sistemas de administración de edificios, monitoreo eléctrico, infraestructura de enfriamiento, interfaces de red y programadores de computación, pero dice que la capa de intercambio no es necesaria para que MaxLPS funcione.

La fuente ilustra el problema con dos ejemplos. En una cascada de presupuesto de energía de 100 MW, NVIDIA asigna 20 MW a los gastos generales de las instalaciones, 10 MW a las pérdidas en los racks y 10 MW a las ineficiencias operativas que involucran fallas, reinicios y puntos de control, dejando 60 MW para la carga de IA. Describe por separado un presupuesto de sitio de 540 kW en el que el aprovisionamiento estático incluye 170 kW y el aprovisionamiento dinámico habilita otro bastidor. Estas se presentan como figuras ilustrativas, no como mediciones de un centro de datos operativo designado. NVIDIA también informa evaluaciones de inferencia representativas en las que la potencia del rack aprovisionada cayó de 125 kW a 90 kW en GB200 NVL72 y de 136 kW a 101 kW en Vera Rubin NVL72. Dice que esos cambios preservaron el rendimiento de la carga de trabajo, permitieron un 39% y un 35% más de racks respectivamente y mejoraron el rendimiento por vatio aproximadamente 1,5 veces y entre 1,3 y 1,4 veces. Las cargas de trabajo probadas fueron DeepSeek-R1 y Kimi-K2.5. La fuente proporcionada no proporciona validación independiente ni protocolos de prueba completos.

Lea la fuente principal: developer.nvidia.com

Por qué es importante

Los centros de datos de IA están cada vez más limitados por la electricidad, la refrigeración y la infraestructura física. Si las afirmaciones de NVIDIA se mantienen en implementaciones independientes, el sistema podría aumentar la producción útil de IA de las conexiones eléctricas existentes, pero la fuente no establece los costos, la confiabilidad o la eficiencia más amplia del enfoque.

La electricidad se está convirtiendo en una limitación directa a la expansión de la infraestructura de IA. Un centro de datos puede tener terreno, equipos de red y espacio en rack disponibles y al mismo tiempo no poder energizar más GPU porque su conexión de servicios públicos, equipo de distribución o planta de enfriamiento ha alcanzado su límite de diseño. La propuesta de NVIDIA apunta a una ineficiencia específica en esa disposición: los racks a menudo se aprovisionan para la demanda máxima a pesar de que las cargas de trabajo pasan por fases como ráfagas de cómputo, ejecución limitada a memoria, sincronización, puntos de control, precarga y decodificación. Si la energía se puede cambiar de manera segura durante esos cambios, una instalación podría producir inferencias o resultados de entrenamiento más útiles sin asegurar inmediatamente otra conexión de energía.

El enfoque también muestra por qué se trata de un proyecto de instalaciones y no de una optimización únicamente de software. NVIDIA dice que los sitios deben diseñarse en torno a una envolvente de potencia bruta fija, y luego dimensionarse para distribución de energía, refrigeración, redes y posiciones de rack que puedan soportar el número de GPU previsto a largo plazo. La empresa recomienda planificar un funcionamiento de entrada de refrigeración líquida directa a 45 °C para los sistemas Vera Rubin NVL72. Un refrigerante más cálido puede permitir que los enfriadores secos u otras formas de enfriamiento gratuito manejen una mayor carga anual de rechazo de calor, lo que reduce la dependencia de enfriadores mecánicos en climas adecuados. Ese potencial depende del clima local, el tamaño del equipo, la redundancia y los controles. Es posible que las instalaciones que no fueron diseñadas para las temperaturas, circuitos de líquido o flexibilidad energética relevantes no puedan capturar las ganancias reclamadas sin un trabajo de modernización significativo.

Para los operadores, el atractivo práctico es la opcionalidad. Inicialmente, un sitio podría ocupar menos racks, mientras que las cargas de trabajo con mucho entrenamiento consumen más energía, y luego agregar hardware más adelante si la combinación de cargas de trabajo cambia hacia la inferencia y la demanda promedio de racks cae. Eso podría cambiar el momento del gasto de capital y la expansión de las instalaciones. Por sí solo, no reduce la demanda total de electricidad procedente de la IA ni demuestra que se construirán menos centros de datos. En cambio, una mayor capacidad dentro de la dotación existente podría hacer que los servicios de IA adicionales sean económicamente viables. La fuente no menciona clientes, escala de implementación, costo de adquisición, ahorros de energía anuales medidos, consumo de agua, tasa de fallas o impacto en el nivel de servicio. Sus afirmaciones centrales de capacidad y rendimiento siguen siendo afirmaciones de NVIDIA basadas en evaluaciones representativas.

Qué ver a continuación

Las pruebas clave son si Dynamic Power Software alcanza la disponibilidad general, si los operadores independientes reproducen las ganancias reportadas y cómo se comporta el sistema ante fallas, cargas de trabajo cambiantes y condiciones climáticas extremas. El diseño térmico y eléctrico requerido puede limitar la adopción en las instalaciones existentes.

La primera pregunta es la madurez del producto. Dynamic Power Software y DSX Exchange se identifican como Developer Preview, por lo que su hardware compatible, interfaces, garantías operativas y disponibilidad de producción siguen siendo desconocidos. La documentación futura debería aclarar cómo se aplican las políticas, qué tan rápido se puede redistribuir el poder, qué sucede cuando la telemetría se retrasa o es incorrecta y si las acciones de emergencia son deterministas. NVIDIA dice que el circuito de control funciona con el mejor esfuerzo posible durante los eventos de energía, una limitación importante para las instalaciones que deben mantener estrictos compromisos de servicio y redundancia. También importará si el sistema puede funcionar con equipos y programadores fuera de la propia pila de NVIDIA.

La segunda cuestión es la reproducibilidad. Una comparación útil publicaría la línea base estática no administrada, la configuración de la carga de trabajo, el número de ejecuciones, la definición de rendimiento, la latencia, la tasa de error del servicio, la utilización de la GPU y los límites de medición de energía. La propia NVIDIA enumera el rendimiento, la latencia, la tasa de error del servicio, el consumo de energía, la utilización y el cumplimiento de políticas como métricas para una validación de alcance, pero la fuente proporcionada no proporciona esos resultados completos. Las pruebas independientes entre cargas de trabajo de inferencia, capacitación y post-entrenamiento mostrarían si las mejoras reportadas se generalizan más allá de los dos casos de inferencia representativos. Los resultados también deben separarse de las ganancias causadas por hardware más nuevo, versiones de software, cambios de red o ajustes específicos de la carga de trabajo.

La tercera cuestión es el despliegue físico. Los operadores necesitarán evidencia de sitios con diferentes climas, arquitecturas de enfriamiento, limitaciones de servicios públicos y requisitos de confiabilidad. El diseño de 45 °C puede reducir el uso de enfriadores en algunos lugares, pero podría requerir nuevos equipos de rechazo de calor, controles o prácticas de mantenimiento en otros. Los observadores deben monitorear si las instalaciones pueden agregar las posiciones de rack prometidas sin expandir la distribución eléctrica, la capacidad de enfriamiento o la infraestructura de la red, y si el sistema mantiene el rendimiento durante climas cálidos, fallas, reinicios y puntos de control. Hasta que esos resultados estén disponibles, MaxLPS se entiende mejor como una estrategia de infraestructura descrita por el proveedor y un software de vista previa, no como un punto de referencia de eficiencia para toda la industria establecido de forma independiente.

Guías y cuestionarios relacionados

¿Encontró esto útil?
El informe semanal

Obtenga las historias de IA que realmente importan.

Un correo electrónico útil a la semana: qué cambió en la IA, por qué es importante, además de herramientas, guías, oportunidades y formas prácticas de actuar.

Gratis · Sin spam · Darse de baja en un clic