Alimentación para centros de datos de IA: A/B, UPS y PDU
E
ETENZ•Fabricante e integrador de E-House
La alimentación para centros de datos de IA debe soportar la pérdida de una vía y el mantenimiento. Partimos de las entradas del servidor para dimensionar A/B, ubicar UPS y baterías, elegir la PDU de rack y definir la medición.
Dos sistemas pueden estar conectados a dos vías y reaccionar de forma muy distinta cuando una se pierde: uno mantiene plena carga, otro reduce potencia y otro llega a detenerse. Esa respuesta determina cuánto debe soportar cada vía, cómo se configura el UPS y cuánta capacidad de cómputo queda disponible durante la incidencia.
El esquema unifilar suele ser el punto de partida, pero en un módulo de cómputo debe llegar hasta las entradas de alimentación de los servidores y reflejar la operación prevista tras un corte: qué cargas siguen, cuáles pueden limitarse y cuáles pueden guardar estado y apagarse. Con estas decisiones tomadas antes de solicitar ofertas, se pueden comparar con sentido una vía única, dos vías A/B y las distintas disposiciones de UPS.
Primero, cómo recibe energía el servidor
Un NVIDIA DGX H100/H200, por ejemplo, incorpora seis módulos de alimentación con redundancia 4+2 y necesita al menos cuatro energizados para operar con normalidad. Si se conectan tres a A y tres a B, al perder una vía quedan solo tres: el sistema puede reducir rendimiento o incluso detenerse. Por eso, la guía de diseño para centros de datos DGX SuperPOD recomienda al menos tres alimentaciones independientes por rack en aplicaciones de alta disponibilidad cuyos trabajos no puedan recuperarse desde un punto de control. Cada servidor conecta dos de sus seis módulos a cada vía, de modo que, al perder una, todavía quedan cuatro energizados. No es una exigencia general para cualquier rack de IA, sino una recomendación para esa arquitectura.
La agrupación de los módulos de alimentación define cuántas vías hacen falta y qué capacidad necesita cada una. Conviene incluir cómputo, almacenamiento y red en la primera lista de cargas, indicando para cada equipo tensión de entrada, tipo de conector, número y redundancia de módulos, reparto previsto entre vías y respuesta al perder una: funcionamiento normal, potencia reducida o parada.
Un equipo con una sola entrada necesita un conmutador de transferencia para recibir energía de dos vías, y su tiempo de conmutación debe ser menor que la interrupción admisible por el equipo. En equipos de doble fuente, cada cable se conecta, según las instrucciones del fabricante, a una PDU de rack distinta, A y B. Conectar ambos a la misma PDU parece redundante, pero sigue siendo una sola vía.
La continuidad necesaria depende del servicio: si el entrenamiento puede reanudarse desde un checkpoint, si la inferencia puede pasar a otros nodos y cuánto tiempo deben mantenerse el almacenamiento y la red de gestión. Negocio y TI deben fijar estas condiciones; el diseño eléctrico define después qué cargas requieren alimentación continua.
Cuánta carga debe aceptar cada vía A/B
Una distribución de vía única obliga a parar para mantenimiento y cualquier fallo de la cadena corta el suministro. Es válida para cargas que admiten parada o que pueden migrarse a otros nodos. En una arquitectura A/B hay que seguir ambas rutas desde el rack hasta sus fuentes aguas arriba, barras y protecciones. Si terminan en el mismo UPS o en la misma barra, ese elemento común puede derribar las dos vías y debe quedar señalado en el unifilar.
La capacidad se calcula para el estado posterior a la pérdida de una vía. Supongamos 100 kW de carga TI cuyas fuentes reparten normalmente entre A y B y permiten que una sola vía sostenga toda la carga. En operación normal circulan unos 50 kW por cada vía; si A cae, B debe entregar 100 kW. Dos vías con 70 kW útiles cada una sobran en condiciones normales, pero no bastan cuando solo queda B.
El cálculo recorre toda la vía restante: salida del UPS, circuito de distribución, busway o cable, PDU de rack, tomas y entradas del servidor. La menor capacidad de esa cadena marca el límite. También hay que considerar reducción por ambiente, ampliaciones y variación de carga. En el ejemplo anterior, 140 kW de placa sumados entre ambas vías solo respaldan 70 kW de carga TI si se exige plena carga tras perder una vía.
Con A fuera, B asume los 100 kW
Si el proyecto admite reducir carga tras el fallo, la lista debe indicar hasta qué nivel, en cuánto tiempo y mediante qué control. Entre la pérdida de la vía y la aplicación efectiva del límite, la vía restante y sus protecciones siguen recibiendo la carga completa.
Cuando un equipo como el DGX anterior admite tres vías con dos módulos de alimentación en cada una, la capacidad necesaria por vía baja. Para los mismos 100 kW, cada vía lleva unos 33 kW normalmente; al perder una, las otras dos llevan 50 kW cada una. Bastan 50 kW por vía y 150 kW instalados en total. Con dos vías mutuamente redundantes harían falta 100 kW por vía, 200 kW en total. La arquitectura de tres vías reduce la capacidad individual, a cambio de una tercera cadena de distribución y más conexiones.
En qué vía y en qué módulo ubicar el UPS
Un UPS en una sola vía cubre un fallo aguas arriba durante la autonomía de la batería, pero aguas abajo sigue existiendo una única ruta. Si A lleva UPS y B se conecta directamente a red, un corte de red desplaza toda la carga a A. La capacidad de A, la potencia que conservan los servidores con una sola vía y la autonomía de su batería deben comprobarse para ese instante.
Con un UPS independiente en A y otro en B, ambas rutas tienen respaldo. Para el mantenimiento hay que revisar cómo se conectan el bypass, los seccionadores y las baterías: de dónde toma energía el bypass, qué elementos quedan sin protección y cuánta carga acepta la vía restante. Cuando el UPS pasa a bypass de mantenimiento, la carga continúa alimentada directamente desde la red, pero ya no está protegida por la batería de ese UPS.
En una oferta, “N+1” suele significar un módulo de potencia adicional dentro de un UPS modular: si falla uno, la salida continúa. No dice por sí solo si la barra de salida, el bypass o los circuitos aguas abajo tienen reserva. Dos sistemas descritos como N+1 pueden ofrecer capacidades muy distintas durante una avería o una intervención; hay que identificar qué componente está redundado.
UPS y baterías pueden instalarse dentro del módulo de cómputo, concentrarse en un E-House eléctrico separado o conectarse a un sistema UPS existente en el emplazamiento, dejando dentro solo la distribución. En el primer caso ocupan posiciones que podrían destinarse a racks y su calor entra en el balance térmico del módulo. En un E-House separado queda más espacio para racks; A y B llegan por cables o busway y las interfaces entre ambos módulos deben corresponderse en planos. La ubicación de las baterías también afecta ventilación, acceso de mantenimiento y sectorización contra incendios.
Si los servidores siguen funcionando con el UPS, siguen produciendo calor. En un módulo de cómputo refrigerado por líquido, la lista de cargas respaldadas debe incluir, junto con TI, las bombas de circulación del CDU, los controladores, la red crítica y la refrigeración por aire necesaria. El respaldo de la fuente de frío exterior depende del aumento de temperatura admisible, la inercia térmica disponible y el tiempo necesario para una parada ordenada. Alimentar solo el controlador deja una alarma activa mientras la bomba ya está parada.
La autonomía de batería siempre depende de la carga. “10 minutos” significa poco sin indicar los kW, qué equipos cubre, la temperatura, si la capacidad corresponde a batería nueva o al final de su vida útil y la tensión final de descarga. El proveedor debe aportar los datos de descarga para esas condiciones. Si la batería cubre el arranque de un grupo electrógeno, también se cuentan el arranque, la transferencia y la toma de carga.
La PDU de rack se dimensiona para la corriente de fallo
El número de tomas es solo una parte de la selección. También deben coincidir con la conexión de los servidores el tipo de entrada, monofásica o trifásica, la corriente nominal, la protección de cada banco de tomas y las capacidades de tomas y cables. En la solicitud de oferta conviene separar la PDU de rack del cuadro de distribución aguas arriba.
Un ejemplo simplificado muestra el efecto. Para un rack con 60 kW de entrada de CA, 400 V trifásicos equilibrados y factor de potencia 0,95, la corriente de línea es I = P ÷ (√3 × U × factor de potencia), unos 91 A. Con reparto normal A/B, cada vía lleva unos 46 A. Si una sola debe mantener los 60 kW, la vía restante conduce unos 91 A. Dos PDU de 63 A funcionan normalmente, pero la que queda supera su corriente nominal al perder la otra.
La selección real también considera la fase más cargada, la corriente de cada circuito de tomas, la instalación de los cables y las reducciones aplicables al equipo. Puede haber margen en los kW totales mientras una fase o un banco de tomas ya está al límite. La fracción utilizable de la corriente nominal para carga continua se determina conforme a los requisitos aplicables al proyecto y a las condiciones del dispositivo.
La demanda de las GPU cambia con el trabajo de entrenamiento y puede variar mucho en muy poco tiempo. La documentación de selección debe indicar amplitud, duración y secuencia de energización, para comprobar la respuesta dinámica del UPS y la coordinación de protecciones. El consumo mensual o una media de potencia por minuto no muestran esos transitorios.
Los puntos de medida siguen las rutas eléctricas
El contador de acometida mide el consumo del módulo completo. Medir entrada y salida del UPS permite ver las pérdidas de conversión y la carga que soporta. La medición en la PDU de rack ayuda a repartir capacidad, detectar desequilibrio entre fases y decidir si aún se puede añadir equipo. Con la refrigeración en circuitos separados, el consumo de TI queda claramente diferenciado del de los auxiliares.
Para un equipo TI con dos entradas, la energía consumida es la suma de A y B sobre el mismo límite de medida y el mismo intervalo. El contador aguas arriba ya incluye los niveles inferiores; sumar ambos vuelve a contar la misma energía. Si las lecturas se usan para facturación, se acuerdan aparte la precisión, la verificación y el método de liquidación.
La lista de señales suele incluir corriente, potencia, energía y factor de potencia por fase, posición de interruptores, modo del UPS —red, batería o bypass— y autonomía restante. Durante la pérdida de una vía, el operador necesita ver en la misma pantalla el evento y el aumento de carga en la otra para decidir si debe limitar consumo. El periodo de muestreo, la marca de tiempo de eventos y la recuperación de datos tras una caída de comunicaciones se definen según las necesidades de alarma y análisis.
La aceptación debe probar transferencia, mantenimiento y retorno
El plan de aceptación se organiza por condiciones: operación normal con carga, pérdida de A, pérdida de B, respaldo por UPS, bypass de mantenimiento y restablecimiento. Cada prueba define carga inicial, punto de apertura, respuesta esperada, interrupción o reducción admisible y los valores de tensión, corriente, alarmas y estado del servicio que deben registrarse.
“Abrir A” puede probar cosas distintas según el punto. Si se abre la entrada del UPS, este pasa a batería y el servidor continúa recibiendo energía por esa vía: se está probando la batería. Si se abre la salida del UPS o el circuito del rack, el servidor pierde realmente una entrada y se comprueba si la otra vía acepta toda la carga.
Las rutas, capacidades, controles y medidas pueden ensayarse en fábrica con cargas simuladas. La reducción de frecuencia de los servidores, la reconexión de red y la continuidad del servicio solo se observan en el emplazamiento con los equipos reales conectados. La coordinación entre protecciones se confirma mediante cálculo de diseño y los ensayos correspondientes.
Cómo se traduce en un E-House
Dentro del módulo, estas decisiones se convierten en disposición de armarios, recorridos de barras y cables, ubicación de baterías, disipación térmica y espacio de mantenimiento. Según el reparto acordado para el proyecto, ETENZ fabrica el cerramiento e integra sistemas eléctricos, gestión térmica y monitorización. El alcance puede incluir interfaces prefabricadas, montaje en fábrica o entrega del E-House completo, además de colaboración OEM/ODM.
Para solicitar ofertas, el unifilar debe llegar hasta las entradas de alimentación de los servidores; la lista de cargas debe indicar la agrupación de fuentes y la respuesta al perder una vía; las cargas de refrigeración deben figurar en el respaldo, y el plan de aceptación debe separar cada condición de prueba. Con las condiciones de suministro disponibles, cada proveedor puede mostrar rutas, capacidades y cobertura de respaldo en un mismo esquema, lo que permite comparar propuestas equivalentes. Los datos sobre la alimentación de DGX H100/H200 proceden de la sección de especificaciones eléctricas de NVIDIA DGX H100/H200 User Guide y del capítulo eléctrico de DGX SuperPOD: Data Center Design Featuring NVIDIA DGX H100 Systems.
Etiquetas
alimentación para centros de datos de IAalimentación A/BUPS para centros de datosPDU de rackdistribución eléctrica modular