A alimentação de data centers de IA precisa suportar a perda de um caminho e a manutenção. A partir das entradas dos servidores, dimensionamos A/B, UPS, baterias, PDU de rack e pontos de medição.
Dois sistemas podem receber energia por dois caminhos e reagir de maneiras bem diferentes quando um deles sai de operação: um mantém plena carga, outro reduz potência e outro pode até parar. Essa resposta define quanto cada caminho precisa suportar, como configurar o UPS e quanta capacidade computacional permanece disponível durante a falha.
O diagrama unifilar costuma ser o ponto de partida. Em um módulo de computação, ele precisa chegar às entradas de alimentação dos servidores e refletir a operação após a perda de energia: quais cargas continuam, quais podem ser limitadas e quais podem salvar o estado e desligar. Com isso definido antes da cotação, fica possível comparar de forma consistente um caminho único, dois caminhos A/B e diferentes arranjos de UPS.
Comece pelas entradas de energia do servidor
Um NVIDIA DGX H100/H200, por exemplo, tem seis módulos de alimentação em redundância 4+2 e precisa de pelo menos quatro energizados para operar normalmente. Se três forem ligados em A e três em B, a perda de um caminho deixa apenas três: o sistema pode reduzir o desempenho ou até parar. Por isso, o guia de projeto de data center para DGX SuperPOD recomenda pelo menos três alimentações independentes por rack em aplicações de alta disponibilidade cujas tarefas não possam ser retomadas a partir de checkpoint. Cada servidor liga dois dos seis módulos a cada caminho; quando um sai, quatro continuam energizados. Essa é uma recomendação para essa arquitetura, não uma regra geral para qualquer rack de IA.
O agrupamento dos módulos de alimentação determina quantos caminhos são necessários e qual deve ser a capacidade de cada um. Vale colocar computação, armazenamento e rede na primeira lista de cargas, registrando para cada equipamento a tensão de entrada, o tipo de plugue, a quantidade e a redundância dos módulos, a divisão prevista entre caminhos e o comportamento sem um deles: operação normal, potência reduzida ou parada.
Equipamentos com uma única entrada precisam de uma chave de transferência para receber energia de dois caminhos, e o tempo de comutação deve ser menor que a interrupção tolerada pelo equipamento. Nos equipamentos com duas fontes, cada cabo deve ser conectado, conforme orientação do fabricante, a uma PDU de rack diferente, A e B. Ligar os dois na mesma PDU parece redundância, mas continua sendo um único caminho.
A continuidade necessária depende da operação: se o treinamento pode voltar de um checkpoint, se a inferência pode migrar para outros nós e por quanto tempo armazenamento e rede de gerenciamento devem permanecer ativos. Negócio e TI definem essas condições; o projeto elétrico delimita então quais cargas precisam de alimentação contínua.
Quanto cada caminho A/B precisa suportar
Uma distribuição por caminho único exige parada para manutenção e qualquer falha na cadeia interrompe o fornecimento. Ela atende cargas que aceitam parada ou que podem ser transferidas para outros nós. Em uma arquitetura A/B, os dois caminhos devem ser seguidos do rack até as respectivas fontes a montante, barramentos e proteções. Se terminarem no mesmo UPS ou barramento, esse ponto comum pode derrubar ambos e precisa aparecer com clareza no unifilar.
A capacidade é calculada para a condição após a perda de um caminho. Considere 100 kW de carga de TI cujas fontes dividem normalmente a demanda entre A e B e permitem que um único caminho assuma tudo. Em operação normal, A e B levam cerca de 50 kW cada; se A cair, B precisa fornecer 100 kW. Dois caminhos com 70 kW úteis cada parecem folgados no dia a dia, mas não atendem quando resta apenas B.
A conta percorre todo o caminho restante: saída do UPS, circuito de distribuição, barramento blindado ou cabo, PDU de rack, tomadas e entradas dos servidores. A menor capacidade da cadeia define o limite. Também entram derating por ambiente, expansão e oscilação de carga. No exemplo anterior, 140 kW nominais somando os dois caminhos só sustentam 70 kW de carga de TI se o requisito for plena carga após a perda de um deles.
Com A fora, B assume os 100 kW
Se o projeto aceitar redução de carga após a falha, a lista deve informar o novo limite, em quanto tempo ele será atingido e por qual controle. Entre a perda do caminho e a atuação efetiva do limite, o caminho restante e seus dispositivos de proteção ainda recebem a carga total.
Quando um equipamento como o DGX citado aceita três caminhos, com dois módulos de alimentação em cada um, a capacidade necessária por caminho diminui. Para os mesmos 100 kW, cada caminho leva cerca de 33 kW normalmente; com a perda de um deles, os dois restantes levam 50 kW cada. Assim, bastam 50 kW por caminho e 150 kW instalados no total. Com dois caminhos em redundância mútua seriam 100 kW por caminho, 200 kW no total. O arranjo de três caminhos reduz a capacidade individual, mas acrescenta uma terceira cadeia de distribuição e mais conexões.
Em qual caminho e em qual módulo instalar o UPS
Um UPS em apenas um caminho sustenta uma falha a montante enquanto houver bateria, mas depois dele ainda existe uma única rota de distribuição. Se A tiver UPS e B for ligado diretamente à rede, uma falta de rede transfere toda a carga para A. A capacidade de A, a potência que os servidores mantêm com um único caminho e a autonomia da bateria precisam ser verificadas nessa condição.
Com um UPS independente em A e outro em B, os dois caminhos têm respaldo. Para manutenção, é preciso verificar como bypass, chaves de isolamento e baterias estão ligados: de onde o bypass recebe energia, quais partes ficam sem proteção e quanta carga o caminho restante suporta. Ao passar o UPS para bypass de manutenção, a carga continua energizada diretamente pela rede, mas deixa de contar com a proteção da bateria daquele UPS.
Em uma proposta, “N+1” normalmente indica um módulo de potência adicional dentro de um UPS modular: se um módulo falhar, a saída continua. Isso não informa, por si só, se o barramento de saída, o bypass ou os circuitos a jusante têm redundância. Dois sistemas descritos como N+1 podem oferecer capacidades muito diferentes em falha ou manutenção; é preciso identificar qual componente tem a reserva.
UPS e baterias podem ficar no módulo de computação, concentrados em um E-House elétrico separado ou conectados ao sistema UPS existente no site, deixando apenas a distribuição dentro do módulo. No primeiro caso, ocupam posições que poderiam receber racks e seu calor entra no balanço térmico do ambiente. Em um E-House separado, sobra mais espaço para racks; A e B chegam por cabos ou barramentos blindados e as interfaces entre os módulos precisam corresponder nos desenhos. A posição das baterias também afeta ventilação, acesso para manutenção e compartimentação de incêndio.
Se os servidores continuam operando no UPS, continuam gerando calor. Em um módulo de computação com refrigeração líquida, a lista de cargas de backup deve incluir, junto com TI, bombas de circulação do CDU, controladores, rede crítica e a refrigeração a ar necessária. O respaldo da fonte externa de rejeição de calor depende do aumento de temperatura permitido, da inércia térmica disponível e do tempo necessário para o desligamento ordenado. Alimentar apenas o controlador mantém o alarme ativo enquanto a bomba já parou.
A autonomia da bateria sempre depende da carga. “10 minutos” diz pouco sem os kW, os equipamentos cobertos, a temperatura, a capacidade de bateria nova ou no fim da vida útil e a tensão final de descarga. O fornecedor deve apresentar os dados de descarga para essas condições. Se a bateria serve para aguardar um grupo gerador, também entram na conta partida, transferência e aplicação de carga.
A PDU de rack é dimensionada pela corrente de contingência
Quantidade de tomadas é apenas um critério. Tipo de entrada, monofásica ou trifásica, corrente nominal, proteção de cada banco de tomadas e capacidade de tomadas e cabos também precisam corresponder às ligações dos servidores. Na solicitação de cotação, a PDU de rack deve aparecer separada do quadro de distribuição a montante.
Um exemplo simplificado mostra o efeito. Para um rack com 60 kW de entrada em CA, 400 V trifásicos equilibrados e fator de potência 0,95, a corrente de linha é I = P ÷ (√3 × U × fator de potência), aproximadamente 91 A. Com divisão normal A/B, cada caminho leva cerca de 46 A. Se um único caminho precisar manter os 60 kW, o caminho restante conduzirá cerca de 91 A. Duas PDU de 63 A atendem normalmente, mas a unidade restante supera a corrente nominal quando a outra sai.
A seleção real também considera a fase mais carregada, a corrente de cada circuito de tomadas, as condições de instalação dos cabos e os deratings dos equipamentos. Pode haver folga nos kW totais enquanto uma fase ou um banco de tomadas já atingiu o limite. A parcela da corrente nominal disponível para carga contínua é definida conforme os requisitos aplicáveis ao projeto e as condições dos dispositivos.
A carga das GPU varia com as tarefas de treinamento e pode mudar bastante em intervalos muito curtos. A documentação de seleção deve informar amplitude, duração e sequência de energização para verificar a resposta dinâmica do UPS e a coordenação das proteções. O consumo mensal e a potência média por minuto não mostram esses transientes.
Os pontos de medição acompanham os caminhos elétricos
O medidor da entrada mostra o consumo do módulo inteiro. Medir entrada e saída do UPS permite ver perdas de conversão e carga atendida. A medição na PDU de rack ajuda a distribuir capacidade, identificar desequilíbrio entre fases e decidir se ainda cabe novo equipamento. Com a refrigeração em circuitos separados, o consumo de TI fica claramente distinto dos serviços auxiliares.
Para um equipamento de TI com duas entradas, o consumo é a soma de A e B dentro do mesmo limite de medição e no mesmo período. O medidor a montante já inclui os níveis inferiores; somar os dois níveis conta a mesma energia novamente. Se as leituras forem usadas para faturamento, classe de exatidão, verificação e método de cobrança são acordados separadamente.
A lista de pontos de supervisão costuma incluir corrente, potência, energia e fator de potência por fase, posição das chaves, modo do UPS —rede, bateria ou bypass— e autonomia restante. Na perda de um caminho, o operador precisa ver na mesma tela o evento e o aumento de carga no outro para decidir se deve limitar consumo. Intervalo de amostragem, carimbo de tempo dos eventos e recuperação de dados após falha de comunicação são definidos conforme as necessidades de alarme e análise.
A aceitação deve testar transferência, manutenção e retorno
O plano de aceitação é organizado por condição: operação normal com carga, perda de A, perda de B, respaldo por UPS, bypass de manutenção e restabelecimento. Cada ensaio define a carga inicial, o ponto de abertura, a resposta esperada, a interrupção ou redução admissível e os registros de tensão, corrente, alarmes e estado do serviço.
“Abrir A” testa coisas diferentes conforme o ponto escolhido. Ao abrir a entrada do UPS, ele passa para bateria e o servidor continua energizado por aquele caminho: o teste é da bateria. Ao abrir a saída do UPS ou o circuito do rack, o servidor realmente perde uma entrada e o teste mostra se o outro caminho suporta toda a carga.
Caminhos, capacidades, controles e medições podem ser ensaiados na fábrica com cargas simuladas. Redução de frequência dos servidores, reconexão da rede e continuidade da aplicação só aparecem no site com os equipamentos reais conectados. A coordenação entre proteções é confirmada por cálculo de projeto e pelos ensaios correspondentes.
Como isso chega ao E-House
Dentro do módulo, essas decisões viram disposição de painéis, rotas de barramentos e cabos, posição das baterias, dissipação térmica e espaço de manutenção. Conforme a divisão de responsabilidades do projeto, a ETENZ fabrica o invólucro e integra sistemas elétricos, gerenciamento térmico e monitoramento. O escopo pode incluir interfaces pré-fabricadas, montagem em fábrica ou entrega do E-House completo, além de cooperação OEM/ODM.
Para cotar, o unifilar deve chegar às entradas de alimentação dos servidores; a lista de cargas deve indicar o agrupamento das fontes e a resposta à perda de um caminho; as cargas de refrigeração precisam entrar no backup, e o plano de aceitação deve separar cada condição de ensaio. Com as condições de alimentação disponíveis, cada fornecedor pode mostrar caminhos, capacidades e abrangência do respaldo em um único desenho, facilitando a comparação entre propostas equivalentes. As informações de alimentação do DGX H100/H200 vêm da seção de especificações elétricas do NVIDIA DGX H100/H200 User Guide e do capítulo elétrico de DGX SuperPOD: Data Center Design Featuring NVIDIA DGX H100 Systems.
Tags
alimentação de data centers de IAalimentação A/BUPS para data centerPDU de rackdistribuição elétrica modular