Perspectives du secteur

Architecture d’alimentation data center IA : choisir les voies A/B, l’UPS et les PDU de rack

E
ETENZ•Rédaction

Une alimentation data center IA doit rester cohérente après la perte d’une voie et pendant la maintenance. Tout part du raccordement électrique des serveurs : capacité de chaque voie A/B, implantation de l’UPS et des batteries, courant des PDU de rack et points de comptage.

Intérieur d’un E-House électrique pour data center IA : équipements moyenne et basse tension alignés sous des chemins de câbles superposés

Deux serveurs alimentés par deux voies ne réagissent pas forcément de la même façon lorsqu’une voie disparaît. L’un peut rester à pleine charge, l’autre réduire sa puissance, voire s’arrêter. Le modèle retenu détermine donc la capacité de chaque voie, l’architecture UPS et la puissance de calcul qui restera disponible après le défaut.

La conception commence généralement par le schéma unifilaire. Pour un module de calcul, celui-ci doit aller jusqu’aux entrées d’alimentation des serveurs et correspondre au comportement demandé après une coupure : charges maintenues, charges délestées et tâches pouvant s’arrêter après sauvegarde de leur état. Une fois ces choix arrêtés avant la consultation, il devient possible de comparer objectivement une voie unique, deux voies A/B et les différentes architectures UPS.

Commencer par le raccordement des serveurs

Prenons le NVIDIA DGX H100/H200 : ses six blocs d’alimentation sont organisés en redondance 4+2 et au moins quatre doivent rester sous tension pour un fonctionnement normal. Avec trois blocs sur la voie A et trois sur la voie B, la perte d’une voie n’en laisse que trois ; le système peut alors fonctionner avec des performances réduites, voire s’arrêter. Le guide de conception des data centers DGX SuperPOD indique ainsi que le schéma A/B traditionnel convient aux baies de gestion, mais recommande au moins trois alimentations indépendantes par baie lorsque la disponibilité est critique et que les tâches ne peuvent pas repartir d’un point de contrôle. Chaque voie alimente alors deux des six blocs du serveur : après la perte ou la maintenance d’une voie, quatre blocs restent alimentés.

La répartition des blocs d’alimentation fixe à la fois le nombre de voies et la capacité à prévoir sur chacune. Dès le premier bilan de puissance, il faut donc recenser ensemble calcul, stockage et réseau, avec pour chaque équipement la tension d’entrée, le type de prise, le nombre et la redondance des alimentations, leur répartition prévue et le comportement attendu après la perte d’une voie.

Un équipement doté d’une seule entrée doit passer par un commutateur de transfert de rack pour utiliser deux sources ; son temps de transfert doit rester inférieur à la coupure admissible par l’équipement. Un équipement à deux alimentations se raccorde, selon les prescriptions du fabricant, à un PDU de rack distinct sur chaque voie A et B. Brancher les deux cordons sur le même PDU donne l’apparence d’une double alimentation, mais conserve un point de défaillance unique.

La continuité nécessaire dépend de l’exploitation : un entraînement peut-il reprendre depuis un point de contrôle, l’inférence peut-elle basculer vers d’autres nœuds, et combien de temps le stockage et le réseau de gestion doivent-ils rester disponibles ? Les équipes métier et IT répondent à ces questions ; l’étude électrique en déduit le périmètre à secourir.

Quelle charge chaque voie A/B doit-elle reprendre ?

Avec une seule voie, toute maintenance impose une coupure et tout défaut sur le parcours interrompt l’alimentation. Cette solution convient aux charges acceptant l’arrêt ou aux services repris par d’autres nœuds. Avec deux voies A/B, il faut remonter chaque parcours depuis la baie jusqu’à sa source amont, son jeu de barres et ses protections. Si les deux voies rejoignent finalement le même UPS ou le même jeu de barres, la défaillance de cet élément les coupe ensemble ; ce point commun doit apparaître clairement sur le schéma unifilaire.

La capacité se calcule dans l’état dégradé. Supposons une charge IT de 100 kW, normalement partagée entre deux voies, mais pouvant être reprise intégralement par la voie restante. En régime normal, A et B portent environ 50 kW chacune ; si A disparaît, B doit porter 100 kW. Deux voies offrant chacune 70 kW sont confortables en régime normal, mais insuffisantes lorsqu’il ne reste que B.

Le calcul suit toute la voie restante : sortie UPS, départ de distribution, canalisation préfabriquée ou câble, PDU de rack, prise, puis entrée du serveur. Le composant le moins dimensionné fixe la capacité de l’ensemble. Il faut aussi intégrer les déclassements liés à l’environnement, l’extension future et les variations de charge. Dans l’exemple précédent, deux voies totalisant 140 kW en valeur nominale ne permettent de protéger que 70 kW de charge IT si la pleine puissance doit rester disponible après la perte d’une voie.

Schéma de charge des voies A/B : 50 kW sur chaque voie en régime normal ; après une coupure en sortie de l’UPS A, la voie A tombe à 0 kW et la voie B reprend les 100 kW. Chaque voie alimente un groupe d’entrées IT via un UPS, une distribution et un PDU de rack.
Voie A coupée : B reprend les 100 kW

Si le projet accepte un délestage après la perte d’une voie, le bilan de puissance doit préciser la puissance cible, le délai de réduction et le mode de commande. Pendant l’intervalle entre le défaut et la fin du délestage, la voie restante et ses protections supportent encore la pleine charge.

Lorsqu’un équipement peut être raccordé sur trois voies comme le DGX cité plus haut, avec deux blocs d’alimentation par voie, la capacité unitaire baisse. Pour 100 kW, chaque voie porte environ 33 kW en régime normal ; après la perte d’une voie, les deux autres portent 50 kW chacune. Trois voies dimensionnées à 50 kW totalisent alors 150 kW, contre 200 kW pour deux voies redondantes de 100 kW chacune. Le gain porte sur la capacité de chaque voie ; il faut en contrepartie une troisième chaîne de distribution et son câblage.

Sur quelle voie placer l’UPS, et dans quel module ?

Un UPS sur une voie permet de franchir une coupure amont pendant l’autonomie des batteries, mais l’aval de l’UPS reste une chaîne unique. Si la voie A passe par l’UPS et la voie B est raccordée directement au réseau, une coupure réseau reporte toute la charge sur A. La capacité de cette voie, la puissance encore disponible avec une seule alimentation serveur et l’autonomie de ses batteries doivent être vérifiées dans cet état.

Avec un UPS sur A et un autre sur B, chaque voie dispose de sa propre réserve. La maintenance impose toutefois de vérifier le raccordement du bypass, des organes d’isolement et des batteries : origine du bypass, parties privées de protection pendant l’intervention et capacité restante sur l’autre voie. Une fois l’UPS placé sur bypass de maintenance, la charge reste alimentée directement par le réseau, mais elle n’est plus protégée par la batterie de cet UPS.

Dans une offre, « N+1 » désigne souvent un module de puissance supplémentaire dans un UPS modulaire : la perte d’un module n’interrompt pas la sortie. Cela ne dit rien, à lui seul, de la redondance du jeu de barres de sortie, du bypass ou des départs aval. Deux offres N+1 peuvent donc protéger des composants différents et laisser des capacités très différentes en maintenance ou sur défaut.

Les UPS et batteries peuvent prendre place dans le module de calcul, être regroupés dans un E-House électrique séparé ou s’appuyer sur l’UPS existant du site, le module ne conservant alors que la distribution. Dans le premier cas, ils occupent des emplacements de baies et leur dissipation thermique s’ajoute à la charge du module. Dans le second, davantage de baies IT peuvent être installées ; les voies A et B arrivent séparément par câbles ou canalisations préfabriquées, avec des interfaces et cheminements concordants sur les plans des deux modules. L’emplacement des batteries conditionne aussi la ventilation, les accès de maintenance et le compartimentage incendie.

Tant que les serveurs restent sur UPS, ils continuent à produire de la chaleur. Dans un module de calcul refroidi par liquide, le bilan des charges secourues doit donc inclure les pompes de circulation du CDU, les contrôleurs, le réseau critique et le refroidissement d’air indispensable, en plus de l’IT. Le secours de la source froide extérieure dépend de la hausse de température admissible, de l’inertie ou du stockage thermique disponible et du délai nécessaire à un arrêt ordonné. Secourir uniquement le contrôleur aboutit à une situation simple : il continue d’émettre des alarmes alors que la pompe est déjà arrêtée.

L’autonomie d’une batterie n’a de sens qu’avec ses conditions de charge. Une mention « 10 minutes » varie fortement selon la puissance en kW, les équipements couverts, la température, l’état neuf ou de fin de vie de la batterie et la tension finale de décharge. Le fournisseur doit fournir les données de décharge correspondant à ces hypothèses. Si la batterie sert à attendre un groupe électrogène, il faut inclure le démarrage, le transfert et la prise de charge.

Dimensionner le PDU de rack sur le courant de défaut

Le nombre de prises n’est qu’un critère du PDU de rack. Monophasé ou triphasé, courant assigné, protection de chaque groupe de prises, calibre des prises et des cordons : tout doit correspondre au raccordement des serveurs. Dans la demande de prix, les PDU de rack doivent être séparés des tableaux de distribution amont.

Un exemple simplifié montre l’enjeu. Pour une baie absorbant 60 kW en courant alternatif, sous 400 V triphasé équilibré avec un facteur de puissance de 0,95, le courant de ligne vaut I = P ÷ (√3 × U × facteur de puissance), soit environ 91 A. En partage normal A/B, chaque voie porte environ 46 A. Si la baie doit rester à 60 kW après la perte d’une voie, la voie restante doit laisser passer environ 91 A. Deux PDU dotés chacun d’une entrée 63 A suffisent en régime normal, mais dépassent leur courant assigné dès qu’une voie est perdue.

Le choix final doit tenir compte de la phase la plus chargée, du courant de chaque groupe de prises, des conditions de pose des câbles et des déclassements des équipements. Une marge apparente en kW n’empêche pas une phase ou un groupe de prises d’atteindre sa limite en premier. La fraction du courant assigné utilisable en charge continue dépend des exigences applicables au projet et des conditions des matériels.

La puissance appelée par les GPU suit les cycles des tâches d’entraînement et peut varier fortement sur de très courtes durées. Les données de sélection doivent préciser l’amplitude, la durée de ces variations et la séquence de mise sous tension afin de vérifier la réponse dynamique de l’UPS et la coordination des protections. Les relevés mensuels d’énergie et les moyennes à la minute ne montrent pas ces transitoires.

Placer le comptage le long des voies d’alimentation

Le compteur à l’arrivée mesure la consommation du module entier. Un compteur à l’entrée et un autre à la sortie de l’UPS permettent d’isoler les pertes de conversion et de connaître sa charge. Le comptage des PDU de rack sert à répartir la capacité, repérer un déséquilibre de phases et vérifier si de nouveaux équipements peuvent être ajoutés. Des départs séparés pour le refroidissement distinguent immédiatement l’énergie IT de celle des auxiliaires.

Pour un équipement IT à double alimentation, la somme des mesures A et B sur le même périmètre et la même période donne sa consommation. Un compteur amont inclut déjà les compteurs aval ; additionner les deux niveaux compte l’énergie deux fois. Si les mesures servent à la facturation, la classe de précision, la vérification et les règles de décompte doivent faire l’objet d’un accord distinct.

La liste des points de supervision couvre généralement courant par phase, puissance, énergie, facteur de puissance, position des appareils, mode réseau, batterie ou bypass de l’UPS et autonomie restante. En cas de perte d’une voie, l’exploitant doit voir sur le même écran l’événement et la hausse de charge sur l’autre voie pour décider d’un éventuel délestage. Période d’échantillonnage, horodatage des événements et rattrapage après une coupure de communication se définissent selon les besoins d’alarme et d’analyse.

Tester le transfert, la maintenance et le retour à la normale

Le plan de réception doit énumérer les états à tester : charge normale, perte de A, perte de B, fonctionnement sur batterie, bypass de maintenance et rétablissement de l’alimentation. Pour chacun, il précise la charge initiale, le point de coupure, la séquence attendue, l’interruption ou le délestage admissible, ainsi que les tensions, courants, alarmes et états applicatifs à enregistrer.

L’expression « couper la voie A » recouvre deux essais différents. Couper l’entrée de l’UPS le fait passer sur batterie et laisse l’entrée serveur correspondante sous tension : on teste la batterie. Couper la sortie de l’UPS ou le départ de baie retire réellement une voie au serveur : on vérifie alors si l’autre supporte toute la charge.

Les chemins électriques, les capacités, les commandes et le comptage peuvent être testés en usine avec des charges simulées. La baisse de fréquence des serveurs, la reconnexion du réseau et la continuité des applications ne se vérifient qu’une fois les équipements réels raccordés sur site. La coordination des protections se confirme par l’étude, complétée par les essais correspondants.

Traduire l’architecture dans l’E-House

Dans l’E-House, ces exigences deviennent un plan d’implantation des armoires, des canalisations et câbles, des batteries, du refroidissement et des dégagements de maintenance. Selon le partage de responsabilités du projet, ETENZ peut assurer la fabrication de l’enveloppe et l’intégration des équipements électriques, de la gestion thermique et de la supervision, avec interfaces préfabriquées, assemblage en usine ou livraison du module équipé. Les projets OEM/ODM sont également pris en charge.

Pour consulter les fournisseurs, le schéma unifilaire doit aller jusqu’aux entrées des serveurs. Le bilan de puissance précise la répartition des alimentations et le comportement après la perte d’une voie ; le bilan des charges secourues inclut le refroidissement ; le plan de réception détaille chaque état à tester ; les caractéristiques de l’alimentation disponible sont jointes. Les fournisseurs peuvent alors représenter sur un même document les voies, les capacités et le périmètre secouru, ce qui permet de comparer des offres portant réellement sur la même architecture. Les données relatives à l’alimentation des DGX H100/H200 citées ici proviennent de la section consacrée à l’alimentation du « NVIDIA DGX H100/H200 User Guide » et du chapitre électrique de « DGX SuperPOD: Data Center Design Featuring NVIDIA DGX H100 Systems ».

Étiquettes

alimentation data center IAalimentation redondante A/BUPS data centerPDU de rackdistribution électrique data center

Partager l'article

Merci de partager le contenu ETENZ