
液冷算力舱询价前,先定清这六类接口
液冷算力舱接口定得越早,报价越容易比较,现场接管和联调也越顺畅。从服务器机型出发,逐项确认CDU分工、供冷条件、流量压差、水质定压和失冷联动。
算力舱供电架构要经得起一路失电和设备检修。从服务器电源怎么接讲起,说清A/B两路各配多大、UPS和电池放在哪里、机柜PDU按什么电流选、计量点设在哪一级。

同样接了两路电,停掉一路以后,有的服务器照常满载,有的只能降功率运行,甚至停机。机型属于哪一种,每路配电配多大、UPS怎么配、一路失电时还剩多少算力,都跟着变。
供电方案一般从单线图画起。算力舱的单线图要一直画到服务器的电源输入端,再和失电后的运行要求对上:哪些任务继续跑,哪些可以降载,哪些保存好状态就能停。这几条在询价前定下来,单路、A/B双路和几种UPS配法才比得出哪种合适。
以NVIDIA DGX H100/H200为例,六个电源模块按4+2冗余,至少四个带电才能正常运行。A、B两路各接三个时,失去一路只剩三个,系统会降性能运行,甚至停机。NVIDIA为DGX SuperPOD编写的数据中心设计指南因此认为,传统的A/B双路只够管理机柜用;对可用性要求高、任务又无法从检查点恢复的场合,每个机柜至少接三路独立电源,每台服务器的六个电源模块每路接两个,这样任何一路失电或检修,仍有四个模块带电。
电源怎么分组,决定了要几路供电,也决定了每路配多大。所以计算、存储、网络设备最好在第一轮就列进同一张负荷清单,每台写明输入电压、插头规格、电源模块数量和冗余方式、打算怎样分组接线,以及少一路电以后是照常运行、降功率还是停机。
只有一个电源的设备要从两路取电,得经过机架转换开关,它的切换时间必须短于设备能承受的断电时间。两个电源的设备按厂家要求分别接到A、B两路的机柜PDU(机柜里的电源分配单元)上;两根线插在同一路PDU上,看着是双电源,其实只有一路。
哪些负荷必须一直有电,要看业务:训练任务能不能从检查点恢复,推理服务能不能切到别的节点,存储和管理网络要撑多久。这几件事由业务和IT团队定下来,配电设计再据此划出持续供电的范围。
单路配电检修要停电,路径上任何一处故障也会停电,适合停得起的负荷,或者业务能交给其他节点接管的场合。A/B双路要从机柜往上逐级追两条路径,一直追到各自的上级电源、配电母线和保护器件。两路如果最后汇到同一台UPS或同一段母线上,这台设备一出问题,两路会一起断,单线图上要把这种共用点单独标出来。
容量按失去一路以后的状态算。假设一组IT设备需要100 kW,电源支持平时两路均分、一路失电后由另一路带满。平时A、B各带约50 kW,A路一断,B路就要带100 kW。两路各有70 kW可用,平时绰绰有余,到了只剩B路的时候就不够了。
这笔账沿着剩下那一路逐级算:UPS输出、配电支路、母线槽或电缆、机柜PDU、插座,一直到服务器电源输入。哪一级最小,整条路就只能按它算。裕量还得算上环境降额、扩容和负荷波动。拿前面的例子说,两路铭牌合计140 kW,按失去一路还要带满来算,这套配电最多只能带70 kW的IT负荷。

项目如果接受一路失电后降载,负荷表里写明降到多少、多久降到位、靠什么控制。从一路失电到降载完成有一段时间,这段时间里,剩下那一路和它的保护器件带的仍是满负荷。
设备如果像前面的DGX那样能分三路接、每路接两个电源模块,每一路要配的容量会小得多。同样100 kW,平时三路各带约33 kW,失去一路后剩下两路各带50 kW,每路按50 kW配置即可,三路合计150 kW;两路互为备用时每路要配100 kW,合计200 kW。三路方案省下的是每一路的容量,多出的是第三套配电路径和接线。
单路加UPS,能在电池撑得住的时间内扛过上游停电,但UPS后面仍然只有一条配电路径。A路带UPS、B路直接接市电时,市电一停,负荷全压到A路上。A路的容量、服务器只靠一路时还剩多少电源能力、A路电池能撑多久,都按这个时刻算。
A、B两路各配一套UPS,两条路径各有后备。检修时要看旁路、隔离开关和电池到底怎么连:旁路从哪里取电,检修期间哪些部分失去保护,剩下那条路径还能带多少。UPS转到检修旁路以后,负荷由市电直接供电,仍然有电,只是这台UPS的电池已经护不住它了。
报价里写“N+1”,常见的是一台模块化UPS里多装一个功率模块:坏一个模块,输出照常;输出母线、旁路和下游支路有没有备用,是另一回事。同样写着N+1,备用的是哪个部件、检修或故障时还剩多少容量,可能差得很远。
UPS和电池可以装在算力舱里,也可以集中到单独的电力舱;有的项目直接接场地现有的UPS系统,舱内只做配电。装在算力舱里,UPS、电池和配电柜会占掉一部分机位,发热也算在舱内散热里;集中到电力舱,算力舱能多放机柜,A、B两路从电力舱分别用电缆或母线接过来,两个舱的接口和走线在图纸上一一对应。电池放在哪里,还关系到通风、检修通道和消防分区。
服务器靠UPS继续运行,热量也在继续产生,所以液冷算力舱的后备供电负荷表里,CDU循环泵、控制器、关键网络设备和必要的空气冷却设备要和IT负荷列在一起。室外冷源要不要同期保电,看允许温升、可用的蓄冷和业务有序停机要多长时间。只给控制器接了UPS,停电时控制器还在报警,循环泵已经停了。
电池能撑多久,离不开负载条件。同样写着“后备10分钟”,按多少kW算、覆盖哪些设备、电池在什么温度、按新电池还是寿命末期的容量、放到什么电压为止,结果会差很多。供应商按这些条件给出对应配置的放电数据。电池若是用来等发电机,启动、切换、带上负载的时间都得算在里面。
选机柜PDU,插口够不够只是一项。输入是单相还是三相、额定电流多大、每组插座怎么保护、插座和电源线的额定值,都要跟服务器的接法对上。询价清单里,机柜PDU和上游配电柜分开列。
用一组简化数据看电流。一柜IT设备的交流输入功率60 kW,按400 V三相平衡、功率因数0.95计算,线电流I=P÷(√3×U×功率因数),约91 A。A、B两路平时均分,每路约46 A;要求失去一路后仍带满60 kW,剩下那一路就要通过约91 A。两路各配一个63 A输入的PDU,平时够用,断掉一路就超出额定电流。
实际选型时,三相里最重的那一相、每组插座的支路电流、线缆的敷设条件和设备降额都要算进去;总kW看着有余量,某一相或某组插座仍可能先到上限。连续负载能用到额定值的多少,各地规范和器件条件不一样,按项目适用的要求确定。
GPU负载随训练任务起伏,功率可能在很短时间里大幅变化。选型资料里给出变化幅度、持续时间和上电过程,UPS的动态响应和保护配合有了校核依据;月度电量和分钟平均功率里看不出这些短时变化。
舱进线的电表看整个模块用了多少电;UPS输入和输出各装一块,差值就是转换损耗,输出侧也看得出UPS带着多少负载;机柜PDU的计量用来分配容量、发现三相不平衡、判断还能不能加设备。冷却设备单独走回路,IT和辅助设备各用了多少电,一看就分得开。
双路输入的IT设备,A、B两路的读数按同一个测量边界、同一段时间相加,就是它的用电量。上级电表的读数已经包含了下级,两级再加一次就重复算了。读数要拿来结算电费的话,计量精度、校验和结算方式另外约定。
监控点表一般列出每相电流、功率、电量、功率因数、开关状态,以及UPS处在市电、电池还是旁路状态、电池还剩多少。一路失电时,运维人员在同一个画面上看到失电事件和另一路负荷往上跳,才判断得了要不要降载。采样周期、事件时间戳、通信中断后怎么补记,按报警和事后分析的需要来定。
验收方案按工况列:正常带载、A路失电、B路失电、UPS后备、检修旁路、恢复供电。每一项写明起始负载、断在哪里、预期怎么动作、允许中断或降载到什么程度,以及要记下的电压、电流、告警和业务状态。
“断A路”断在哪里,试出来的是两回事。断UPS输入,UPS转电池,服务器那一路照样有电,验的是电池;断UPS输出或机柜支路,服务器才真正少了一路,验的是另一路扛不扛得住全部负荷。
配电路径、容量、控制和计量,在工厂用模拟负载就能试;服务器会不会降频、网络会不会重连、业务会不会中断,只有到现场接上实际设备才看得到。保护之间的配合,靠设计校核加上相应的试验来确认。
前面这些要求到了舱里,就是柜体怎么排、母线和电缆怎么走、电池放在哪里、怎么散热、检修空间留多少。伊田机电可按项目分工承接舱体制造,以及电气、热管理、监控等配套集成,提供接口预制、工厂装配或成舱交付,也支持OEM/ODM合作。
询价时,单线图画到服务器的电源输入端,负荷清单写明每台设备的电源怎么分组、少一路电以后怎么动作,后备供电负荷表把冷却设备列进去,验收方案按工况逐项写好,再附上现有的电源条件。供应商据此把供电路径、容量和后备范围画在同一张图上,几家报价是不是同一套东西,一对就看得出来。文中DGX H100/H200的电源说明,出自NVIDIA《DGX H100/H200 User Guide》的电源规格部分,以及《DGX SuperPOD: Data Center Design Featuring NVIDIA DGX H100 Systems》的电气规格一章。
感谢您分享伊田机电的精彩内容

液冷算力舱接口定得越早,报价越容易比较,现场接管和联调也越顺畅。从服务器机型出发,逐项确认CDU分工、供冷条件、流量压差、水质定压和失冷联动。

AI数据中心基础设施的供电、冷却和空间布置,需要围绕同一套服务器配置一起规划。从机柜功率到液冷排热、舱内布局与工厂预制,梳理项目初期该先确认的工程输入。

预制舱外壳定制的防腐要求,必须从一个等级转化为环境、基材、涂层、检验和修补方案。伊田机电把关键输入前置,让防腐真正可报价、可制造、可验收。

液冷算力舱接口定得越早,报价越容易比较,现场接管和联调也越顺畅。从服务器机型出发,逐项确认CDU分工、供冷条件、流量压差、水质定压和失冷联动。

AI数据中心基础设施的供电、冷却和空间布置,需要围绕同一套服务器配置一起规划。从机柜功率到液冷排热、舱内布局与工厂预制,梳理项目初期该先确认的工程输入。

预制舱外壳定制的防腐要求,必须从一个等级转化为环境、基材、涂层、检验和修补方案。伊田机电把关键输入前置,让防腐真正可报价、可制造、可验收。