冷板式和浸没式液冷怎么选?沿散热路径比较改造条件
冷板和浸没式液冷如何把热量带出机房?比较介质接触、残余风冷、换热接口、硬件兼容和维护要求,核对能效结论的工况。
在冷板式与浸没式液冷之间做选择,核心在于权衡“服务器局部改造的兼容性”与“机房整体基础设施的重构深度”。如果目标是在现有标准机架和服务器架构上平滑过渡、尽量保留硬件原厂保修并控制维护习惯的变动,冷板式通常是改造成本相对可控的折中方案;若追求完全取消机箱内部风扇、接受服务器形态彻底定制与全套冷却基础设施重建,浸没式则提供了更直接的热接触路径。理解冷板式和浸没式液冷区别,需要从发热核心到室外大气的完整散热链条来客观审视。
沿散热路径看冷却机制:热量如何被转移?
评估液冷方案时,不能只看发热源处的温降,而应顺着热量的流动路径,逐级核对流体介质、物理边界与设备形态的改变。
1. 发热核心处的接触边界
- 冷板式液冷:金属冷板(通常内部加工有精密微通道)通过导热界面材料(TIM)紧贴CPU、GPU等高功耗芯片表面。流经冷板内部管路的冷却液体(使用按系统要求配置的水基或其他适配冷却液)吸收芯片传导出的热量。需要明确的是,冷板接触芯片的热路径并不等于水直接接触电子元件,冷却介质在密闭管路中流动,与板卡元器件保持物理隔离。同时,服务器内部未安装冷板的辅助发热件(如部分内存颗粒、供电模块VRM、接口芯片及电源模块),通常仍需要依靠机箱内的残余风冷提供气流散热。
- 浸没式液冷:服务器的主板、芯片和各类元器件整体直接浸泡在特制的绝缘介电液体(Dielectric Liquid)中。介电液体兼具绝缘性与流动换热能力,发热元件直接将热量传导给周围液体。依据流体形态,浸没式分为液体不发生相变的单相浸没,以及利用低沸点液体沸腾汽化吸热、再经冷凝器回流的双相浸没。由于整机浸泡,机箱内部的风扇通常完全移除。
2. 机柜内外的热量交换:CDU的物理边界
不论采用冷板还是浸没,服务器内部带走热量的流体通常属于“二次侧循环回路”,不能直接连接到建筑屋顶的开放式冷却塔中。常见方案通过**CDU(冷量分配单元)**等换热设备进行隔离,具体回路和设备集成方式取决于架构:
- 典型液-液CDU内含换热器、循环泵及监测控制部件,构成了机房内部微循环与大楼供水系统之间的分水岭。
- 二次侧(靠近服务器侧)对介质纯净度、抗腐蚀性与防漏要求较高;一次侧(建筑设施侧)则承接换热器传出的热量并送往室外。因此,机房内部署液冷时,应核对热量如何传至设施侧、由哪些设备控制;不应把独立CDU视为所有方案的必备形式。
Vertiv 的CDU说明还列出液-气换热形式,可将热量交给机房空气系统。因此不能将液冷一概理解为必须连接设施水管。
3. 室外排热:设施排热依然存在
采用液冷技术,只是改变了热量离开芯片表面的效率,但机房设施排热依然需要存在。在液-液换热架构中,二次侧热量传至设施侧后,最终仍需通过室外的干冷器、冷却塔或冷水机组排散到大气中。液冷并没有让热量凭空消失,室外冷源的设计与散热裕量依然是机房建设必须核算的环节。
核心区别与改造条件对照表
为了理清冷板式和浸没式液冷区别,下表从物理接触、工程改造及运营维护等关键维度进行对比:
| 比较维度 | 冷板式液冷 | 浸没式液冷 |
|---|---|---|
| 热接触方式 | 金属微通道冷板间接传导(密闭管路) | 绝缘介电液体直接浸泡接触 |
| 工质类型 | 经兼容性验证的冷却液(密闭) | 烃类油品、合成油或氟化液等介电液体 |
| 残余风冷需求 | 通常需要保留(处理供电、内存等辅热件) | 基本不需要机箱风扇 |
| 服务器兼容性 | 沿用标准机箱结构,加装冷板与快换接头 | 需移除风扇,定制机箱,重新布局接口 |
| 原厂保修与维保 | 需核对具体整机及冷却配置的保修条款 | 需核对具体设备、介质与浸没配置的保修支持 |
| 日常运维操作 | 沿用机架抽屉式抽拉,需定期排气与防漏巡检 | 按设备重量与结构配置取出工具,涉及沥液与防污染规程 |
| 机房结构荷载 | 机架承重与传统风冷相比增幅适中 | 槽体注满液体后自重较大,对楼板承重有要求 |
| 节能表现 | 可能降低部分风扇能耗,整机房效果需测量 | 需结合泵、设施排热和介质等评估 |
评估场景推演(假设示例)
以下为用于说明评估逻辑的假设性推演场景,非真实机房工程实测数据,各项参数仅作决策逻辑参考:
假设某计算中心计划升级一个既有的标准42U机柜动力区域,单机柜目标功率预计提升至35kW:
- 选择假设冷板路线:
- 改造动作:机柜保留原有立柱与导轨,背部加装垂直分配管路(Manifold);服务器节点更换为装配了微流道冷板的主板模块,保留部分内部风道与低转速风扇,处理周边元器件发热。机柜侧方或列间配置CDU。
- 权衡结果:改造主要集中在机柜内部与二次侧管网,机房原有的地板承重、通道布局改动较小。原厂硬件供货渠道相对稳定,但运维团队需增加流体压力检测与接头防泄漏检查的工作项。
- 选择假设浸没路线:
- 改造动作:拆除原有42U立式机柜,更换为卧式浸没储液槽;服务器节点拆除所有风扇并清洗表面残留杂质,重新评估电容密封胶、线缆外皮与介电液体的长期化学相容性;机房上方需规划吊装导轨以供节点取出维护,地面需核算满液状态下的单位面积荷载。
- 权衡结果:机箱风扇相关噪音与振动减少,芯片与环境温差利用更充分;但机房整体平面布局、起吊空间、介电液补液与防挥发损耗构成了新的维护成本,采购需转向已验证兼容的硬件与服务组合。
产业读者如何按步骤检查技术资料表
在阅读厂商方案或技术规范时,非专业背景读者可以按照以下四个步骤核对技术细节,避免被单纯的温度数据所误导:
- 第一步:核对换热介质与密封边界
检查资料中的“液冷”具体指代哪种介质。若是冷板式,确认微通道内循环液体是否密封、是否需要添加防腐阻垢剂;同时查阅机箱内部是否依然标注了风扇数量与风量要求,明确残余风冷的散热配比。 - 第二步:核实硬件兼容性与保修归属
确认服务器主板、内存和扩展卡是否属于原厂标准适配组件。如果是浸没式方案,核对光学模块、接插件及表面贴片元件是否有与该介电液体的长期浸润兼容性白名单,并确认第三方浸泡改造是否会影响整机供应商的原厂质保。 - 第三步:辨识CDU与设施侧的接口参数
查看方案是否完整包含了CDU换热模块。注意核对一次侧(设施侧)所需的供水温度区间。如果资料中宣称的换热效果依赖较低的一次侧水温,在夏季高温气候下可能仍需开启机械压缩制冷,需综合评估室外排热设备的基础负荷。 - 第四步:审视能效指标的前提条件
厂商常以PUE(电能利用效率)数值作为宣传重点。在核对时,需分清“制冷系统电耗降低”与“整体机房总能耗”的区别,明确该指标是在何种室外干球/湿球温度、何种负载率下测得,不将特定实验室工况下的极限值直接推算为日常全工况运行表现。
常见认知误区与决策边界
在实际方案论证中,容易出现几种片面看待液冷的倾向,需要建立清晰的边界认知:
- 误区一:改用液冷后便不再受风冷制约
对于冷板式液冷而言,绝大部分系统仍属于“气液混合”形态。虽然CPU、GPU等大功耗芯片的热量被液体带走,但主板上的其他元器件依然散发热量。如果机房完全取消空气调节或忽视机箱风道,辅助元件局部过热依然可能引发宕机。 - 误区二:采用液冷即可保证固定的节能比例
任何液冷方案都不能在所有场景下保证无条件的固定节能比例。液冷技术直接削减的是风扇运转功耗以及冷机在大温差制冷时的部分功耗,但IT设备本身计算所消耗的电能并未减少。此外,介电液体的挥发补充、循环泵功耗以及配套设施的折旧,都可能在不同负荷区间内改变整体运行经济性。 - 误区三:单向比较换热系数而忽略工程代价
浸没式扩大了液体接触范围,实际换热能力仍依赖介质、流动与表面条件,但在实际落地时,需要权衡机房承重改造、电气绝缘维护、流体挥发控制以及现场运维工具链的重建成本。
在参考行业一手资料(例如Vertiv高密制冷解决方案资料)时,应当将厂商给出的技术架构与自身机房的供电裕量、空间高度和运营生命周期结合起来分析,不把特定型号的技术说明泛化为适合所有场景的普适规律。
延伸阅读与参考
了解液冷系统在算力机房中的位置,需要将其置于完整的供应链与设备上下游中进行综合考量:
文中算例用于解释原理,具体参数请按引用资料与产品条件核对。发现问题,可将文章链接与依据发送至 support@packscena.com。
继续阅读产业指南
- DAC、AOC 和光模块怎么区分?按距离与维护方式读懂互联
DAC、AOC与独立光模块的区别不只在距离。比较铜与光、一体与分体形态,核对端口速率、分拆支持、兼容性及后期维护。
- PUE 怎么计算?为什么数字更低不一定总耗电更少
PUE等于总设施能耗除以IT设备能耗。用算例解释辅助用电比例、负荷率与计量边界,说明低PUE为什么不等于总耗电更少。
- Scale-up 和 Scale-out 有何不同?读懂 AI 集群的两层互联
在AI集群中,Scale-up与Scale-out承担不同通信任务。比较通信域、带宽口径和扩展开销,理解增加GPU为何不保证吞吐同比增长。