一台 GPU 智算服务器的功耗相当于 30 台普通 PC,传统风冷机房的空调已经”吹不动”了——单柜功率超过 1520kW 后,风冷换热效率触及天花板,PUE 停在 1.41.6 下不来。液冷技术(冷板式贴芯片、浸没式整机泡入、喷淋式淋洒)用液体直接带走热量,能把 PUE 压到 1.1 附近。它常作为 微模块机房 的高密选配,并由 动环监控 统一看护。

一、为什么风冷不够用了
CPU/GPU 功耗随算力指数上升,单机柜从传统 48kW 提升到 2050kW 甚至更高。风冷靠空气换热,比热容小、风机耗电大,高密下要么吹不动、要么 PUE 飙升。液冷的比热容约为空气的上千倍,是本质上的效率跃迁。
二、三类液冷路线
- 冷板式液冷: chips 贴合冷板,冷却液在板内循环,不改服务器整体形态,改造兼容性好,是当前部署最主流的过渡方案。
- 浸没式液冷:服务器整机浸入绝缘冷却液中,热量被液体直接吸收,换热效率最高、PUE 最低、噪音近乎为零,适合超高密智算。
- 喷淋式液冷:冷却液喷淋到发热元件,结构介于两者之间,布液均匀性要求高。
三、液冷带来的收益
- PUE 显著下降:典型从 1.4+ 降到 1.1x,年电费可观。
- 高密部署:同面积塞进更多算力,省机房空间。
- 安静可靠:去大风机,噪音与故障点减少。
- 余热可回收:冷却液温度高,便于接入 园区能源管理 做余热利用。
四、落地要点与坑
- 漏液风险:管路、接头、密封是生命线,要有漏液检测与自动关断。
- 兼容与改造:冷板式对服务器有改造成本;浸没式需专用机箱与液体,旧设备利旧难。
- 运维能力:液冷运维与传统风冷不同,团队要培训,纳入 动环监控与预警。
- Tier 与可靠性:高密机房更要对照 数据中心 Tier 标准 做冗余设计。
五、适用场景
- 智算/AI 中心:GPU 集群必选液冷。
- 金融/科研高密机房:单位面积算力需求高。
- 园区 微模块机房 扩容:高密模块直接上冷板式,平滑演进到浸没式。
常见问题
Q:液冷会漏液泡坏服务器吗? A:合规液冷用绝缘冷却液(浸没式)或密封管路(冷板式),并配漏液检测+自动关断;风险主要来自施工与接头质量,选成熟方案与规范施工可将风险压到极低。
Q:PUE 1.1 是真实可达成吗?
A:浸没式在理想工况下可接近 1.051.15,冷板式通常 1.151.25;实际取决于室外气候、冷却塔/干冷器效率与负载率,需结合 微模块设计 整体优化。
Q:老机房能改液冷吗? A:可局部改造:先用冷板式液冷改造高密机柜,保留其余风冷;全浸没式则需专用机柜与液体循环系统,旧设备利旧性差,更适合新建高密区。
Q:液冷和微模块怎么配合? A:液冷常作为 微模块机房 的高密选配,冷源(CDU)与机柜一体化预集成,配合 动环监控 做温度云图与漏液告警,交付更快。
在我司参与设计的某 AI 智算中心项目中,单机柜设计功率 25kW(GPU 集群),传统风冷完全无法满足。我们最终选了冷板式液冷方案,PUE 稳定在 1.18。项目中最关键的决策是”漏液检测”——我们在每台 CDU 出口和机柜底部都加了双重传感器,确保任何泄漏能在 10 秒内被发现并触发自动切断。这个安全冗余后来在一次接头松动事件中发挥了作用。