腾讯云液冷方案降低能耗:规模化落地实践解析
当一座中型数据中心每年电费超过千万元,PUE 值却徘徊在 1.5 附近时,液冷就不再只是超算中心的专利。腾讯云液冷方案降低能耗的规模化落地,正将这一技术推向通用算力场景。从冷板到浸没,一场围绕热管理的架构变革已经展开。
一、液冷技术:破解数据中心高能耗的钥匙
1. 液冷是什么
液冷是用液体(去离子水、氟化液等)替代空气作为传热介质,把服务器热量带出机柜的散热方式。行业里分三种路线:冷板式在芯片上方覆盖水冷板,液体不与电路接触;浸没式把整台服务器泡进绝缘液里;喷淋式则向发热器件精确喷洒冷却液。当前已部署的液冷方案中,冷板式占比超过 90%,它不需要改动主板形态,改造成本最低,也是腾讯云规模化落地的主力技术路径。这意味着一座机房引入液冷,并非推翻重来,而是在关键高密度节点上换一种热交换逻辑。
2. 液冷与风冷对比
传统风冷 PUE 常年在 1.4—1.6 之间,单机柜散热极限大约 15kW,面对一台 8 卡 GPU 服务器动辄 6kW 以上的功耗,风冷很容易逼出局部热点和芯片降频。冷板式液冷可以把 PUE 拉到 1.1—1.2,浸没式甚至做到 1.05 以下,而且单柜功率密度轻松突破 30kW,高端方案能冲到 100kW。这不是纸面差距——GPU 服务器在高温下主动降频会让算力折损 5%—10%,用液冷压住温度,等于是把被阉割的算力捡回来。风液混合也不会让风冷立刻退场,液冷专攻高密度计算节点,风冷继续应付低功耗设备和辅助散热,两者互补才是当前最经济的部署策略。
3. 液冷应用场景
液冷最先被推到前台的是 GPU 训练集群和推理集群,这些场景单柜功耗高、对算力稳定性极度敏感,液冷几乎成了标配。腾讯云在 AI 算力平台的实践中把冷板液冷与整机柜交付绑定,让液冷节点像标准机柜一样快插即用。另一个容易被忽视的场景是存量高密度改造——不少一线城市的机房受制于 PUE 不高于 1.3 甚至 1.15 的硬约束,靠风冷优化已经触及天花板,引入机柜级液冷 CDU(冷量分配单元)复用现有冷水系统,比拆机重建要现实得多。浸没式则更多出现在实验性超算和边缘恶劣环境,出水温度可达 50—60℃,余热回收直接折算成采暖或热水,这笔账在北方数据中心已经越算越清楚。
二、腾讯云液冷方案规模化落地详解
把服务器泡在液体里——这个画面在五年前还属于“技术炫技”,但当单台GPU服务器的功耗突破10kW、一个机柜轻松跑到40kW以上时,液冷已经从可选项变成了必选项。
腾讯云是国内最早一批将液冷方案规模化落地的云厂商。与实验阶段的单机箱测试不同,规模化落地解决的不只是“能不能冷下来”,而是如何在数万台服务器的集群中,把液冷做成一门经济账算得过来、运维体系接得住、业务负载无感知的工程。
1. 方案架构:风液混合仍然是当前最优解
在腾讯云的液冷架构设计中,几乎没有看到“全液冷”的激进路线。实际部署采用的是冷板式液冷为主、风冷为辅的混合架构——这也是当前超大规模数据中心最务实的选型逻辑。
架构分三层来看:底层是直接贴合在cpu/GPU上方的冷板模块,通过微通道将芯片热量传导至去离子水回路;中间层是机柜级CDU(冷量分配单元),负责二次侧液体的流量分配与温度控制;顶层接入园区冷冻水系统,通过板式换热器与外部冷却塔完成热量交换。
这里有个被外界忽视的细节:冷板液冷并没有完全消灭风扇。腾讯云的液冷服务器仍保留了低速风扇用于内存、硬盘、网络卡等非核心元件的辅助散热。看起来保守,但恰恰是这种“不清零”的设计,让液冷方案可以在不改造现有主板布局、不完全推翻供应链的前提下快速铺开。
从实际运行数据看,这种架构将典型机柜的PUE从1.4-1.5压到了1.15以下,单柜功率密度可以支撑到30kW以上——是传统风冷方案的两到三倍。意味着同一个机房面积,算力部署密度能翻倍。
另一条值得关注的线是浸没式液冷。腾讯云在高性能计算和部分GPU训练集群中测试了单相浸没方案,电子氟化液完全浸润服务器,PUE低至1.05附近。但浸没式的规模推开速度明显慢于冷板式,核心原因不在技术,而在成本——氟化液单价高、运维操作需要专用吊装设备、旧机房承重改造费用不菲。腾讯云的策略是“冷板保当下规模,浸没赌未来密度”,两者并非替代关系。
2. 核心技术解密:把水送进服务器,门道在接头和管路上
对没接触过液冷的人来说,最大的心理障碍是“水进机柜”这件事。实际工程中,冷板液冷最考验能力的不是制冷原理,而是流体控制、材料兼容性和漏液检测。
腾讯云的液冷回路采用的是双盲插快接头设计。服务器冷板与机柜歧管之间通过无滴漏快接头连接,支持不断液情况下的热插拔——运维人员可以像换普通服务器一样直接抽拉节点,冷却液自动截止,泄漏量控制在0.5毫升以内,基本等同于“手摸一下的潮湿度”。
管路材料方面,腾讯云选用了EPDM三元乙丙橡胶软管与不锈钢硬管组合,内部循环的介质是经过去离子处理的纯水,添加缓蚀剂与抑菌剂后电导率控制在极低水平。这步看似细节,但实际是多数液冷事故的源头:如果水质控制不严,管路结垢、微生物滋生、接头腐蚀,三年后就可能从“节能方案”变成“漏水灾难”。
另一个关键技术节点是CDU的冗余设计。腾讯云在CDU内部配置了双泵头、双电源和自动旁通回路,单台CDU故障时可在30秒内切换至备用单元,冷却液持续流动不中断。这与早期一些厂商做的串联管路不同——串联方案故障时影响整排机柜,而腾讯云的分布式CDU部署做到了单柜级隔离。
漏液检测方面采用了管线压力监测加机柜底部积液绳的双重感知,一旦检测到液路压力异常跌落或底部导电率突变,系统会在毫秒级时间内触发断电保护并关闭该路阀门,把影响半径控制在单柜内。这套逻辑已经在其多个智算集群中跑通,目前对外展示的事故率数据是“零液冷相关漏液宕机”。
实操层面最关键的一条经验是:液冷不是买硬件,而是买“管路设计与水处理”的集成能力。 很多项目的翻车,不是因为冷板质量不行,而是管路口径算错了、水质没控好、接头插拔次数超标没人监控。腾讯云在规模化部署中,把这部分工程化能力封装成了标准化交付流程——出厂前预装歧管和管路,现场“盲插对接、进水通电即用”——本质上把液冷从“工程项目”变成了“产品化交付”。这也解释了为什么其液冷方案能在短短两年内从试点做到万台级规模。
三、服务器能耗降低:真实数据与案例
液冷之所以从“可选”进入“必选”,关键在于能耗账单的跌幅不再是小修小补,而是直接改变了数据中心成本结构。过去几年,多数机房PUE停留在1.4以上,意味着每消耗1度电用于计算,就有0.4度电被散热、配电损耗等吃掉。冷板液冷方案规模化落地后,PUE天花板被整体下压,节能数字也开始变得具体且可复制。
1. PUE优化与泛在节能数据
冷板液冷在腾讯云常规高密度部署中已稳定将PUE压至1.15以下,浸没型方案更可逼近1.05。对比传统风冷1.4–1.6的中位水平,这意味着同等算力下,制冷环节的电耗被砍掉近三分之二。以一座中型1000个机柜的数据中心测算,PUE从1.5降至1.15,每年可节省约4500万千瓦时电量,相当于减少约2.6万吨碳排放——这不仅直接降低了占总运营成本60%以上的电费支出,还让一二线城市日益严苛的能评、限电红线有了达标的数字凭据。
更关键的隐性收益是“拆天花板”。风冷机柜常见15kW/柜的散热极限,直接限制了GPU集群的堆叠密度,一旦单柜功率超过25kW,风扇满转下的声浪和故障率就急剧上升。液冷将单柜热设计能力推到30kW甚至更高后,同样的业务负载只需更少机柜,间接降低了机房面积、布线、运维等一系列边际开支。从实际抽样看,采用冷板液冷的计算集群,单柜功率密度平均提升2.1–2.5倍,而由此释放出的算力密度,让万台以上的GPU训练任务不再被制冷瓶颈打断。
2. 客户现场:从热点焦虑到算力满载
液冷降能耗的价值不只在电费表上,更在业务连续性。腾讯云在华南某大型游戏客户的实时渲染集群上,通过机柜级冷板液冷方案替换原纯风冷,解了长期存在的局部热点问题。此前,该客户GPU节点因进风口温度过高,频繁触发芯片降频保护,实测算力损失约7%,游戏高峰期波动加剧。改造后,节点全速运行时芯片壳温稳定在66℃左右(此前风冷环境下可达88℃),PUE从1.45降至1.12,单机柜功率由14kW提升至30kW。换算到业务侧,就是同规模渲染任务排队时间缩窄了约18%,且无须为晚间高峰额外申请购电配额。
另一个案例是某头部短视频平台的内容理解集群,其推理服务器采用腾讯云液冷整机柜交付后,从进集、接水路到点亮仅耗时3天,大幅缩短部署窗口。电费账单方面更为直观:改造前单台服务器年电费约1.3万元,液冷替代后下降至约0.85万元,年降幅超过34%。而这类客户之所以愿意迈出第一步,正是因为液冷带来的能耗控制不再是“实验室数据”,而是可直接对照电表、运维系统实时验证的运营指标。
四、液冷规模化面临的挑战
如果仅看能效指标,液冷替代风冷似乎是毫无争议的单一选项,但现实中的规模化落地始终在多个维度上拉锯。技术路线之争、基础设施建设惯性与运维能力的短板,让数据中心从“想用”到“好用”之间还有很长一段路。
1. 成本与回报的账本仍不透明
谈论液冷时,行业很容易陷入一个陷阱:用冷板式液冷的初始建设成本(CapEx)去对比成熟风冷方案的运营成本(OpEx),得出一个模糊的“液冷更贵”或“液冷更省”的结论。实际上,两者的成本结构完全不同。冷板液冷需要额外投入CDU(冷量分配单元)、管路、歧管等设施,单机柜CapEx通常比同等风冷配置高出20%-30%。但同时,液冷可以将PUE从1.4以上压至1.15以下,并允许单柜功率密度提升到30kW甚至更高,在寸土寸金的一线城市机房,这意味着同样的物理空间能承载更多算力,单位算力的土地和空间成本被摊薄。
真正的难题不在于绝对成本孰高孰低,而在于缺乏一套标准化的TCO(总拥有成本)核算模型。电费节省、算力密度提升带来的业务上架率提升、芯片因散热改善而减少的降频损失(通常可挽回5%-10%的有效算力),这些收益很难在采购立项阶段被精确量化。对于多数中小规模数据中心用户,他们看到的是需要一次性多掏两三成的硬件账单,而无法预判三年后能否收回这笔差价。这种信息不对称直接抑制了从“试点”到“规模部署”的决策速度。部分服务商推出了CDU租赁模式来降低启动资金门槛,但这只是缓解而非解决了评估难题——当企业无法自己算清这笔账时,往往会倾向于继续沿用熟悉的风冷方案,哪怕它的总体拥有成本更高。
2. 基础设施改造的隐性门槛
液冷部署的另一重阻力在于,它并不是即插即用的孤立设备,而是一整套对现有基础设施的“外科手术式”改造。很多人以为只要把液冷机柜搬进数据中心接上水管就行,现实往往是,老旧机房的承重、管网和配电系统从一开始就没为液冷考虑过。
首先是承重。单机柜装满服务器时本就接近1吨,液冷管路和冷却液还会再增加20%-30%的静载荷,单柜浸没式方案甚至可能突破1.5吨。许多在2015年前建成的多层数据中心楼面设计荷载仅为8-12kN/m²,意味着放置液冷机柜需要额外做承重加固或限制部署区域,这直接推高了改造成本和工程周期。其次是水路改造。采用冷板式液冷虽然可以利用现有的冷冻水管网,但液冷CDU要求供回水温度、水质洁净度、水压等参数远比传统精密空调末端严苛。存量机房普遍存在管路腐蚀、水质含氧量超标等问题,直接接入液冷系统可能导致冷板微通道堵塞,反过来影响散热效率甚至损坏设备。这意味着要确保液冷运行稳定,往往需要加装二次水处理设备和闭式循环隔离,又是一笔额外投入。
另外,配电系统同样面临考验。液冷消除了风扇的大量功耗,单柜IT功耗反而会顺势提升到30kW、50kW甚至更高,这要求机房的配电母排、UPS容量、列头柜分路都必须升级。一套冷板液冷方案的改造,表面上解决的是散热问题,背后牵扯的却是建筑结构、暖通和电气三个专业的联动改造。这种深度耦合,决定了液冷很难像服务器更新换代那样快速铺开,而只能走“先选择少数条件合适的机房做标杆,再逐步扩展到其他节点”的漫长路径。
3. 散热与维护的可靠性挑战
液冷在可靠性上的争议,核心矛盾集中于漏液风险和运维技能断层。尽管冷板液冷在设计中采用去离子水等非导电介质,并配备了漏液检测绳和自动关断阀,可以在泄漏发生的几秒内切断该支路,但从心理安全层面,运维人员对“液体进入数据中心”的抵触远大于对风扇噪音和热风的容忍度。这种心理门槛会转化为运维动作上的迟疑与保守,比如在巡检中因担心碰到快接头而不愿做常规的管道紧固检查,反而降低了系统安全性。
更被低估的问题是运维能力的断层。传统数据中心暖通工程师熟悉的设备是冷水机组、精密空调和湿度控制,而液冷系统引入了板式换热器、CDU、冷板微通道等新组件,故障诊断逻辑完全不同。比如单机柜散热效率突然下降,可能是微通道局部堵塞、歧管进气或二次侧循环泵压力异常等,这些都需要新的诊断技能和经验积累。但目前行业内掌握液冷运维的资深工程师严重短缺,多数操作人员只经过厂商的短期培训,面对复杂异常时依然高度依赖原厂技术支持。这意味着液冷方案在实现“去厂商化”运维之前,规模化复制会持续受到限制——机房不敢在缺乏自维护能力的偏远节点部署液冷。
此外,风液混合带来的管理复杂度也在上升。现实部署中,极少有机房做到100%液冷,风冷散热通常仍需保留以应对低负载和辅助设备散热。这种混合模式需要同时维护两套独立的散热系统,整体设施运维复杂度不是简单的加法,而可能带来1+1>2的管理负担。如果不能将液冷、风冷的监控数据统一汇入DCIM(数据中心基础设施管理)平台并实现联动控制,运维团队很可能会发现,节省下来的风扇功耗,又被增加的人力成本和应急响应压力抵消了。
五、腾讯云的创新举措与解决方案
云厂商推动液冷落地,不仅要解决技术问题,更要让方案在成本、交付和运维上具备可复制性。腾讯云的做法,本质是用“产品化”思路把液冷从定制实验变成标准化基础设施。
1. 模块化液冷设计:让部署像组装乐高
最早在自研服务器上验证冷板液冷的互联网厂商之一,就是腾讯云。它的液冷方案从一开始就回避了“每台服务器单独改水”的碎片化路线,转而采用冷板式液冷整机柜交付。机柜出厂时歧管、盲插快接头和漏液检测带全部预装,现场只需要对接二次侧冷却水管即可上线,单柜功率密度可以轻松做到 30 kW 以上,实测 PUE 压至 1.15 以内。这种模块化思路还延伸到了数据中心建筑层面——T‑block 预制化方案将液冷散热单元、配电和 IT 设备封装在标准集装箱模块中,显著缩短了从土建到业务上架的周期。对于既有机房改造,腾讯云也提供机柜级 CDU 插拔式部署,利用原有冷水系统实现“先局部液冷、再逐步扩面”的平滑演进,降低了改造过程对在线业务的扰动。
2. 智能节能策略:从恒定冷量转向按需供冷
传统制冷系统习惯于设定一个保守的出水温度,让冷量“永裕”供应,后果是大量冷量被浪费在非高峰时段。腾讯云将自研的“智维”平台与液冷管路控制逻辑打通,利用历史负载数据和实时芯片功耗监测,动态调节一次侧和二次侧的供水温度、流量和泵频。在负载低谷期,系统会自动提高冷板进水温度(例如从 32℃ 提升至 38℃),让一部分热负荷转由冷却塔自然冷却承担,从而进一步压缩制冷能耗。经过多个大规模集群的实测,这种 AI 调优可使液冷系统的年综合能效再提升约 8%–12%。此外,由于液冷出水温度可达 50℃ 以上,腾讯云在部分园区已试点将废热接入邻近的配套供暖系统,把 PUE 计算之外的“能源再利用效率(ERE)”也纳入整体运营指标,追求数据中心从电力消费者向能源中转站的转变。
3. 开放生态合作:不做“独家”方案,推动行业对齐
液冷长期受困于接口不统一、服务器与冷却设备强绑定。腾讯云在 ODCC(开放数据中心委员会)牵头发布液冷整机柜技术规范时明确主张:冷板接头、歧管尺寸、二次侧水质要求必须开放,且与主流服务器 OEM 厂商对齐。目前,基于这一规范的液冷整机柜已支持同时插载不同品牌的计算节点,用户不必陷入“买了 A 家液冷方案就必须用 A 家服务器”的锁定困局。在产业链上游,腾讯云与冷却设备厂商联合研发了氟化液泄露抑制涂层和快速自封接头,把单点泄漏风险降低了一个数量级;在下游,它把液冷整体方案拆分为“算力SaaS+基础设施服务”输出,让缺少液冷运维团队的企业也能用上高密度 GPU 集群。这种开放姿态,实质上是在降低整个行业采纳液冷的隐性门槛——对用户而言,选择液冷不再意味着承担高昂的兼容与迁移成本。
六、企业如何实践液冷节能改造
1. 可行性评估:不是所有机房都准备好了
液冷改造的第一道坎,往往不是技术,而是对现状的误判。很多运维团队下意识认为“我们的负载还没有高到需要液冷”,但实测数据经常打脸。先做一轮热成像扫描和真实 PUE 审计,常会发现几个被忽略的事实:机柜功率超过 8kW 之后,风冷的不均匀性会迅速放大,局部热点导致的芯片降频已经在悄无声息地吃掉 5%~10% 的可用算力;而电费占运维成本 60% 以上,PUE 长期徘徊在 1.4 甚至更高,意味着每花一块钱在算力上,就有四毛钱被制冷带走。这两个信号一旦同时出现,液冷的可行性前提就基本成立。
接下来是约束条件。一线城市对新增和存量数据中心的 PUE 红线已压到 1.3 以下,部分区域甚至要求 1.15,这等于给风冷方案判了缓刑。如果你的机房位于这些区域,而且 IT 负载中 GPU 训练、推理、高性能数据库这类“热密度大户”占比在扩大,那么液冷改造就不止是节能选项,而是合规和业务连续性的必答题。需要避开的一个误区是:不必一步跳到浸没式。现阶段,改动最小、风险最可控的方式,是从风液混合的冷板式 CDU 起步,它不改变现有服务器主板形态,可沿用原冷水系统,单柜功率密度轻松突破 30kW,对存量机房来说,可行性远高于推倒重建。
2. 分步实施建议:从小切口到规模化
液冷改造的路径,最忌讳“一刀切”和“先买设备再看场景”。从过去多个规模化案例来看,节奏可以大致拆成三步:
第一步,以“热插拔”逻辑从高密度节点切入。 先筛选出单柜功率已经超过 12kW 的集群,在这些机柜上加装机柜级冷板液冷分配单元(CDU),形成“风液混合”区。这样既不用动冷水机组的大架构,又能快速消除热点,把局部的 PUE 从 1.5 以上拉到 1.2 以内。这阶段的核心价值不是极致节能,而是先把算力从降频和故障中解放出来,恢复那被浪费的 5%~10% 性能。
第二步,采用整机柜交付模式降低工程复杂度。 一旦验证了液冷在局部节点的收益,后续扩容就不要再自己拼装品牌各异的歧管、接头和管路了。选液冷整机柜产品,出厂已预装好歧管和盲插快接头,现场接水、通电即可上线,部署周期压缩到天级,且规避了不同厂商组件间的兼容性隐患。规模上量时,这种工程化思路比自建拼装省下的运维成本,往往比设备价差本身更可观。
第三步,与业务 TCO 挂钩的精细化选型。 当液冷区域扩大到一定规模,就不能只看能效比,而要切换到“每 TFLOPs 成本”和“业务上架率回报”来评估。短期跑推理任务、无需极致算力密度的场景,用冷板液冷就可以;而大规模 GPU 训练集群,浸没式液冷在单柜 50kW 甚至更高功率下的算力密度优势会拉开明显差距。两条技术路线不是互斥,而是并存于同一个机房的不同功能区,这才是真正务实的分步实施策略。
3. ROI 分析:三年回本是保守估计
关于投入回报,行业内一个常见的误读是“液冷太贵,小微企业玩不起”。但拆开看全生命周期成本,会有不同结论。初始 CapEx 方面,冷板液冷比同等风冷方案高约 20%~30%,主要体现在 CDU、管路和液冷机柜上。但这部分增量,在绝大多数案例中,通过三年左右的电费节约就能回收。以一座中型数据中心平均电费 0.8 元/度、PUE 从 1.5 降至 1.2 计算,每年节省的制冷电费往往在百万量级,即便不做理想化测算,ROI 周期也落在 2.5~3.5 年。
真正拉大回报差距的,是算力增益和机会成本。液冷消除了降频损失,相当于不增加硬件、不额外占用机柜空间,就能多出接近一成的有效算力。这对 GPU 集群来说,会直接转化为模型训练迭代周期的缩短和推理吞吐量的提升。如果把这部分机会收益量化进总账,ROI 周期可以压缩到两年以内。还有一条容易被忽视的路径:液冷出水温度通常在 50℃以上,可以直接对接供暖或生活热水系统,形成余热回收的附加收益。欧洲几家超算中心已经把这部分写进了碳减排报表,减少了总制冷支出,进一步拉低 TCO。
资金方面,液冷改造项目可以被包装为节能减碳项目,去对接绿色信贷、碳中和债以及地方节能技改补贴,实际可降低 20% 以上的净投入。部分设备商也提供 CDU 租赁模式,把前期投资压力分摊到运营周期。所以,液冷早已不是“大厂专属”的实验品,而是一个在合规压力、算力刚需和电价上涨三重叠加下,回本可期且路径清晰的长期账。
kf@jusoucn.com
4008-020-360


4008-020-360
