移至主內容

 🔍 深度壓力錶・溫度計・壓差計權威知識庫|HVAC・半導體・冷凍空調專家選型指南・完整技術資料・工業儀表監測教學平台 

台灣工業儀表領域少數長期深耕技術內容的平台,累積超過 2,400篇壓力錶、壓差計、溫度計選型、校正與製程應用深度文章,由資深工程師團隊持續更新

 
 

AI 資料中心浸没式液冷完整監測指南 — 冷卻液溫度、粘度、污染度監測與能源優化方案

摘要:浸没式液冷(沉浸冷卻)已成為 AI 資料中心的未來標準。本指南詳細解析浸没液冷的監測原理、30+ 監測點架構設計、冷卻液健康管理、預測維護策略,以及實際資料中心的能源優化案例。助力台灣 AI 芯片廠商、GPU 訓練中心、超級運算設施實現 PUE 1.2~1.5 的能效目標。

前言:為什麼浸没式液冷是 AI 資料中心的未來?

2024 年,全球 AI 芯片需求爆炸式成長。NVIDIA、AMD、Intel 的最新一代 GPU(H200、MI300、Gaudi 3)單卡功耗已達 400~700W,傳統風冷已經無法應對。這推動了浸没式液冷技術的快速普及。

浸没式液冷的核心優勢:

  • 散熱效率提升 5~10 倍:液體比空氣的熱容量大 3,500 倍,冷卻效率遠超風冷
  • PUE 從 2.2 降至 1.2~1.5:能源成本年度節省 30~50%
  • 機房密度提升 3~5 倍:同樣面積可部署 3~5 倍的 GPU,提高 CAPEX ROI
  • 芯片溫度穩定在 40~60℃:相比風冷的 70~90℃,延長芯片壽命 2~3 倍
  • 水費遠低於電費節省:全年冷卻成本反而降低 40%

但是,浸没式液冷也帶來了新的監測挑戰:

  • 冷卻液健康管理:液體會逐漸氧化、受污染、粘度漂移,需要持續監測
  • 複雜的多層流量系統:冷卻液經過「冷源 → 冷卻塔 → 分配機架 → 浸没箱 → 回流」的完整循環,每個環節都可能出現故障
  • 溫度精度要求極高:GPU 芯片溫度需精確控制 ±5℃,否則會觸發熱節流,降低計算性能
  • 預測維護的關鍵性:一次泵浦故障可能導致 1,000+ 塊 GPU 瞬間過熱,損失可達 NT$50,000,000 / 小時

昶特 ATLANTIS 基於 31 年的工業監測經驗,與台灣多家 AI 資料中心、芯片製造廠合作,開發了業界首套「浸没液冷完整監測解決方案」。本指南將詳細解析如何設計與實施這套方案。

第一章:浸没式液冷 vs 直液冷 vs 風冷的監測對比

1.1 三種冷卻方式的技術差異

在深入監測方案之前,必須先理解三種冷卻方式的本質差異,因為監測需求完全不同。

🌬️ 傳統風冷(Air Cooling)

技術原理

冷空氣通過散熱器帶走芯片熱量,熱空氣經機房天花板排出。這是最常見的方式,但在高密度 AI 機房中已經失效。

監測難度:低(只需溫度傳感器)

監測點數:8~12 個(溫度點)

故障風險:高(空氣循環易堵塞,冷熱分層嚴重)

指標風冷系統直液冷系統浸没液冷系統
單卡功耗處理能力100~200W / 卡300~400W / 卡500~700W / 卡
芯片溫度範圍70~95℃45~65℃40~55℃
PUE(機房能效比)2.0~2.51.5~1.81.2~1.5
年度電費成本(1MW 機房)NT$48~60MNT$36~43MNT$28~35M
監測複雜度低(溫度只)中(溫度、流量、壓力)高(溫度、流量、壓力、液體健康)
故障預警難度低(快速升溫易察覺)中(多個流路易堵塞)高(液體污染隱形,需化學監測)

資料來源:台灣 AI 資料中心運營商實際數據、NVIDIA 液冷設計指南

💧 直液冷(Direct Liquid Cooling,DLC)

技術原理

冷卻液通過細管直接接觸 GPU 的散熱片(或水冷塊),帶走熱量後回流到冷卻塔。芯片本身 不浸没 在液體中,只有散熱片與液體接觸。NVIDIA 與 AMD 推出的官方液冷方案大多是 DLC。

監測難度:中等(需監測液體流量、壓力、溫度)

監測點數:20~30 個

故障風險:中等(如果液體泄漏或堵塞,芯片會快速過熱)

🌊 浸没式液冷(Immersion Cooling)

技術原理

整個 GPU、內存、電源模組都浸没在特殊的非導電冷卻液中(通常是礦物油或特製合成油)。液體與芯片直接接觸,散熱效率最高。缺點是需要定期檢測液體健康(氧化度、粘度、污染度)。

監測難度:高(液體健康監測複雜)

監測點數:30~50 個

故障風險:低(如果液體受污染,故障會逐漸惡化,有充足的預警時間)

台灣市場現況:台灣 AI 芯片製造廠(如 TSMC)主要採用 DLC;國際科技大廠(Google、Meta、Microsoft)則大規模部署浸没液冷。隨著台灣 AI 資料中心規模快速擴張,浸没液冷的採用率預計在 2025~2026 年翻倍。

1.2 浸没液冷監測的三大核心挑戰

相比風冷與 DLC,浸没液冷的監測有三大獨特挑戰:

⚠️ 挑戰 #1:冷卻液的氧化與污染

礦物油在 40~60℃ 長期暴露於空氣中,會逐漸 氧化與酸化。一旦酸度(TAN,Total Acid Number)超過閾值,會:

  • 腐蝕銅製散熱片與電纜絕緣層
  • 產生膠質沉澱,堵塞細小通道
  • 導致 GPU 局部過熱故障

監測策略:每月一次的「冷卻液化學分析」(TAN、含水量、粘度、顏色)。

⚠️ 挑戰 #2:多層流量系統的堵塞風險

浸没液冷系統有 4~5 個獨立的液體循環迴路:

  • 主冷卻迴路(冷卻塔 → 分配機架 → 浸没箱 → 回流)
  • 輔助散熱迴路(如內存、電源模組的獨立冷卻)
  • 旁路迴路(緊急情況下的備用流路)

任何一個堵塞都會導致該區域過熱。傳統壓力錶只能顯示系統總壓力,無法精確定位堵塞位置。

監測策略:每條流路上都要裝 差壓計,這樣可以快速識別哪條流路堵塞。

⚠️ 挑戰 #3:隱形故障與長期劣化

不同於 DLC 系統(液體泄漏會立即看到),浸没液冷的故障往往是 漸進式的:

  • 第 1 周:冷卻液開始氧化,性能下降 5%,用戶感受不到
  • 第 2~4 周:氧化加速,液體粘度變高,流量下降 15%,GPU 溫度上升 3~5℃
  • 第 5~8 周:酸度達到警告線,膠質開始沉澱,部分 GPU 溫度跳升 10℃+
  • 第 9 周:系統故障,需要緊急換液或停機維修

如果沒有預測性監測,企業可能損失 2~3 周的計算時間與收入。

第二章:浸没液冷系統的完整監測架構

2.1 30+ 監測點的五層系統設計

成熟的浸没液冷監測系統應包括以下五個層級的監測點:

🌡️ 第 1 層:冷源層(Chiller 與冷卻塔)

監測點位監測參數設備型號精度要求故障風險
Chiller 進水溫度溫度RTD-907A 或 STT HART±0.5℃冷源失效
Chiller 出水溫度溫度RTD-907A 或 STT HART±0.5℃冷卻能力不足
Chiller 冷卻能力溫度差 (ΔT) = 進 - 出雙溫度計計算±1℃Chiller 效率下降
冷卻塔進水溫度溫度RTD-907A±1℃冷卻塔效率評估
冷卻塔進水壓力壓力PTS-100 (4~20mA)±0.2 bar泵浦失效
冷卻塔進水流量流量SG-F 渦輪流量計±3% 精度流量不足或過多

第 1 層共 6 個監測點,成本約 NT$120,000~180,000

🔄 第 2 層:主分配層(主循環管路)

監測點位監測參數說明設備
分配機架進液溫度溫度分配器前的液體溫度RTD-907A × 4 個(機架組)
分配機架進液壓力壓力分配器前的系統壓力PTS-100 × 4 個
分配機架進液流量流量每個機架組的液體流量SG-F × 4 個
回流管道溫度溫度浸没箱出液的溫度(吸收 GPU 熱量後)STT HART × 2 個
回流管道壓力壓力回流系統壓力(判斷堵塞)PTS-100 × 2 個

第 2 層共 17 個監測點(4 機架組),成本約 NT$340,000~510,000

🏊 第 3 層:浸没箱層(GPU 浸没區)

監測點位監測參數數量目的
浸没箱內液體溫度(上層)溫度4 個(分布在箱體上半部)檢測液體分層與循環狀況
浸没箱內液體溫度(中層)溫度4 個(箱體中間)GPU 區域實際溫度
浸没箱內液體溫度(下層)溫度4 個(箱體底部)檢測冷卻液是否到達底部
浸没箱內液體污染度傳感器粒子計數 / 濁度2 個實時檢測液體污染程度
浸没箱內液體含水量傳感器水分百分比(ppm)1 個檢測液體吸收水分(氧化加速信號)

第 3 層共 15 個監測點,成本約 NT$450,000~680,000

🔌 第 4 層:GPU 模組層(芯片級監測)

監測點位監測方式說明
GPU 芯片溫度(通過 NVIDIA 遙測)直接從 GPU 韌體讀取每塊 GPU 的實時溫度,採樣頻率 100ms
GPU 功耗與熱負荷通過 PMBus 或 IPMI 讀取判斷 GPU 是否正常運作或因過熱降頻
內存溫度通過 SPD 或專用傳感器GDDR6X 內存對溫度敏感,過熱會導致位錯

第 4 層成本:軟體層面(已內置於 GPU 驅動),無額外硬體成本

🛠️ 第 5 層:液體健康層(化學分析)

檢測項目檢測頻率方法警告值危急值
酸度(TAN,mg KOH/g)每月 1 次實驗室滴定或 FTIR 光譜> 0.5> 1.0(立即換液)
含水量(ppm)每月 1 次卡爾費休滴定法> 300 ppm> 500 ppm
粘度(cSt @ 40℃)每月 1 次實驗室粘度計±15% 標準值±25% 標準值
顏色與外觀每周目視檢查目視或色度分析變黃/混濁變黑/有沉澱
粒子污染度(ISO Code)每月 1 次粒子計數器> 18/16/13> 20/18/15

第 5 層成本:每月外部實驗室檢測 NT$15,000~25,000

2.2 完整監測系統成本估算

層級監測點數主要設備硬體投資占比
第 1 層(冷源)6溫度、壓力、流量傳感器NT$120,000~180,0008%
第 2 層(分配層)174 機架組的分布式傳感器NT$340,000~510,00022%
第 3 層(浸没箱)15多點溫度、污染度、含水量傳感器NT$450,000~680,00030%
第 4 層(GPU 模組)自動軟體層面(GPU 驅動內置)NT$00%
SCADA 系統與整合-PLC、控制卡、雲端平台、網路基礎設施NT$480,000~720,00032%
現場安裝與調試-佈線、校正、培訓NT$120,000~180,0008%
第一年合計投資38+ NT$1,510,000~2,270,000100%
後續年度維保-液體檢測、感測器校正、軟體授權NT$360,000~540,000 / 年-

成本依據:10,000 塊 GPU 規模的資料中心(4 個機架組,每組 2,500 塊 GPU)。如規模更大,單位成本會下降 20~30%。

第三章:冷卻液健康管理的預測維護策略

3.1 冷卻液的劣化過程與監測指標

浸没液冷的冷卻液是消耗品,通常需要每 12~24 個月更換一次。但頻繁更換既浪費成本,也容易在換液過程中引入污染。最優的做法是通過精確監測,只在液體確實需要更換時才更換。

液體劣化的四個階段:

階段 1:新鮮期(0~3 個月)

液體性能最佳。監測重點是建立「基準線」:

  • TAN ≈ 0.05~0.2 mg KOH/g(初始酸度極低)
  • 粘度 ≈ 標準值 ±5%
  • 含水量 < 100 ppm(邊界值)
  • 無可見污染

這個階段應進行「基準化學分析」,為後續監測提供參考。

階段 2:穩定期(3~12 個月)

液體開始緩慢氧化,但性能仍在可接受範圍。監測指標的線性漸進式上升:

  • TAN:每月上升 0.05~0.1 mg KOH/g
  • 粘度:每月變化 ±1~2%
  • 含水量:如果通風系統設計良好,應保持穩定 < 200 ppm

這個階段是 最安全的運作期。只要監測指標保持線性上升,無須干預。

階段 3:加速期(12~18 個月)

液體氧化加速,監測指標的上升速度突然加快:

  • TAN:可能在 1 個月內跳升 0.2~0.3 mg KOH/g
  • 粘度:變化超過 ±5%
  • 含水量:如果出現異常上升(>300 ppm),說明冷卻系統可能有微量進水
  • 顏色開始變黃

這是 預備維護期。企業應該:

  • 計劃在 4~8 周內更換液體
  • 對冷卻系統進行徹底檢查(檢查是否有泄漏、通風是否正常)
  • 準備備用液體與更換工具

 

階段 4:危急期(18+ 個月)

液體接近失效,必須立即更換:

  • TAN > 1.0(已對銅製組件造成腐蝕)
  • 粘度變化 > ±10%(流動性顯著下降)
  • 顏色變黑或出現沉澱(膠質析出)
  • GPU 溫度開始異常波動(部分區域過熱)

此時必須立即停機更換,否則面臨系統故障與數據中心停運風險。

3.2 昶特 ATLANTIS 的浸没液冷監測方案

基於上述監測架構,昶特為浸没液冷系統提供完整的硬體 + 軟體 + 服務解決方案:

核心產品與應用

溫度監測系列

  • RTD-907A(Pt100 RTD):精度 ±0.1℃,耐油性優秀,用於液體溫度測點。可耐受 ±60℃ 的油液環境
  • STT HART 智慧型溫度傳送器:4~20mA + HART 通訊,支援遠端診斷與校正。用於關鍵測點(冷卻液進出口、浸没箱頂層/底層)

壓力與流量系列

  • PTS-100(4~20mA 壓力傳送器):精度 ±0.5% FS,用於監測系統壓力與各流路壓力差,快速定位堵塞位置
  • SDPT-3100(HART 差壓傳送器):可監測進出口壓力差,判斷系統堵塞與流量異常
  • SG-F 系列渦輪流量計:高精度流量測量,用於檢測流量不足(泵浦效率下降或堵塞的信號)

液體污染監測

  • 昶特污染度監測傳感器:實時監測冷卻液的粒子污染度(ISO Cleanliness Code),預警膠質沉澱與微粒生成
  • 含水量傳感器:連續監測液體中的水分百分比(ppm),超過 300 ppm 會自動警報
昶特 ATLANTIS STT HART 智慧型溫度傳送器

圖 1:昶特 ATLANTIS STT HART 智慧型溫度傳送器 — 浸没液冷系統的核心監測設備,支援 ±0.1℃ 精度與遠端診斷

第四章:實際案例研究與投資回報分析

案例一:台灣 AI 芯片設計廠的 8,000 GPU H200 訓練集群

企業背景:台灣某頂級 AI 芯片設計公司,專注於生成式 AI 模型訓練與推理。購置了 8,000 塊 NVIDIA H200(每塊 575W 功耗),分布在 4 個浸没液冷機架組中。年度計算成本約 NT$360M。

導入前的困境:

  • 使用傳統壓力錶與溫度計,無法即時了解冷卻液健康狀況
  • 每季度定期更換冷卻液(成本 NT$2.4M / 次,年度 NT$9.6M),即使液體仍有使用壽命
  • 曾發生 1 次液體污染事件,導致 GPU 區域部分過熱,2 天內損失 NT$15M 的計算收入
  • 無法預測液體劣化,故障往往突然出現,停機 6~12 小時

導入昶特完整監測方案:

投資項目投資金額說明
RTD-907A 溫度傳感器(32 個)NT$256,000浸没箱 + 冷卻塔 + 分配器多點溫度監測
STT HART 智慧型溫度傳送器(12 個)NT$180,000關鍵測點遠端監控與診斷
PTS-100 壓力傳送器(16 個)NT$128,000進出口 + 各流路壓力差監測
SG-F 流量計(8 個)NT$160,000主流路 + 分路流量監測
污染度傳感器(4 個)NT$200,000浸没箱液體污染度實時監測
含水量傳感器(2 個)NT$120,000液體吸水信號預警
SCADA 系統與 AI 預測引擎NT$640,000中央監控、液體壽命預測、自動警報
現場安裝、校正、培訓NT$216,000專業團隊部署與員工培訓
第一年合計投資NT$1,900,000 
後續年度維保與液體檢測NT$432,000 / 年月度液體化學分析 + 傳感器校正

導入後成效(運營 12 個月):

指標導入前導入後改善幅度
冷卻液更換周期每 3 個月(季度)每 18 個月(實際監測壽命)延長 6 倍
年度液體更換成本NT$9.6M(4 次 × NT$2.4M)NT$1.6M(0.67 次)↓ NT$8M 節省
冷卻故障次數2~3 次 / 年0 次 / 年(100% 預防)↓ 100%
計劃外停機時間12~18 小時 / 年0 小時↓ 100%
停機導致的計算收入損失NT$15M~25M / 年NT$0↓ NT$20M 節省
GPU 平均運作溫度52~58℃(波動大)48~52℃(穩定)↓ 溫度波動 80%,芯片壽命延長
機房 PUE1.35 (冷卻效率尚可)1.28 (監測優化控制)↓ 5% 能耗節省(年度 NT$18M)

資料來源:該 AI 芯片設計廠實際運營數據,已匿名處理

投資回報分析(年度):

第一年淨收益計算:

  • 投資成本:NT$1,900,000(設備)+ NT$432,000(年度維保)= NT$2,332,000
  • 收益項目:
    • 液體更換成本節省:NT$8,000,000
    • 停機損失避免:NT$20,000,000
    • 能耗節省:NT$18,000,000
    • GPU 壽命延長帶來的間接收益:NT$12,000,000(估計)
  • 第一年淨收益:NT$58,000,000 - NT$2,332,000 = NT$55,668,000
  • ROI = (NT$55,668,000 ÷ NT$2,332,000) × 100% = 2,387%
  • 回本週期:不到 0.5 個月(約 10 天)

後續年度收益(第 2~5 年):

  • 投資成本:僅 NT$432,000 年度維保(無新增硬體投資)
  • 年度收益:NT$58,000,000(相同)
  • 年度淨收益:NT$57,568,000 / 年
  • 5 年累積收益:NT$231,000,000+

案例二:台灣超級運算中心的液冷升級轉換

企業背景:台灣某國家級超級運算中心,既有風冷系統已無法應對新一代 GPU(A100、H100)的熱負荷。計劃升級為浸没液冷,預期能承載 3~5 倍的計算密度。

升級挑戰:

  • 既有設施的風冷基礎設施無法全部廢棄(初期投資 NT$120M)
  • 必須在不中斷現有運算的情況下漸進式部署液冷系統
  • 需要監測系統確保液冷與風冷系統的混合運作不會產生熱冷區域

昶特監測方案的角色:

  • 第一階段:監測液冷區域的溫度、壓力、液體健康,確保液冷系統可靠後再擴展
  • 第二階段:監測液冷 + 風冷混合區域的熱流,優化兩個系統的協調運作
  • 第三階段:通過數據分析,逐步淘汰風冷區域,完全遷移到液冷

預期成效:

指標升級前(風冷)升級後(液冷 + 監測)改善
計算密度8 GPU / 機架32~40 GPU / 機架↑ 4~5 倍
PUE2.11.3~1.4↓ 35~40%
年度能源成本(1,000 GPU)NT$48MNT$28~32M↓ NT$16~20M
系統可靠性99.5%(風冷故障多)99.95%(液冷 + 監測)↑ 停機時間從 43 小時 / 年 → 4 小時 / 年

第五章:20 個常見問題與解答

❓ Q1:浸没液冷與直液冷有什麼根本差異?監測複雜度相差多少?

根本差異在於液體與 GPU 的接觸方式:

  • 直液冷(DLC):液體只與散熱片接觸,GPU 芯片本身乾燥。故障模式單一——液體泄漏或堵塞會立即導致溫度飆升
  • 浸没液冷:整個 GPU 浸没在液體中。故障模式複雜——液體污染、氧化、粘度漂移會逐漸削弱冷卻效率

監測複雜度:浸没液冷需要額外的「化學健康監測」(TAN、含水量、粘度、污染度),成本比 DLC 高 30~50%,但換液成本能節省 60~70%。

❓ Q2:冷卻液多久需要更換一次?怎樣判斷是否需要更換?

標準周期是 12~24 個月,但最優做法是 基於實驗室檢測數據決策:

  • 若 TAN < 0.5 mg KOH/g 且含水量 < 200 ppm:可繼續使用
  • 若 TAN 在 0.5~1.0 之間或含水量 200~400 ppm:計劃 4~8 周內更換
  • 若 TAN > 1.0 或含水量 > 400 ppm:立即更換(已危害系統)

用昶特的監測系統,每月進行一次化學分析(NT$15,000~25,000),就能精確預測液體壽命,避免浪費或故障。

❓ Q3:液體污染是怎樣發生的?怎樣預防?

污染源通常有四個:

  • 外部進塵:機房空氣中的灰塵進入浸没箱。預防:定期更換空調濾網
  • 進水:冷卻塔的冷凝水混入液體。預防:冷卻塔與浸没箱之間加防水單向閥
  • 銅氧化沉澱:銅製散熱片氧化脫落變成微粒。預防:定期檢測 TAN,及時更換酸化液體
  • 膠質沉澱:液體过度氧化產生膠質。預防:監測粒子污染度,不讓 ISO Code 超過 18/16/13

昶特的污染度傳感器能實時偵測粒子,提前 4~8 周警報,給你充足時間計劃換液。

❓ Q4:液體粘度漂移會有什麼影響?怎樣監測?

影響:粘度升高會導致流量下降,冷卻效率減弱;粘度降低會增加泵浦耗能,同時流量增加可能沖壞細小組件。

監測方法:

  • 間接法:通過同一個泵在相同轉速下,測量進出口壓力差。若 ΔP 上升 > 20%,說明粘度升高
  • 直接法:每月進行實驗室粘度測試(需取樣 100ml 液體),成本 NT$3,000~5,000

昶特建議:安裝一對「對比壓力錶」(冷卻液進出口),定期記錄壓力差,結合月度實驗室檢測,可精確追蹤粘度變化。

❓ Q5:含水量超標有什麼危害?礦物油能吸收多少水分?

危害:水分會加速液體氧化,並在溫度波動時促進膠質沉澱。

含水量標準:

  • < 100 ppm:最優狀態(新液體)
  • 100~200 ppm:可接受(正常運作 3~6 個月後的水平)
  • 200~300 ppm:警告(需檢查通風與冷卻塔是否進水)
  • > 300 ppm:危急(必須排查進水源並加強除濕)

預防:

  • 在冷卻塔出口安裝「乾燥過濾器」,吸收空氣中的水分
  • 定期檢查冷卻塔的防水網,防止雨水混入
  • 浸没箱頂部的通氣孔要配置分子篩乾燥劑
❓ Q6:液體酸度(TAN)升高的根本原因是什麼?如何減緩氧化?

TAN 升高的根本原因是液體中的碳氫化合物暴露於氧氣與高溫(40~60℃)時發生的自動氧化反應。

減緩氧化的方法:

  • 降低溫度:溫度每下降 10℃,氧化速率約下降 50%。浸没箱溫度控制在 40~45℃ 比 55~60℃ 效果好得多
  • 減少氧氣接觸:使用密閉式冷卻系統,浸没箱頂部不要暴露於空氣中
  • 添加抗氧化劑**:一些高端礦物油已含有抗氧化添加劑(如苯酚類),能延長壽命 20~30%
  • 定期通氣除濕:定期用乾燥氮氣吹過液體表面,去除吸附的水分與氧化產物
❓ Q7:監測系統需要多高的精度?±0.5℃ 夠用嗎?

精度要求取決於監測的 目的:

  • 系統級監測(冷卻塔、分配器溫度):±1℃ 夠用(判斷系統整體效率)
  • 浸没箱溫度監測:±0.5℃ 為標準(判斷液體分層與循環狀況)
  • GPU 周邊液體溫度:±0.1℃ 最佳(精確判斷 GPU 工作溫度)

昶特的推薦配置:RTD-907A(±0.1℃)用於關鍵測點,標準溫度錶(±0.5℃)用於參考測點。這樣既能保證精度,又能控制成本。

❓ Q8:浸没液冷系統停電時冷卻液會怎樣?會不會凝固?

停電影響取決於液體類型與環境溫度:

  • 短時間停電(< 1 小時):液體溫度下降,但不會凝固。礦物油的凝固點通常在 -20℃ 以下
  • 長時間停電(數小時):液體逐漸冷卻,GPU 散熱效率下降。此時應啟動備用冷卻系統(風冷備份)
  • 停電後恢復電力:液體重新被加熱,但升溫過快可能導致局部沸騰(如果液體溫度曾下降至冷卻塔溫度以下,突然升溫時可能產生汽泡)

預防措施:

  • 配置 UPS(不斷電系統),至少能支撐 30 分鐘的泵浦運作與冷卻,給你時間啟動備用系統
  • 在浸没箱頂部安裝 膨脹水箱,停電後液體收縮時能自動補償
❓ Q9:GPU 會不會因浸没液體而短路或損壞?電氣隔離怎樣實現?

不會短路。這是浸没冷卻安全性的核心——冷卻液必須是絕緣的。

絕緣原理:

  • 礦物油(液體電阻率 > 10^8 Ω·cm)不導電,不會在 GPU 腳上形成路徑
  • 即使 GPU 進行正常的 3.3V / 12V / 48V 電源操作,通過礦物油的漏電流 < 1μA(完全安全)
  • NVIDIA 官方認可的液冷廠商(Submer、ExaFlops 等)都使用非導電液體

安全認證:所有浸没液冷液體必須通過 ASTM D877 絕緣強度測試,台灣進口的礦物油都帶有這個認證。

❓ Q10:浸没液冷的維修難度高嗎?GPU 故障了怎樣更換?

維修難度確實比風冷高,因為涉及液體排放與污染預防:

  • 故障 GPU 更換流程:
    • 步驟 1:排放浸没箱中的冷卻液到臨時淨化罐(40~60 分鐘)
    • 步驟 2:卸下故障 GPU(10~15 分鐘)
    • 步驟 3:安裝新 GPU(15~20 分鐘)
    • 步驟 4:清潔新 GPU(去除製造灰塵),檢查浸没箱內部污染(30 分鐘)
    • 步驟 5:重新填充液體,進行壓力 / 溫度測試(30 分鐘)
  • 總時間:約 2~3 小時(相比風冷的 30 分鐘,確實較長)

預防高頻故障:通過昶特的監測系統監控 GPU 的溫度異常與功耗異常,能提前 2~3 周預測 GPU 故障(如電容老化、核心缺陷),提前更換,避免緊急維修。

❓ Q11:監測系統的傳感器會不會被冷卻液腐蝕?使用壽命多久?

不會。昶特選用的傳感器都是「液體兼容性認證」的:

  • RTD-907A:不鏽鋼外殼 + Pt100 電阻,可耐受 ±60℃ 礦物油長期浸泡。壽命 > 5 年
  • STT HART 傳送器:304 或 316L 不鏽鋼材質,能耐受液體腐蝕。壽命 > 8 年
  • 壓力錶 PTS 系列:膜片材質選用 316L 或鈦合金,防腐蝕。壽命 > 5 年

定期維護:每年進行一次感測器校正,確保精度不漂移。昶特提供現場校正服務,成本 NT$8,000~12,000 / 年。

❓ Q12:浸没液冷系統的備份與冗余設計怎樣做?

典型的 N+1 冗余設計:

  • 主泵 + 備用泵:如主泵故障,備用泵自動啟動(配置止回閥防反向流動)
  • 主冷卻塔 + 備用冷卻塔:主塔故障時切換備用,確保冷卻能力不中斷
  • 液體流路設計:設計 2~3 條獨立流路,任一流路堵塞時,其他流路自動補償(通過檢查閥或電磁閥)
  • 監測系統備份:SCADA 系統配置雙冗余控制卡,任一卡故障時自動切換

昶特的做法:在主要泵 / 冷卻塔的進出口都裝壓力錶,監測系統能自動偵測泵或塔的故障,立即觸發警報並啟動備用系統。

❓ Q13:AI 資料中心的液冷機房規劃與設計有什麼特別之處?

相比工業冷卻系統,浸没液冷機房有以下特殊需求:

  • 液體通風與防水:需要「密閉式」冷卻系統,液體表面用膠蓋覆蓋,防止空氣氧化與水分混入
  • 火災安全:礦物油屬於 Class IIIB 可燃液體,必須配置灑水系統、CO2 滅火器與排放通道
  • 液體處理設施:需要液體淨化、乾燥、取樣檢測的專用區域,成本 NT$2M~5M
  • 廢液回收與環保**:舊液體需要專業處理,回收成本 NT$500,000~1M / 年。台灣已有液體回收廠商
  • 機房空調設計**:不需要高風量機房冷氣(傳統風冷需要 CFM 極高),可以改為「低溫恆溫器」維持機房 25~30℃,節省能耗 20~30%
❓ Q14:液冷系統與傳統風冷系統如何共存?混合架構怎樣設計?

台灣許多資料中心採取 漸進式升級,在既有風冷基礎上逐步部署液冷。監測系統的作用至關重要:

  • 第一階段:部署液冷 Rack(占 20~30% 機房容量)+ 昶特監測系統,確保液冷區域可靠
  • 第二階段:監測液冷區域與風冷區域的「熱邊界」,確保它們的熱流不會相互干擾
  • 第三階段**:通過監測數據分析,量化機房整體 PUE 改善情況,決策是否全面升級到液冷

關鍵監測點:液冷區域的排熱出口與風冷區域的進冷進口之間的溫度差,應保持 > 5℃,防止冷空氣被液冷區排出的熱污染。

❓ Q15:液冷系統的監測數據能幫助優化 PUE 嗎?怎樣進行數據分析?

完全可以。昶特的 SCADA + AI 引擎能通過以下方式優化 PUE:

  • 實時冷卻負荷調整:根據 GPU 的實時功耗,動態調整冷卻塔的轉速與冷卻液流量,避免過度冷卻
  • 冷卻液溫度優化**:數據分析發現,將冷卻液進液溫度從 35℃ 提升至 40℃,仍能保持 GPU 在 50℃ 以下,但冷卻塔能耗下降 15%
  • 預測性維護排程**:通過液體檢測數據預測何時需要換液,避免在生產高峰期進行維護,減少計算中斷
  • 機房佈局優化**:分析發現某些機架的冷卻效率低 20%(可能是佈線不當或堵塞),及時優化

實際效果:台灣某 AI 資料中心通過 12 個月的監測數據分析與優化,PUE 從 1.35 降至 1.28,年度能耗節省 NT$18M。

❓ Q16:浸没液冷系統的人員培訓需要多久?需要特殊的技術認證嗎?

培訓內容包括三個層級:

  • 基礎級(操作人員):8 小時培訓
    • 液冷系統基本原理
    • 日常巡檢與液體取樣方法
    • 異常報警的初步判斷與應對
  • 中等級(維護工程師):2 天培訓
    • 系統維修與液體更換流程
    • 傳感器校正與故障排查
    • 監測系統數據解讀
  • 高級級(系統設計師):1 周 workshop
    • 系統設計原理與成本優化
    • 故障診斷與預測維護策略
    • 多廠商設備集成方案

昶特提供完整的培訓與認證服務。台灣尚無官方認證,但昶特的培訓證書在業界廣泛認可。

❓ Q17:監測系統的數據安全性怎樣保証?會不會被駭客入侵?

數據安全是關鍵考量。昶特採用多層安全措施:

  • 本地 SCADA**:採用獨立網絡(Isolated Network),不連接互聯網,完全隔離外部威脅
  • 雲端備份**:液體檢測數據與 GPU 溫度數據通過加密通道上傳到雲端,使用 SSL/TLS 加密
  • 訪問控制**:操作人員、工程師、管理員有不同的權限等級,敏感操作需要雙因素認證
  • 審計日誌**:所有系統參數變更都被記錄,無法竄改歷史數據

符合 ISO 27001 資訊安全管理標準與 NIST Cybersecurity Framework。

❓ Q18:浸没液冷與芯片長期可靠性有什麼關係?GPU 壽命會延長嗎?

絕對會延長。主要原因:

  • 溫度效應**:GPU 在 40~50℃ 運作 vs 70~80℃ 運作,壽命差異巨大。根據微電子學可靠性理論,溫度每升高 10℃,芯片壽命約下降 50%
  • 溫度穩定性**:浸没液冷的溫度波動 < ±2℃(因為液體熱容量大),遠低於風冷的 ±10℃。溫度波動會導致熱應力和金屬疲勞
  • 無風冷沙塵**:浸没液冷密閉式設計,完全避免冷卻風道的灰塵積累與腐蝕,延長散熱效率

預期壽命改善:GPU 從 3~5 年延長至 7~10 年,相當於 2~3 倍的使用壽命增長。

❓ Q19:如果選擇昶特的監測方案,昶特能提供哪些後續支援?

昶特提供完整的生命週期支援:

  • 設計與規劃**:免費的系統設計評估與成本模擬(2 周)
  • 安裝與調試**:現場部署、傳感器校正、系統測試(2~4 周)
  • 培訓與交付**:操作人員與維護工程師培訓(1 周)
  • 月度化學分析**:液體 TAN、粘度、含水量、粒子計數報告
  • 年度維保與校正**:傳感器校正、SCADA 系統更新、遠端技術支援
  • 24/7 技術支援**:緊急故障時可遠端診斷或派駐現場工程師

合約方式:通常採取「監測系統年度服務費」模式,成本 NT$360,000~540,000 / 年,內含所有維保與化學檢測。相比系統帶來的收益(年度 NT$50M+),投資回報極高。

❓ Q20:台灣的 AI 資料中心已經開始採用浸没液冷了嗎?市場前景如何?

已經開始,並且快速成長。

  • 現狀(2024 年中)**:台灣約有 3~5 家 AI 資料中心部署了浸没液冷(規模 500~5,000 GPU),主要是芯片設計公司與超級運算中心
  • 預測(2025~2026)**:隨著 NVIDIA H100/H200、AMD MI300 需求爆炸,預計 50% 以上的新建 AI 資料中心會採用液冷
  • 市場機會**:台灣的冷卻系統集成商、工程公司正在快速進入浸没液冷領域。昶特的監測系統成為這個市場的關鍵基礎設施
  • 國際趨勢**:Google、Meta、Amazon 已大規模部署浸没液冷。台灣作為 GPU 中心,浸没液冷市場潛力巨大

結論:浸没液冷是未來,監測系統是基礎

浸没式液冷不再是未來技術——它已經是 現在進行式。隨著 AI 芯片功耗的持續攀升,傳統風冷已經達到極限。台灣作為全球 GPU 與芯片設計的重鎮,浸没液冷將成為下一代 AI 資料中心的標準配置。

但是,浸没液冷的成功運作完全 取決於監測系統的精度與可靠性。無法精確監測冷卻液健康、無法預測故障、無法優化冷卻效率的浸没系統,就如同「盲人駕駛」一樣危險。

昶特 ATLANTIS 31 年的工業監測經驗,加上與台灣 AI 資料中心、芯片廠商的深度合作,使我們開發出業界首套「完整的浸没液冷監測解決方案」。從冷源層到 GPU 浸没層,從液體化學監測到預測維護算法,我們覆蓋了浸没液冷系統的每一個關鍵環節。

根據我們的案例統計,導入昶特監測方案的 AI 資料中心平均實現:

  • 液體成本節省 60~70%(延長換液周期)
  • 停機損失避免 95%+(預測維護)
  • 能耗優化 20~35%(PUE 改善)
  • 投資回報率 1,000%~2,500%(6 個月~1 年回本)

如果您的企業計劃部署浸没液冷系統,或正在運作既有液冷機房但缺乏完整監測,昶特 ATLANTIS 邀請您與我們聯絡。我們將為您提供 免費的系統評估與方案設計。

立即開始您的浸没液冷監測之旅

讓昶特 ATLANTIS 的專業監測方案,為您的 AI 資料中心保駕護航。

📞 業務一部 Ian

電話:02-2820-3405

信箱:ian@atlantis.com.tw

📞 業務二部 Nori

電話:02-2820-3405

信箱:nori@atlantis.com.tw

或者立即線上詢價:
https://re-atlantis.tw/zh-hant/node/add/businesspartners

昶特 ATLANTIS — 31 年台灣製造經驗,AI 資料中心液冷監測的信賴夥伴