液冷資料中心故障預防完全指南
壓力、流量、溫度三層監測架構 — 提前 2-5 分鐘發現故障的科學方法
⚠️ 為什麼單層溫度監測會導致故障?
當液冷伺服器的冷卻液開始洩漏時,物理過程是這樣發生的:
- 第 0 秒:微小洩漏開始(肉眼看不見)
- 第 30 秒:系統壓力開始緩慢下降(下降速率 ≈ 0.1-0.2 bar/小時)
- 第 2-5 分鐘:冷卻液循環流量異常(可偵測流量下降 ±5%)
- 第 5-10 分鐘:冷板溫度開始上升(從 25°C 升至 30-35°C)
- 第 10-60 秒內:GPU 溫度飆升至 85°C 以上 → 自動關機(計算中斷)
如果您只監測溫度,您將在「最後 10-60 秒」才收到警報。但如果您監測壓力與流量,您可以在「洩漏發生後 2-5 分鐘」就偵測異常,留出充足時間啟動應急程序。
第一章:三層監測架構為什麼是必需的?
1.1 單層監測的盲點
| 監測層級 | 監測內容 | 能偵測的故障 | 盲點 | 反應時間 |
|---|---|---|---|---|
| 溫度層(僅有) | 液溫、冷板溫度 | 系統過熱、Chiller 失效 | ❌ 微洩漏、流量不均、管道堵塞 | 5-10 分鐘(太遲) |
| 壓力層(新增) | 系統壓力、差壓 | 洩漏、堵塞、隔膜破裂 | ❌ 不知道冷卻效果是否充分 | 2-5 分鐘(黃金時間) |
| 流量層(新增) | 系統流量、支路流量 | 流量不均、水泵故障 | ❌ 不知道原因(是堵塞還是洩漏?) | 3-7 分鐘(補充診斷) |
| 三層聯動 | 壓力 + 流量 + 溫度 | ✅ 所有液冷故障 | 🟢 完整覆蓋 | 2-5 分鐘(早期預警) |
1.2 三層聯動的早期預警機制
案例:某資料中心冷板微洩漏發生過程
⏰ 時間軸對比
❌ 僅溫度監測(傳統方案)
- T=0分鐘:微洩漏開始(無反應)
- T=5分鐘:冷板溫度異常 → 發出警報
- T=7分鐘:人工確認 → 手動停機
- 結果:GPU 已過熱 5-10 次,部分晶片損傷
✅ 三層監測(ATLANTIS 方案)
- T=0分鐘:微洩漏開始
- T=1分鐘:壓力異常(下降速率 0.1 bar/小時)→ 趨勢預測告警
- T=2分鐘:流量確認異常(↓5%)→ 二層確認
- T=3分鐘:系統自動進入保護模式(降低功率、增加散熱)
- 結果:零晶片損傷,應急程序順利啟動
第二章:三層監測架構的各自角色
2.1 壓力層 — 第一防線
角色:最早偵測系統異常的哨兵
| 監測點 | 正常範圍 | 異常信號 | 可能原因 | 應急行動 |
|---|---|---|---|---|
| Chiller 出口壓力 | 2.0-3.5 bar | 緩慢下降 (< -0.1 bar/hr) | 泵磨損、內漏 | 檢查泵運行狀態 |
| CDU 進口壓力 | 1.8-3.2 bar | 驟降 (> -0.5 bar/min) | 系統洩漏(大) | 立即停機,定位洩漏 |
| 冷板進口微壓(左支路) | 0.3-0.5 bar | 持續下降 (< -0.05 bar/hr) | 冷板微洩漏 | 更換冷板,保留故障件檢測 |
| CDU 進出口差壓 | ≤ 1.5 bar | 上升 (> 2.0 bar) | 管道堵塞、隔膜故障 | 清潔管道或更換濾芯 |
💡 壓力層的關鍵優勢:
精密壓力錶(精度 ±0.02%)可在液體流速改變 < 1% 時偵測異常。 這意味著在人眼看不見任何洩漏的情況下,系統已經知道有問題了。
2.2 流量層 — 第二防線
角色:診斷壓力異常的根本原因
| 監測點 | 正常範圍 | 異常信號 | 可能原因 | 應急行動 |
|---|---|---|---|---|
| CDU 進口流量 | 150-200 L/分 | 下降 (> 10%) | 泵輸出下降 | 檢查泵功率、溫度 |
| 進出口流量守恆 | 進 ≈ 出 ±5% | 出口流量 < 進口 15% | 內部洩漏或蒸發 | 檢查 CDU 內部、液體質量 |
| 支路流量平衡 | 各支路相等 ±5% | 某支路 < 平均 20% | 該支路堵塞或洩漏 | 隔離故障支路,檢修 |
| 回流溫度上升速率 | ≤ 1°C/5分鐘 | > 2°C/5分鐘 | 冷卻能力不足 | 檢查 Chiller、流量 |
💡 流量層的關鍵優勢:
流量計可區分「洩漏」vs「堵塞」: 洩漏時進出流量不相等;堵塞時進出流量相等但壓力升高。 這個診斷至關重要,因為兩者的應急程序完全不同。
2.3 溫度層 — 最後防線
角色:確認冷卻效果、防止 GPU 過熱
| 監測點 | 安全範圍 | 警告級別 | 危險級別 | 應急行動 |
|---|---|---|---|---|
| Chiller 出口液溫 | 20-25°C | > 28°C | > 35°C | 降低 GPU 功率、增加冷卻劑流量 |
| 冷板入口液溫 | 20-28°C | > 32°C | > 40°C | 檢查管線堵塞、隔膜破裂 |
| 冷板出口液溫 | 25-32°C | > 38°C | > 45°C | 確認冷板與 GPU 接觸良好 |
| 回流液溫(Chiller 入口) | < 40°C | > 45°C | > 50°C | 檢查冷卻塔、風扇效率 |
第三章:12種常見液冷故障的診斷決策樹
🔍 故障診斷決策樹
使用方法:從最頂層的症狀開始,按照決策樹逐層診斷,最終確定故障類型與應急措施。
- 表現:CDU 出口流量明顯下降,機櫃地面濕潤
- 應急:立即停機、隔離故障機櫃、收集洩漏液體
- 恢復:檢查所有接頭、更換損傷管道
- 表現:差壓 > 2.5 bar,冷板溫度異常升高
- 應急:増加泵功率、檢查冷卻液清潔度
- 恢復:執行液冷系統沖洗、更換過濾器
- 表現:CPU/GPU 侷部過熱,TIM(熱界面材料)老化
- 應急:降低該伺服器功率至 50%
- 恢復:更換冷板、重新塗抹 TIM、校準壓力
- 表現:整個系統液溫持續上升,冷卻塔風扇異常
- 應急:臨時增加冷卻塔風扇轉速
- 恢復:檢修或更換 Chiller、清潔冷凝器
- 表現:GPU 溫度逐漸升高,機櫃角落有細微水漬
- 應急:立即更換備用冷板
- 恢復:返廠檢測洩漏部位、焊接或更換冷板
- 表現:該冷板溫度升高,但其他部位壓力正常
- 應急:降低該伺服器功率
- 恢復:沖洗冷板內部通道、更換液體
- 恢復:清潔該支路、更換沙粒過濾器
- 恢復:檢查閥門位置、重新調整至完全開啟
3.1 故障速查表
| 故障編號 | 故障名稱 | 主要信號 | 診斷難度 | 恢復時間 |
|---|---|---|---|---|
| #1 | 系統洩漏(大) | 進出流量差 > 10% | 🟢 易 | 30 分鐘 |
| #2 | 管道堵塞 | 差壓 > 2.5 bar | 🟢 易 | 1-2 小時 |
| #3 | 冷板接觸不良 | 溫差 < 3°C | 🟡 中 | 20 分鐘 |
| #4 | Chiller 故障 | 全系統溫度升高 | 🟡 中 | 2-4 小時 |
| #5 | 冷板微洩漏 | 微壓緩慢下降 | 🔴 難 | 15 分鐘 |
| #6 | 冷板內部堵塞 | 進出差壓突增 | 🟡 中 | 30-60 分鐘 |
| #7 | 分支管道堵塞 | 支路流量不均 | 🟡 中 | 45 分鐘 |
| #8 | 閥門部分關閉 | 該支路流量低,但溫度正常 | 🟢 易 | 5 分鐘 |
第四章:2-5 分鐘早期預警的商業價值
4.1 故障成本計算模型
⚠️ 一次液冷故障的真實成本
不是「停機時間 × 時薪」這麼簡單。實際成本包括:
| 成本項目 | 故障無預警 | 三層監測(提前2-5分鐘) | 成本差異 |
|---|---|---|---|
| 停機時間 | 90 分鐘(誤診 + 修復) | 15 分鐘(預知 + 快速修復) | 節省 NT$400,000 |
| GPU 晶片損傷 | 2-3 顆報廢(過熱失效) | 0 顆(保護程序啟動) | 節省 NT$300,000-450,000 |
| 液冷系統污染 | 全系統沖洗(2-3 天) | 局部清潔(4 小時) | 節省 NT$200,000 |
| 客戶賠償 (SLA) | NT$500,000-1,000,000 | 零(未達到 SLA 違反閾值) | 節省 NT$500,000-1,000,000 |
| 單次故障總成本差異 | NT$1,400,000-1,850,000 | ||
4.2 年度投資回報計算
年度成本對比:
| 成本類別 | 無監測 | 三層監測後 | 年度節省 |
|---|---|---|---|
| 故障成本 | NT$36-54M/年 | NT$5-7M/年 | NT$31-47M |
| 監測系統成本 | NT$0 | NT$150,000/年 | -NT$150,000 |
| 年度淨節省 | NT$30.85-46.85M |
💡 關鍵洞察:
三層監測的投資成本在首次故障預防時就已回本。 對於每月經歷 2-3 次故障的資料中心,這套系統在第一個月內的 ROI 就已達到 200-300%。
第五章:ATLANTIS 三層監測推薦配置
5.1 標準配置(100-250kW 液冷集群)
| 層級 | 監測點 | 儀表型號 | 量程/規格 | 精度 | 數量 |
|---|---|---|---|---|---|
| 壓力層 | Chiller 出口 | DPS-2.5SPD3 | 0-5 bar | 1.0 | 1 |
| CDU 進口 | DPS-2.5SPD3 | 0-6 bar | 1.0 | 1 | |
| CDU 出口 | DPS-2.5SPD3 | 0-6 bar | 1.0 | 1 | |
| 冷板微壓(支路 A/B) | AT803-D | 0-0.5 bar | 0.5 | 2 | |
| 流量層 | CDU 進口 | FM-60 | 0-200 L/分 | 1.0 | 1 |
| CDU 出口 | FM-60 | 0-200 L/分 | 1.0 | 1 | |
| 溫度層 | Chiller 出口液溫 | PT-RF321 | 0-60°C | 1.0 | 1 |
| 冷板進出溫(多點採樣) | PT-RF321 | 0-50°C | 1.0 | 3 | |
| 回流溫度 | PT-RF321 | 0-80°C | 1.6 | 1 | |
| 保護層 | 洩漏感測 | LS-500 | N/A | 毫秒級 | 3 |
5.2 信號集成與遠程診斷
所有儀表支援 HART 協議 與 4-20mA 模擬信號 雙輸出,可與現有 BMS 系統無縫整合。 進階配置支援 Modbus TCP 與雲端連接,實現 24/7 遠程監測與趨勢預測。
🔗 集成架構:
儀表 → HART 集線器 / Modbus Gateway → BMS 軟體 → 遠程告警系統 → 運維團隊手機通知
第六章:20 個技術深度 FAQ
❓ Q1: 為什麼要監測「冷板微壓力」而不是「冷板溫度」?
因為壓力反應速度快 10 倍。
當冷板開始微洩漏時:
- T=1分鐘:微壓力下降 0.02 bar(可偵測)
- T=5分鐘:溫度才上升 2-3°C(勉強可偵測)
所以壓力是早期預警的「哨兵」。溫度是最後的「救生索」。
❓ Q2: 精度 0.5 級和 1.0 級的差別有多大?
對於 5 bar 量程的儀表:
- 1.0 級:誤差 ±0.05 bar(相對 5% 偏差)
- 0.5 級:誤差 ±0.025 bar(相對 0.5% 偏差)
在 0.5 bar 的微壓應用上:
- 1.0 級:誤差 ±0.01 bar → 10% 偏差(無法判斷是故障還是波動)
- 0.5 級:誤差 ±0.005 bar → 1% 偏差(可清楚判斷)
成本差異:約 30%,但能力差異是 10 倍,所以值得投資。
❓ Q3: 為什麼需要「進出口流量計」而不是「一個流量計」?
因為流量守恆是診斷洩漏的關鍵。
例如:
- 進口流量 100 L/分,出口流量 95 L/分 → 系統內部洩漏 5 L/分
- 進口流量 100 L/分,出口流量 100 L/分,但壓力下降 → 管道堵塞或隔膜破裂
同一個現象(流量低),兩個完全不同的原因(洩漏 vs 堵塞),應急程序相反。 所以進出口各一個流量計,成本增加 50%,但診斷準確度提升 100%。
❓ Q4: 「趨勢預測」如何工作?能提前多久警報?
趨勢預測算法監測:
- 壓力的下降速率(bar/小時)
- 溫度的上升速率(°C/小時)
- 流量的衰減趨勢(L/分/天)
ATLANTIS 的 SDPT-3100 雲端儀表配備機器學習模型,可基於歷史數據推算:
- 「按照目前速率,該指標將在何時超過警告閾值?」
- 典型預測提前 12-48 小時發警
這給您充足的時間排期維護,而不是被迫應急。
❓ Q5: 如果我的 BMS 不支援 HART,可以用其他方式嗎?
完全可以。ATLANTIS 儀表提供三種信號輸出選項:
- ✅ 4-20mA 模擬信號(所有 PLC 都支援,最經典)
- ✅ HART 數位信號(如果 BMS 支援)
- ✅ Modbus TCP/IP(如果有網路基礎設施)
推薦:先用 4-20mA,後期若需升級可加裝 HART 集線器或 Modbus 閘道,無需更換儀表。
❓ Q6: 液冷系統停機後,儀表讀數會不會有誤差?
會,但很小且可預測。
停機 24 小時後:
- 壓力會因溫度下降而自然下降 5-10%
- 流量計指針歸零
- 溫度緩慢均衡至環境溫度
這是正常現象,不是儀表故障。下次開機時自動恢復。
❓ Q7: 故障診斷決策樹對我的系統適用嗎?
99% 適用。
決策樹基於液冷的物理原理設計,對所有液冷系統都適用,無論廠商品牌。 唯一的變數是「具體數值」(您的系統正常壓力、流量範圍可能不同)。
第一步:根據您的系統規格,自訂決策樹中的「警告閾值」。 之後就可以直接使用。
❓ Q8: 三層監測的「假警報」會不會很多?
很少。設計得當的監測系統假警報率 < 2%。
關鍵是「算法」而非「閾值」:
- ❌ 簡單閾值(壓力 < 3.0 bar 就警報)→ 假警報多
- ✅ 趨勢算法(壓力持續下降 > 0.2 bar/小時)→ 真實故障準確率 95%+
ATLANTIS 的智慧監測採用「趨勢 + 多層確認」,在新竹案例中的假警報率僅 0.8%。
❓ Q9: 更換儀表會中斷液冷系統嗎?
視類型而定:
- 溫度計、流量計:通常無需停機,在線更換(3-5 分鐘)
- 壓力錶:直插式需要關閉進液閥,隔膜式可在線更換
- 微壓力錶:通常不可在線更換(需停機 15-30 分鐘)
建議:購買 1-2 套備用儀表,故障時可立即熱替換,零停機時間。
❓ Q10: 如何定期校正這些儀表?
推薦週期:
- 精度等級 0.5:每 12 個月校正一次
- 精度等級 1.0:每 24 個月校正一次
- 故障發生後:立即校正(確認儀表本身未受損)
ATLANTIS 在台北、新竹設有認證實驗室,校正週期 5-7 天,成本 NT$2,000-5,000/件。 或购置便携式校準器(NT$50,000 一次性),可現場快速校正。
❓ Q11: 如果液冷系統改用「隔膜隔離」,還需要微壓力錶嗎?
是的,更需要。
隔膜隔離的好處是「保護儀表」,但不改變「液體的洩漏會發生」這個事實。 實際上,隔膜隔離系統因為無法直接接觸液體,更依賴於「壓力變化」來診斷問題。
隔膜後面的壓力下降 = 液體側有洩漏,這是唯一的診斷信號。 所以隔膜型號應選擇更高精度(0.3-0.5 級)以確保敏感性。
❓ Q12: 我的液冷系統用的是「油冷」,不是「水冷」,還能用這些儀表嗎?
可以,但需要特殊規格。
礦物油冷卻液對儀表的要求:
- ✅ 外殼必須 316L 不銹鋼(而非 304)
- ✅ 防爆型 ATEX/IECEx 認證(油霧可燃)
- ✅ 隔膜式必須用 Hastelloy 或 316L 合金
- ⚠️ 校正週期縮短至 12 個月(油類腐蝕性更強)
ATLANTIS 全線產品均提供「水冷版」和「油冷版」規格, 詢價時請明確指定冷卻液類型。
❓ Q13: 壓力錶的「指針」和「數位顯示」哪個更準確?
都準確,各有優勢。
- 指針型:直觀易讀,無電源依賴,但無數據記錄
- 數位型:精度更高,支援 4-20mA 輸出,可自動記錄趨勢
建議配置: 關鍵監測點(CDU、冷板)用「數位型」以支援自動化診斷; 輔助監測點(回流)可用「指針型」以降低成本。
❓ Q14: 三層監測可以「預測」故障會在何時發生嗎?
可以,準確度 80-90%。
例如:
- 觀察到:壓力每小時下降 0.15 bar
- 目前壓力:3.0 bar,警告閾值:1.5 bar
- 計算:(3.0-1.5) / 0.15 = 10 小時後將達到閾值
- 結論:「您有 10 小時時間排期維護」
這就是「預知性維修」的核心——從「被動應急」轉變為「主動規劃」。
❓ Q15: 如果監測系統本身故障怎麼辦?
有三層冗餘設計:
- 第一層:備用儀表(關鍵點配置 1:1 備用)
- 第二層:信號線冗餘(HART + 4-20mA 雙輸出)
- 第三層:告警聯鎖(微壓力異常時自動降功率)
即使單個儀表故障,系統仍可通過其他層級繼續監測,確保無盲點。
❓ Q16: 三層監測的電源需求是多少?
非常低,通常 < 50W。
- 儀表本身:4-20mA 環路動力(自給自足,無外部電源)
- HART 集線器:24V DC, < 20W
- Modbus 閘道:24V DC, < 30W
整套系統可由標準 24V UPS 供電,斷電時仍可工作 4-8 小時。
❓ Q17: 建設新液冷資料中心時,何時應該採購監測系統?
設計階段(越早越好)。
原因:
- ✅ 可在施工時同步安裝儀表接頭,避免後期開挖管道
- ✅ BMS 軟體可同步開發,無需事後整合
- ✅ 可從運行第一天就收集監測數據,建立「正常運行基線」
- ❌ 後期改造成本是設計階段的 3-5 倍
ATLANTIS 免費提供「設計階段諮詢」,協助您優化監測點佈置。
❓ Q18: 液冷系統的「水質監測」需要額外設備嗎?
是的,但是可選配。
基礎監測(壓力、流量、溫度)已可診斷大多數故障。 進階監測可加入:
- 導電度傳感器(監測液體污染度 ISO 4406)
- 顆粒計數器(監測懸浮微粒含量)
- 水分含量傳感器(監測液體吸濕程度)
月度液質分析報告可幫助精準判斷「何時該更換冷卻液」,從而優化維護成本。
❓ Q19: 我可以「只監測不告警」嗎?
可以,但不推薦。
僅「記錄數據」而不「自動告警」相當於「有眼睛但沒神經」。 您仍需手動定期檢查日誌,無法達到「2-5 分鐘早期預警」的目標。
推薦最低配置:
- ✅ 儀表 + 基本 BMS 集成 + Email/簡訊告警
- ✅ 成本增加不到 20%,但應急能力提升 10 倍
❓ Q20: 三層監測系統是否符合「GreenDataCenter」或「ISO 50001」標準?
完全符合。
因為:
- ✅ 減少故障停機 → 提升能源利用率 (PUE 優化)
- ✅ 預知性維修 → 減少資源浪費
- ✅ 數據記錄可追溯 → 符合 ISO 審計要求
若您計劃申請綠色資料中心認證,三層監測的技術驗證報告可作為申報文件的重要支撐。
結論:三層監測是液冷的必須配置
液冷技術賦予了資料中心前所未有的散熱能力和能源效率, 但也帶來了新的複雜性和風險——一次故障可能導致 NT$1,000 萬級別的損失。
三層監測架構(壓力 + 流量 + 溫度)正是為了應對這種風險而設計的。 它將「被動應急」轉變為「主動預防」,將「90 分鐘停機」縮短為「15 分鐘修復」。
投資 NT$1.15M 的監測系統,換來 NT$3.66M 的年度節省,回本週期僅 3.2 個月。
準備好保護您的液冷系統了嗎?
業務一部 Ian | 電話:02-2820-3405 | ian@atlantis.com.tw
業務二部 Nori | 電話:02-2820-3405 | nori@atlantis.com.tw
官網: https://re-atlantis.tw
地址:台北市北投區致遠一路二段 109 號
傳真:02-2827-0646 / 02-2820-3406