AI 資料中心液冷系統完整監測指南:壓力、溫度、差壓、流量監測核心知識解析
前言:AI 時代電力危機與液冷革命
2024~2026 年,全球 AI 伺服器機房的電力消耗已成為數據中心營運的首大挑戰。單一台 NVIDIA H100 伺服器運算功耗可達 700W 以上,一個中等規模的 AI 訓練集群(100 台伺服器)瞬時消耗電力高達 70~150kW。這不僅推高營運成本,更給散熱系統帶來前所未有的壓力。
傳統風冷散熱系統(Air Cooling)已無法滿足 AI 工作負載需求。根據業界調查,液冷技術(Liquid Cooling)能降低 40~60% 的散熱功耗,成為 AI 資料中心必選方案。但液冷系統的複雜性也隨之增加——系統內的壓力波動、溫度梯度、流量不均、冷凝液管路堵塞等問題,若未及時監測預警,將造成伺服器宕機、數據丟失、冷卻液泄漏等重大故障。
本文透過 ATLANTIS 昶特 30 年工業監測經驗,為您深度解析 AI 資料中心液冷系統的監測需求、儀表選型、成本效益,以及如何透過精密監測系統避免故障、優化營運效率。
第一章:AI 資料中心液冷系統架構與監測點剖析
1.1 液冷系統基本構成與工作原理
AI 資料中心的液冷系統主要由以下組件組成:
- 冷卻液循環迴路 — 從水冷機組供應冷卻液(通常為蒸餾水或專用冷卻液),經過伺服器冷卻塊吸收熱量,再返回冷卻主機進行換熱
- 冷卻液泵浦系統 — 維持系統內冷卻液的持續流動,通常採用變頻泵或恆速泵
- 熱交換器(Chiller) — 將吸收的熱量排放到環境或回收至冷卻水塔
- 管路與接頭 — 傳輸冷卻液,需承受工作壓力與溫度循環應力
- 隔膜膨脹罐 — 補償冷卻液溫度變化引起的體積膨脹,維持系統壓力穩定
- 過濾器與冷凝捕獲裝置 — 防止污染物進入系統,保護精密冷卻塊
液冷系統工作原理:冷卻液在泵浦推動下,以 0.5~2.0 m/s 的流速流經伺服器冷卻塊,吸收 CPU/GPU 散發的熱量(通常溫度上升 5~15°C),隨後進入冷卻主機(Chiller),透過製冷劑迴圈或冷卻水塔與環境進行熱交換,冷卻後的液體再次回到循環迴路。整個過程需要精準監測各個環節的壓力、溫度、流量變化,以確保系統穩定運行。
1.2 必須監測的 8 個關鍵點
根據 ATLANTIS 在 50+ AI 資料中心案例的經驗,液冷系統應至少監測以下 8 個位置:
| 監測點位置 | 監測參數 | 標準範圍 | 故障預警閾值 | 儀表類型 |
|---|---|---|---|---|
| 泵浦進口(吸入端) | 壓力、溫度 | 0.1~0.5 bar,20±2°C | <0 bar 或 >0.3 bar | 壓力錶、溫度計 |
| 泵浦出口(壓送端) | 壓力、溫度、流量 | 1.5~3.0 bar,20±2°C | >3.5 bar 或流量 -20% | 壓力錶、溫度計、流量計 |
| 伺服器冷卻塊進口 | 溫度、流量 | 15~25°C,穩定流量 | 溫度上升 >5°C,流量下降 >10% | 溫度計、流量計 |
| 伺服器冷卻塊出口 | 溫度 | 25~35°C | >40°C | 溫度計 |
| 熱交換器進口 | 溫度、壓力 | 30~40°C,2.0~3.0 bar | >45°C,>3.5 bar | 溫度計、壓力錶 |
| 熱交換器出口 | 溫度 | 15~25°C | <10°C 或 >30°C | 溫度計 |
| 差壓監測(進出口間) | 差壓 ΔP | 0.5~2.0 bar | >2.5 bar(堵塞) | 差壓計 |
| 隔膜膨脹罐 | 壓力、溫度 | 靜態 0.8 bar,動態 1.0~1.5 bar | <0.5 bar 或 >2.0 bar | 壓力錶、溫度計 |
1.3 關鍵監測參數的物理意義
壓力(Pressure) — 液冷系統內冷卻液作用於管壁、泵浦、冷卻塊的垂直應力,單位 bar(巴)或 psi。正常液冷系統工作壓力:1.5~3.0 bar。壓力過高(>3.5 bar)可能指示:管路堵塞、泵浦轉速過高、冷凝液未正常排放。壓力過低(<0.5 bar)則表示:洩漏、空氣進入、膨脹罐失效。
溫度(Temperature) — 冷卻液分子動能的量化表現,直接反映伺服器散熱效果。AI 伺服器冷卻液進口溫度應控制在 15~25°C,出口溫度應不超過 35°C。若進口溫度升至 30°C 或出口溫度超過 40°C,表示冷卻效能下降,可能導致 CPU 節流(Thermal Throttling)、運算性能下降。
差壓(Differential Pressure, ΔP) — 液冷系統進出口間的壓力差,反映系統阻力大小。正常差壓範圍 0.5~2.0 bar。差壓過高(>2.5 bar)通常意味著:過濾器堵塞、冷卻塊內積垢、泵浦老化。定期監測差壓變化趨勢,可提前預警維護需求。
流量(Flow Rate) — 單位時間內通過管路的冷卻液體積,單位 L/min 或 m³/h。流量與冷卻效率成正相關:流量愈高,單位時間內帶走的熱量愈多。但過高的流量會增加泵浦功耗與管路應力。AI 資料中心液冷系統流量通常 50~200 L/min。流量下降 >10% 需立即檢查是否有內漏。
第二章:AI 伺服器尖峰負荷分析與監測臨界值
2.1 典型 AI 工作負載的熱產生特徵
不同 AI 應用場景產生的熱量差異巨大。以下為常見 AI 工作負載的功耗和散熱特性:
| AI 應用場景 | 單卡功耗 (W) | 集群規模 | 瞬時總功耗 (kW) | 冷卻液流量需求 (L/min) | 溫度上升 (°C) |
|---|---|---|---|---|---|
| 大語言模型訓練 (LLM Training) | 700~800 | 100~500 卡 | 70~400 | 150~300 | 8~15 |
| 推理服務 (Inference) | 300~400 | 100~1000 卡 | 30~400 | 80~150 | 4~8 |
| 圖像生成 (Diffusion Model) | 400~600 | 50~200 卡 | 20~120 | 100~200 | 6~12 |
| 科學計算 (Scientific Computing) | 600~750 | 50~300 卡 | 30~225 | 120~250 | 7~14 |
| 邊界計算 (Edge Inference) | 50~150 | 10~50 卡 | 0.5~7.5 | 20~50 | 2~4 |
關鍵觀察:LLM 訓練和科學計算應用是最高功耗場景,瞬時熱產生可達 400kW。液冷系統必須能應對這種尖峰負荷,否則溫度會在數分鐘內快速上升,觸發熱節流,進而導致模型訓練中斷。
2.2 監測臨界值設定與故障預警邏輯
ATLANTIS 建議的監測臨界值設定(基於 50+ 案例經驗):
正常運行區間(Green Zone)
- 進口溫度:18~24°C
- 出口溫度:28~36°C
- 系統壓力:1.8~2.8 bar
- 差壓(整體):0.8~1.8 bar
- 流量:維持±5% 以內
預警區間(Yellow Zone) — 需要監測但不立即停機
- 進口溫度:24~28°C
- 出口溫度:36~40°C
- 系統壓力:2.8~3.2 bar 或 1.3~1.8 bar
- 差壓:1.8~2.3 bar(過濾器可能開始堵塞)
- 流量下降:-10% ~ -15%
告急區間(Red Zone) — 需立即介入
- 進口溫度:>28°C
- 出口溫度:>40°C
- 系統壓力:>3.5 bar 或 <1.0 bar
- 差壓:>2.5 bar(立即清洗或更換過濾器)
- 流量下降:>-20%(泵浦故障或重大堵塞)
2.3 實時監測與 IoT 雲端告警系統
僅有靜態監測(指針或數位壓力錶)已不符合 AI 資料中心的運營需求。業界最佳實踐是建立實時 IoT 監測系統,將壓力、溫度、流量感測器的訊號傳送至雲端平台(如 AWS IoT Core),透過 Lambda 函數實現毫秒級告警:
- 正常工作期間每秒採樣一次
- 一旦進出口溫度差超過 12°C 或壓力異常,立即觸發推播通知、郵件告警、簡訊預警
- 透過 CloudWatch 儀表板實時監控 50+ 個冷卻塊、100+ 個監測點的狀態
- 基於歷史數據進行預測性維護:若差壓趨勢線每天上升 0.05 bar,系統自動預估 7 天後將超過 2.5 bar 臨界值,提前 5 天通知維護團隊清洗過濾器
第三章:AI 資料中心液冷完整儀表清單與配置指南
3.1 壓力錶選型完整指南
液冷系統壓力監測通常需要 3~4 支壓力錶,分別監測:泵浦進出口、Chiller 出口、差壓。以下為選型要點:
| 測量位置 | 推薦量程 | 精度等級 | 結構類型 | 接頭規格 | 材質要求 |
|---|---|---|---|---|---|
| 泵浦進口(低壓區) | 0~0.6 bar | 1.6% (Class 2.5) | 指針式或數位 | M16×2 或 1/4"NPT | 黃銅+不鏽鋼內件 |
| 泵浦出口(工作區) | 0~4 bar 或 0~6 bar | 1.6% (Class 1.6) 或 1% (Class 1.0) | 指針式(推薦)或數位 | M16×2 或 1/4"NPT | 全不鏽鋼 SUS 304 |
| Chiller 出口 | 0~4 bar | 1.6% | 指針式或數位 | M16×2 | 不鏽鋼 304 |
| 差壓監測(進出口間) | 0~2.5 bar 或 0~3.5 bar | 1.6% 或 2.5% | 差壓計(膜式或活塞式) | 雙管接頭 1/4"NPT | 不鏽鋼 304 或膠木件 |
精度等級說明:Class 1.6 表示錶盤量程的 ±1.6% 誤差;Class 1.0 則為 ±1%。液冷系統建議採用至少 1.6 級精度的壓力錶,確保監測數據可信度。
關鍵選型訣竅:
- 泵浦進口應採用低量程錶(0~0.6 bar),因為該區域壓力最低(通常 0.1~0.3 bar);若誤用工作區錶(0~4 bar),指針動作範圍只佔刻度 10%,精度急劇下降
- 泵浦出口應採用0~4 bar 或 0~6 bar 錶,精度應 ≥1.6%,便於精確監測工作壓力波動
- 差壓計必須採用隔膜或活塞式結構,避免一般液柱式差壓計易洩漏、不耐壓的問題
- 所有接觸冷卻液的內件應採用不鏽鋼 304 或更高規格,避免銅合金與某些冷卻液(如乙二醇)產生電化學腐蝕
3.2 溫度計/傳送器選型
液冷系統需要 4~6 支溫度計/傳送器,監測進出口、冷卻塊進出、膨脹罐。選型要點:
| 測量位置 | 溫度範圍 | 傳感器類型 | 精度 | 應用優勢 |
|---|---|---|---|---|
| 系統進出口(通常液體區) | 0~60°C | RTD Pt100 或熱電阻 NTC | ±0.5°C 或更佳 | 響應快、精度高、成本合理 |
| 冷卻塊進出口(高精度要求) | 10~50°C | RTD Pt100 或高精度 NTC | ±0.2°C | 精確計算熱交換效率,檢測內部堵塞 |
| 膨脹罐監測 | 0~60°C | 簡易溫度計或 RTD | ±1°C | 監測膨脹罐工作溫度,預警洩漏 |
| 冷卻機組出口(如 Chiller) | 0~40°C | RTD Pt100 | ±0.3°C | 監測冷卻機主出水溫度,故障診斷 |
RTD vs 熱電偶對比:液冷系統建議優先選用 RTD(Resistance Temperature Detector)如 Pt100,因為:精度 ±0.1~0.5°C(遠優於熱電偶的 ±1~2°C)、線性度好、便於 4-20mA 訊號轉換。僅在需監測極端高溫(>100°C)的場景才考慮熱電偶。
3.3 流量計選型
流量監測是液冷系統的靈敏指標——流量異常往往比溫度異常更早出現。建議在泵浦出口安裝至少 1 支流量計:
| 流量計類型 | 量程範圍 | 精度 | 優缺點 | 典型價格帶(報價制) |
|---|---|---|---|---|
| 渦輪式流量計 (Turbine) | 5~300 L/min | ±1~2% | 精度高、反應快、但易受雜質影響 | 中等 |
| 電磁流量計 (Magnetic) | 5~500 L/min | ±0.5~1% | 無活動部件、抗污性好,但成本較高 | 較高 |
| 超音波流量計 (Ultrasonic) | 0.5~300 L/min | ±2~3% | 無壓損、可外夾式安裝,調試簡單 | 中等 |
| 可視窗流量計 (Sight Glass) | 20~500 L/min | ±5% | 成本低、方便快速估算,但精度較低 | 低 |
推薦配置:泵浦出口安裝電磁或渦輪式流量計(精度 ±1%),定期(每月)對比流量趨勢;若發現流量下降 >10%,立即清洗過濾器或檢查泵浦。
3.4 完整監測系統配置清單
以一個 100 台伺服器的 AI 資料中心液冷系統為例,完整監測配置應包括:
| 儀表名稱 | 數量 | 規格 | 監測點位置 | 用途 |
|---|---|---|---|---|
| 壓力錶(0~0.6 bar) | 1 | Class 2.5, M16×2 | 泵浦進口 | 檢測吸入口真空、是否進氣 |
| 壓力錶(0~4 bar) | 2 | Class 1.6, 不鏽鋼, M16×2 | 泵浦出口、Chiller 出口 | 監測工作壓力、堵塞預警 |
| 差壓計(0~2.5 bar) | 1 | 膜式或活塞式, Class 1.6 | 進出口差壓監測 | 過濾器堵塞提早預警 |
| 溫度計/傳送器(RTD Pt100) | 5 | ±0.3°C, 0~60°C | 進口、出口、冷卻塊進/出、膨脹罐 | 溫度監測、熱效率計算 |
| 流量計(電磁或渦輪式) | 1 | ±1%, 50~250 L/min | 泵浦出口 | 流量異常早期診斷 |
| 4-20mA 訊號轉換器 | 4 | 0~4 bar 或 0~60°C | 與監測主機連接 | 數位化訊號輸出 |
| 無線溫度/壓力傳送器(IoT) | 3 | WiFi 或 LoRaWAN | 冷卻塊群組、備用監測點 | 雲端即時監控、告警 |
第四章:ATLANTIS 昶特 AI 資料中心液冷監測完整方案
4.1 ATLANTIS 30 年液冷監測經驗
昶特有限公司於 1992 年創立,是台灣少數擁有 30 年工業儀表製造經驗的專業廠商。在液冷系統監測領域,ATLANTIS 已服務超過 50+ 個 AI 資料中心項目,涵蓋:
- 大型科技公司機房 — 單機房規模 500~2000 台伺服器的液冷系統設計與監測
- 高效能運算(HPC)集群 — 科學計算、氣象預報、金融模型等應用的冷卻液監測
- 邊界計算中心 — 5G 基地台機房、IoT 感測器集中監控點的小型液冷系統
- 二手伺服器回收廠 — 維護與測試環節中的液冷耗材監控
ATLANTIS 的核心競爭力在於:
✓ 自主研發 TAF 認可校正實驗室 — 每支壓力錶、溫度計出廠前均經逐支檢定,確保精度符合 ISO 8846 國際標準
✓ 完整的 SUS 304 不鏽鋼產品線 — 針對液冷系統常見的冷卻液類型(蒸餾水、乙二醇混合液、專用液體冷卻劑),提供耐腐蝕、長壽命的儀表方案
✓ 快速交付與技術支援 — 台灣在地現貨庫存,3 天快速交付;24/7 技術熱線支援,遇到故障可立即線上診斷
✓ IoT 整合能力 — 與 AWS IoT Core 深度整合,提供端到端的壓力溫度監測雲端解決方案
✓ 30 年經驗報價制服務 — 根據實際應用場景量身定制方案,提供無憂的報價與售後
4.2 ATLANTIS 推薦的 AI 資料中心監測方案架構

圖 1:ATLANTIS AI 資料中心液冷系統監測完整架構 — 從感測器采集到雲端告警的端到端方案
ATLANTIS 建議的方案架構分為三層:
第一層:現場儀表層(Physical Layer)
- 壓力錶(4~5 支)— 監測泵浦進出、Chiller、差壓
- 溫度計/RTD Pt100(5~6 支)— 監測冷卻液溫度梯度
- 流量計(1~2 支)— 監測泵浦出口與主管路流量
- 所有儀表均為 ATLANTIS 自有品牌,全不鏽鋼構造,精度 Class 1.6 或更佳
第二層:訊號採集層(Acquisition Layer)
- 4-20mA 轉換模組 — 將指針錶轉換為標準訊號(可選)
- 壓力/溫度傳送器 — ATLANTIS 自有開發的 4-20mA 或 0-10V 訊號輸出壓力傳送器
- 無線 IoT 感測器 — WiFi 或 LoRaWAN 連接,每秒採樣一次
第三層:雲端監控層(Cloud Layer)
- AWS IoT Core — 接收儀表訊號,MQTT 協定標準傳輸
- Lambda 函數 — 實時數據處理、臨界值判斷、自動觸發告警
- DynamoDB 資料庫 — 儲存 30 天內的監測數據,支持趨勢分析
- CloudWatch 儀表板 — Web 介面實時監看 50+ 個監測點
- SNS/郵件告警 — 一旦進出口溫度差超過 12°C,立即推播手機通知、發送告警郵件
4.3 ATLANTIS 核心產品介紹
ATLANTIS 專為 AI 資料中心液冷系統打造的產品系列:

圖 2:ATLANTIS 全不鏽鋼液冷專用壓力錶 — SUS 304 構造,耐腐蝕、高精度
1. ATLANTIS 全不鏽鋼壓力錶(液冷專用型)
- 量程:0~0.6 bar(進口)、0~4 bar(工作區)、0~6 bar(高壓備用)
- 精度:Class 1.6 (ISO 8846 認證)
- 材質:SUS 304 全不鏽鋼外殼 + 內件
- 接頭:M16×2 或 1/4"NPT,適配全球標準液冷管路
- 特色:30 年液冷工程經驗微調的刻度設計,讀數準確且便於快速判斷異常
- 保障:每支附 TAF 認可校正報告、材質證明書、2 年保固

圖 3:ATLANTIS 4-20mA RTD 溫度傳送器 — 精度 ±0.3°C,直接連接監控主機
2. ATLANTIS 4-20mA RTD 溫度傳送器(液冷型)
- 感測器:Pt100 RTD,精度 Class A (±0.15°C @ 0°C)
- 量程:-20~80°C(可定制 0~60°C)
- 輸出:4-20mA 標準工業訊號
- 安裝方式:直插液冷管路,或以 1/2"NPT 浸管式探頭
- 防護等級:IP67 防水,適合潮濕的機房環境
- 特色:ATLANTIS 自主開發的信號調理電路,抗干擾能力強,精度在工業現場條件下仍能達 ±0.5°C
- 保障:工廠校定報告隨貨附送,支持免費二年內重新校正

圖 4:ATLANTIS 隔膜式差壓計 — 0~2.5 bar,專為液冷過濾器監測設計
3. ATLANTIS 隔膜式差壓計(過濾器監測型)
- 類型:膜式差壓計,避免液柱式的洩漏風險
- 量程:0~2.5 bar、0~3.5 bar(可選)
- 精度:Class 1.6
- 接頭:雙管接頭 1/4"NPT,直接連接過濾器進出端
- 材質:不鏽鋼 304 外殼 + 膠木件(耐液體腐蝕)
- 特色:刻度特別標示「清洗閾值」(通常 2.0 bar),讓現場人員快速辨識何時需清洗
- 保障:TAF 認可校正,出廠報告齊全
4. ATLANTIS WiFi 無線壓力/溫度傳送器(IoT 型)
- 連接:WiFi 802.11ac,支持 2.4G 與 5G 雙頻
- 採樣率:1 Hz~1 kHz(可配置)
- 電池續航:AAA ×2,正常運行 12~18 個月
- 雲端連接:原生支持 AWS IoT Core,一鍵配置
- 告警觸發:可在本地設置臨界值,超限時立即推播到手機 App
- 防護:IP68 等級,可浸沒在液體中監測(無壓損傳感器版本)
- 特色:ATLANTIS 自主開發的 IoT 固件,支持 OTA 韌體更新、本地存儲 30 天離線數據、多設備遠程管理
4.4 典型項目成本效益分析
以 100 台伺服器的 AI 資料中心液冷系統為例,ATLANTIS 完整監測方案的投資成本與回報:
初期投資(一次性)
- 儀表購置(壓力錶、溫度計、差壓計、流量計)— 報價制
- 訊號轉換與 IoT 模組 — 報價制
- AWS IoT Core 與雲端配置 — 報價制
- 安裝與調試 — 技術服務費用
- 總投資:根據具體需求報價
年度運營成本
- AWS 雲端服務費用 — 每月約 NT$5,000~15,000(取決於採樣頻率與數據保留期限)
- 儀表維護與校正 — 年度 2 次校定,每支約 NT$1,500~2,500
- 技術支援與遠程診斷 — 24/7 待命(可選付費服務)
- 年度成本:約 NT$100,000~200,000
預期效益(年度)
- 故障預防 — 提前 7~14 天預警冷卻液洩漏、泵浦故障、過濾器堵塞,避免宕機損失。每次非計畫停機損失約 NT$100,000~500,000(訓練中斷、硬體損傷、客戶賠償),年均預防 2~4 起故障 ≈ 效益 NT$200,000~2,000,000
- 能效優化 — 基於監測數據動態調整泵浦轉速、Chiller 設定,降低冷卻功耗 10~15% ≈ 年度節省 NT$200,000~500,000
- 維護成本降低 — 從被動維修改為預測性維護,減少緊急搶修費用 ≈ 年度節省 NT$50,000~150,000
- 合計年度效益(保守估計):NT$450,000~2,650,000
投資回報期(ROI):根據上述分析,完整監測系統的投資回報期通常為 6~18 個月,此後每年持續產生利潤。對於關鍵業務(如 AI 模型訓練、金融計算),預防一次宕機的價值已遠超全年監測成本。
第五章:AI 資料中心液冷導入真實案例研究
5.1 案例一:北台灣大型 AI 訓練集群(100 伺服器規模)
背景與挑戰
一家專注於自然語言模型研發的新創公司,2024 年初建設了一個 100 台 NVIDIA H100 伺服器的 AI 訓練集群。初期採用風冷系統(Air Cooling),但在進行長時間大規模模型訓練時發現以下問題:
- 機房溫度長期維持 28~35°C,冷氣費用佔總電費的 45%
- CPU 節流(Thermal Throttling)導致訓練速度下降 15~20%
- 硬體故障率高,每月平均 3~5 台伺服器因過熱而需替換
- 難以精確預測系統故障時機,被動式維護導致生產中斷
ATLANTIS 的解決方案
2024 年 Q2,該公司與 ATLANTIS 合作導入完整的液冷監測系統:
- 硬體配置:5 套獨立的液冷迴路,每套服務 20 台伺服器。共安裝 15 支 ATLANTIS 壓力錶、12 支溫度傳送器、3 支差壓計、2 支流量計
- 軟體配置:與 AWS IoT Core 連接,部署自動監控儀表板,設置溫度、壓力、流量三維告警邏輯
- 技術支援:ATLANTIS 現場派駐技術員 2 週進行系統調試與人員培訓
導入成果(6 個月後測量)
| 指標 | 導入前 | 導入後 | 改善幅度 |
|---|---|---|---|
| 機房平均溫度 | 32°C | 22°C | ↓ 31% |
| 冷卻系統耗電量 | 45 kW(冷氣) | 12 kW(液冷泵浦) | ↓ 73% |
| 伺服器月均故障數 | 3~5 台 | 0.2 台(偶發) | ↓ 94% |
| 訓練速度(吞吐量) | 100%(基線) | 118%(無節流) | ↑ 18% |
| 非計畫停機時數(年度) | 約 120 小時 | 約 8 小時 | ↓ 93% |
| 技術人員維護工時(週均) | 40 小時 | 8 小時 | ↓ 80% |
財務影響分析
年度成本節省
- 冷卻電費節省:(45 - 12) kW × 8,760 h × NT$3/kWh ≈ NT$865,440
- 硬體故障降低:換機成本 NT$400,000/台,年度減少故障 31 台 ≈ NT$12,400,000
- 技術維護減少:每小時人力成本 NT$800,年度節省 32 小時/週 × 50 週 ≈ NT$1,280,000
- 訓練效率提升:吞吐量增 18%,相當於額外運算資源 ≈ NT$3,600,000(按新增 18 台伺服器成本計
- 合計年度效益:約 NT$17,745,440
投資成本
- 儀表與硬體購置:報價制
- 系統集成與調試:報價制
- AWS 雲端年費:約 NT$150,000
- 年度維護與校正:約 NT$80,000
- 合計年度投資:根據報價制確定
ROI 評估:基於上述保守估計,該公司的投資回報期不超過 3 個月。此後每年持續產生 NT$1,700 萬左右的淨利潤貢獻。
5.2 案例二:科學計算中心(HPC 集群,500 卡規模)
背景與挑戰
位於中台灣的一個公立科研機構的 HPC 中心,運行天氣預報、分子模擬、流體力學計算等耗密集型任務。該中心 2023 年升級為液冷系統,但缺乏有效的監測手段,導致:
- 2024 年上半年發生 3 次嚴重故障,其中 2 次因冷卻液洩漏導致關鍵計算中斷 48 小時
- 無法預測冷卻液何時需更換、過濾器何時該清洗,只能定期大規模維護(每季度一次),浪費時間與資源
- 高層壓力大,希望建立"預測性維護"系統,實現"零宕機"目標
ATLANTIS 的解決方案
該中心與 ATLANTIS 在 2024 年 Q3 簽約,導入分階段的監測系統:
- 第一階段(1 個月):安裝 8 支 ATLANTIS 差壓計監測各區域冷卻塊進出口,快速識別堵塞位置
- 第二階段(2 個月):補充溫度傳送器與壓力錶,建立完整的 20 點監測網絡
- 第三階段(3 個月):集成 AWS IoT 雲端告警,實現 24/7 無人值守監控
導入成果(9 個月後)
- 故障預警提前期:從"被動應對"改為"提前 7~14 天預警"。例如,差壓計顯示 1.8 bar 時主動清洗過濾器,避免了 2.5 bar 才發現堵塞的被動局面
- 非計畫停機減少:從每半年 1~2 次嚴重故障減為 9 個月零宕機
- 冷卻液更換週期優化:基於溫度趨勢與酸鹼值監測,將原先每 6 個月強制更換改為按需更換(實際延長至 12~15 個月),年度節省液體成本 NT$200,000~300,000
- 維護工時效率:從傳統的每週 20 小時抽樣式檢查改為基於告警的精準維護,週均工時降至 5 小時
5.3 案例三:邊界計算中心(20 台伺服器,成本敏感型)
背景與挑戰
位於北部的 5G 基地台運營商,部署了小型邊界計算中心用於 AI 推理(物體檢測、目標跟蹤)。成本壓力大,原本希望只用風冷,但發現:
- 基地台機房空間狹窄,風冷需要額外的冷氣機,佔用寶貴的 19 吋 機櫃空間
- 改用液冷後空間節省 60%,但對監測系統的成本敏感
- 希望找到"價廉且可靠"的監測方案
ATLANTIS 的解決方案
ATLANTIS 為該客戶量身定制了"精簡版"監測方案:
- 只安裝 3 支 ATLANTIS 壓力錶(進口、出口、差壓)
- 2 支溫度計監測進出口溫度差
- 無 IoT 模組,改用每週 1 次的人工巡檢記錄(由基地台巡檢員完成,無額外人力成本)
- ATLANTIS 提供年度 1 次遠程診斷服務,透過郵件/視訊分析 12 個月的監測數據
導入成果(12 個月後)
- 硬體成本:大幅低於預期,投資不到 NT$100,000
- 無宕機運行:12 個月零故障,儘管監測頻率低但儀表精度足以提前察覺異常
- 應用場景推廣:基於成功案例,該運營商決定在 8 個其他基地台複製此方案,大幅降低邊界計算中心的監測成本
第六章:AI 資料中心液冷監測常見問答(20 個 FAQ)
❓ Q1:為什麼 AI 資料中心一定要監測液冷系統的壓力、溫度、差壓?不能只看溫度嗎?
答:液冷系統是一個複雜的物理系統,各參數之間存在因果關係。單看溫度是危險的:
- 溫度異常通常出現晚 — 當溫度升高時,故障已經進行 1~2 小時。但壓力異常(如過濾器堵塞導致差壓上升)會更早出現
- 溫度升高的原因多樣 — 可能是冷卻液洩漏(壓力告訴你答案)、泵浦故障(流量會下降)、or 冷卻機故障(回水溫度會上升)。只看溫度無法定位根本原因
- 多參數監測才能實現預測性維護 — 差壓趨勢上升 0.05 bar/天 ≈ 7 天後堵塞 ≈ 提前 7 天通知清洗,避免緊急停機
❓ Q2:指針式壓力錶和數位壓力錶哪個更適合液冷系統?
答:兩者皆有用途,通常結合使用:
- 指針式壓力錶(優勢):無需電源、可靠性高、成本低廉、現場快速判斷。缺點:無法遠程傳輸、無歷史記錄
- 數位壓力錶(優勢):4-20mA 訊號輸出、可連接 IoT 平台、精度通常更高。缺點:需要電源、成本較高、故障排查複雜
- 推薦配置:現場安裝指針錶作為"視覺告警",同時配置 1~2 支數位傳送器用於遠程監控與數據記錄。當指針異常時,可即時查看數位數據確認,加快故障診斷
❓ Q3:液冷系統的標準工作壓力是多少?
答:無統一標準,取決於系統設計:
- 典型 AI 資料中心液冷系統:1.5~3.0 bar(泵浦出口)
- 高效能冷卻(如某些高端伺服器冷卻塊):3.0~5.0 bar
- 低壓系統(邊界計算或小型中心):0.5~1.5 bar
- 最重要的是:了解自己系統設計的正常工作壓力區間,監測偏離值。例如,若設計壓力是 2.0 bar,突然升至 3.2 bar,即便仍在安全範圍內,也應查找原因(通常是堵塞)
❓ Q4:差壓計的「臨界值」應該設在多少?
答:差壓臨界值設定很關鍵,設定不當會導致頻繁誤告警:
- 新系統啟動時:前 2 週每日記錄差壓值(通常 0.5~0.8 bar),建立基線
- 預警閾值:設在基線上升 50%,即基線 0.8 bar + 50% = 1.2 bar
- 告急閾值:設在基線上升 100%~150%,即 1.6~2.2 bar。此時應計畫在近期清洗過濾器
- 危急閾值:2.5 bar 以上,此時應立即停止運算、清洗過濾器,避免泵浦過載
- 避免高敏感度設定:若設在 0.3 bar,會導致每小時告警一次(虛報),人員疲勞導致最終忽視真實告警
❓ Q5:溫度計應該裝在冷卻塊進口還是出口?為什麼要同時監測兩個?
答:應該同時安裝在進出口,缺一不可:
- 進口溫度:監測冷卻機的工作效率。若進口溫度持續上升(從 18°C 升至 26°C),表示冷卻機效能下降或環境溫度升高
- 出口溫度:監測伺服器的實時散熱情況。若出口溫度超過 40°C,表示 CPU/GPU 運算負荷過高或冷卻塊內結垢
- 溫度差(ΔT):進出口溫度差是衡量系統效率的金指標。正常 ΔT = 10±2°C。若 ΔT 突然升至 15°C,表示冷卻液流速不足(泵浦故障或堵塞)or 散熱負荷突增
- 單點監測的危害:若只看進口溫度(如 20°C),可能誤以為系統正常,其實 CPU 已經熱節流(出口 45°C)
❓ Q6:流量計需要監測嗎?壓力錶和溫度計是否足夠?
答:強烈建議監測流量,這是最敏感的故障指標:
- 流量是早期預警信號 — 當過濾器開始堵塞時,流量下降發生在壓力上升之前。例如,流量下降 3% 時差壓仍在 0.8 bar(正常),再過 2 天差壓才升至 1.5 bar(預警)。提前 2 天察覺可避免緊急停機
- 泵浦故障最直接的表現 — 泵浦出現內漏或軸承磨損時,首先表現為流量下降,其次才是壓力波動與噪聲
- 成本考量 — 流量計成本約 NT$5,000~15,000(報價制),若能提前預防一次宕機(損失 NT$100,000~500,000),投資效益遠超成本
- 推薦配置 — 至少在主泵浦出口安裝 1 支流量計,配合差壓計形成"雙重預警"
❓ Q7:使用 AWS IoT 監控液冷系統的成本有多高?
答:AWS IoT 成本取決於數據量,可相對控制:
- 基本費用:AWS IoT Core 連接費(每個設備 USD $0.08/月)+ 訊息費(每百萬則訊息 USD $1 = 每月 1 元台幣)
- 100 個監測點,每秒採樣一次的成本估算:
- 月度訊息量:100 × 86,400 秒 × 30 天 ≈ 259 億則訊息 ≈ USD $25,900/月(約 NT$777,000/月)
- 這太高了!改為每 10 秒採樣一次:259 億 ÷ 10 ≈ USD $2,590/月 ≈ NT$77,700/月
- 再改為每分鐘採樣一次:259 億 ÷ 60 ≈ USD $432/月 ≈ NT$12,960/月
- 最佳實踐:高優先級監測點(進出口溫度、泵浦壓力)每 30 秒採樣;低優先級點(隔膜罐)每 5 分鐘採樣。實現"多層次監控",總成本降至 USD $800~1,500/月 ≈ NT$24,000~45,000/月
- 存儲成本:30 天歷史數據保留在 DynamoDB,按實際數據量計費,通常 NT$10,000~30,000/月
- 合計年度成本:約 NT$400,000~900,000,遠低於一次重大故障的損失
❓ Q8:液冷系統多久需要檢驗或重新校正壓力錶、溫度計?
答:根據台灣標準與國際慣例:
- 法規要求:ISO 8846(壓力錶校驗規範)建議每 12 個月校驗一次
- 高精度應用:若要求精度 ≥1.0 級(±1% 誤差),建議 每 6 個月校驗一次
- ATLANTIS 推薦:
- 工作區壓力錶(0~4 bar):每年 2 次校驗(上半年、下半年各一次)
- RTD 溫度計:每 12 個月校驗一次
- 差壓計:每 12 個月校驗一次
- 校驗費用:ATLANTIS TAF 認可校正實驗室,每支儀表 NT$1,500~2,500(報價制)
- 快速方案:簽約年度校驗合約(NT$80,000~150,000/年),ATLANTIS 每月上門 pick-up 儀表,統一送檢,3~5 天內送回,零停工時間
❓ Q9:冷卻液選擇對壓力錶、溫度計有什麼影響?需要特殊材質?
答:冷卻液種類會直接影響儀表選材:
- 蒸餾水(最常見):無腐蝕性,普通黃銅件可用,但易結垢,需加防垢劑。儀表可選黃銅或不鏽鋼
- 乙二醇混合液(30~50% 乙二醇 + 蒸餾水):具輕度腐蝕性,黃銅件長期暴露會腐蝕。必須選用 SUS 304 不鏽鋼內件
- 專用液體冷卻劑(如 3M Novec 或其他光學液體):具強腐蝕性,需 SUS 316 級以上不鏽鋼。普通儀表會在 6~12 個月內失效
- ATLANTIS 建議:購買儀表前告知冷卻液類型,ATLANTIS 會推薦合適的材質組合,通常加收 15~25% 材料費用(報價制),但能大幅延長儀表壽命
❓ Q10:過濾器堵塞時,差壓計會立即指示嗎?有時間延遲嗎?
答:差壓計指示基本無延遲,但堵塞過程是逐漸發生的:
- 時間線:
- Day 1:過濾網開始累積微粒,差壓 0.6 bar(無異常感覺)
- Day 5:微粒累積,差壓升至 1.0 bar,差壓計指針開始偏離正常位置
- Day 10:差壓 1.5 bar,現場人員如果每天檢查會發現異常
- Day 15:差壓 2.2 bar,溫度開始異常升高(流速變慢,熱交換效率下降)
- Day 20:差壓 2.5 bar 以上,溫度升至 38°C,系統告急
- 差壓計的作用:不是"提前預警",而是"精準定位故障時機"。若能在 Day 10 清洗(差壓 1.5 bar),可避免 Day 20 的緊急停機
- 流量計的優勢:在 Day 5 就會檢測到流量下降 5%,相比差壓計提前 5 天預警
❓ Q11:如何快速判斷壓力異常是因為泵浦故障還是過濾器堵塞?
答:根據壓力和流量的組合變化診斷:
- 過濾器堵塞:差壓升高(進出口壓力差增大),但泵浦出口壓力保持穩定。流量開始下降。溫度升高
- 泵浦故障(轉速下降):泵浦出口壓力下降,但差壓基本不變。流量大幅下降。溫度快速升高
- 泵浦故障(內漏):泵浦出口壓力下降,流量大幅下降,但差壓反而下降(因為流速變慢)。溫度升高
- 快速診斷工具:ATLANTIS 可根據您提供的壓力、溫度、流量三點數據,透過遠程電話/郵件 30 分鐘內判斷故障根本原因
❓ Q12:液冷系統進口溫度應該維持多少度?有下限嗎?
答:進口溫度應在 15~25°C 最佳,溫度過低反而有害:
- 正常範圍:18~24°C,这给冷卻塊最大散熱空間
- 溫度過低的害處(<10°C):
- 冷卻液粘度上升,泵浦負荷增加,功耗上升 10~15%
- 與冷卻塊形成的溫度梯度過大(ΔT > 15°C),可能導致冷卻塊內產生熱應力而損傷
- 冷凝水風險 — 若進口液體溫度低於露點溫度,管路外壁會凝水,導致電氣短路
- 溫度過高的害處(>28°C):
- 散熱效率下降,CPU 節流,訓練速度下降
- 冷卻液膨脹加劇,隔膜罐壓力上升
- ATLANTIS 建議:設定預警閾值為進口溫度 > 26°C 或 < 12°C,告急閾值為 > 28°C 或 < 8°C
❓ Q13:ATLANTIS 壓力錶和國際進口品牌(如 WIKA)相比有什麼優勢?
答:昶特 ATLANTIS 的核心競爭力:
- 在地支援 — ATLANTIS 在台灣,遇到問題可當日上門診斷;進口品牌通常需要 2~4 週等待
- 快速交付 — ATLANTIS 台灣現貨庫存充足,3 天交付;進口品牌通常 1~2 個月
- 成本優勢 — ATLANTIS 報價制,可根據客戶預算靈活調整方案;進口品牌固定報價,議價空間小
- 定制能力 — ATLANTIS 可根據冷卻液特性、工作環境定制儀表;進口品牌通常提供標準型號
- 校驗便利 — ATLANTIS 自有 TAF 認可校正實驗室,年度校驗月費 NT$6,000~12,000;進口品牌需送回原廠,費用 2 倍以上且耗時
- 30 年深耕液冷領域 — ATLANTIS 對液冷系統的特殊需求(高精度、高可靠性、易維護)最了解
❓ Q14:液冷系統如何與 AWS IoT 或其他雲端平台整合?需要什麼技能?
答:整合通常分三層,ATLANTIS 可全程協助:
- 第一層(硬體):將壓力/溫度傳送器的 4-20mA 訊號接入 IoT Gateway(如 AWS Greengrass)or 樹莓派
- 第二層(通訊):IoT Gateway 透過 MQTT 協定將數據發送至 AWS IoT Core
- 第三層(應用):AWS Lambda 函數實時處理數據,CloudWatch 存儲,SNS 觸發告警
- 所需技能:基礎的 Linux/Python 知識即可。ATLANTIS 提供範例代碼(Python + AWS SDK),可直接部署
- ATLANTIS 服務:
- 1~2 天現場集成工作
- 雲端配置與 Lambda 函數開發(報價制)
- 後續 6 個月技術支援,遠程協助調試
❓ Q15:液冷系統的壓力錶、溫度計需要防爆認證嗎?
答:一般 AI 資料中心不需要防爆認證,但特殊行業需要:
- 不需要防爆:
- 常規 AI 訓練中心(冷卻液為蒸餾水或乙二醇,無爆炸風險)
- 科研 HPC 集群(室內環境,無危險氣體)
- 需要防爆(Class II/III Group D/E):
- 石油煉油廠內的 AI/HPC 集群
- 化工廠房的液冷系統
- 採礦現場的工業計算中心
- ATLANTIS 準備:雖然主要產品不含防爆認證,但可與 Ex 認證廠商合作,提供 ATEX/IECEx 認證版本(約 4~8 週交期,成本加價 30~50%)
❓ Q16:如何計算液冷系統的「熱負荷」和所需的「冷卻液流量」?
答:基本公式:熱負荷 Q = 流量 × 比熱 × 溫度差
- 例題:100 台 NVIDIA H100 伺服器,單台散熱 700W,希望進出口溫度差 ΔT = 10°C
- 總熱負荷 Q = 100 × 700W = 70 kW
- 冷卻液比熱(蒸餾水)c = 4.18 kJ/(kg·°C) ≈ 1 kcal/(kg·°C)
- 需要流量 = Q ÷ (c × ΔT) = 70 kW ÷ (4.18 kJ/(kg·°C) × 10°C) ≈ 1.67 kg/s ≈ 100 L/min
- 實際設計:計算結果 100 L/min,建議設計泵浦流量 150~200 L/min(留 50% 餘量應對尖峰負荷)
- 監測工具:ATLANTIS 流量計可實時監測實際流量是否達到設計值,若低於 10%,立即預警
❓ Q17:液冷系統啟動前需要做哪些測試?壓力錶、溫度計應該怎樣驗證?
答:標準的系統驗收流程(ATLANTIS 建議):
- Step 1:靜態壓力測試(系統未啟動)
- 關閉所有泵浦,填充冷卻液至設計體積
- 靜待 30 分鐘,壓力錶讀數應穩定在 0.8~1.0 bar(隔膜罐預充壓力)
- 若壓力持續下降,表示系統有洩漏,需修復
- Step 2:動態壓力/流量測試(泵浦啟動,50% 轉速)
- 啟動泵浦至 50% 額定轉速,監測 5 分鐘
- 壓力錶應穩定在 1.5~2.0 bar,流量計讀數應接近設計值的 50%
- 溫度計讀數應緩慢上升(每分鐘升 0.5~1°C),直至進出口溫度差達 10°C
- Step 3:滿負荷測試(泵浦啟動,100% 轉速)
- 升至 100% 轉速,監測 30 分鐘
- 壓力錶應穩定在 2.5~3.0 bar,流量計讀數達 100%
- 進出口溫度差穩定在 10°C,溫度穩定後波動應 < 0.5°C
- 所有儀表讀數應相對穩定(允許 ±2% 波動)
- Step 4:儀表驗證
- 對比多支相同型號壓力錶的讀數,偏差 < 2%(Class 1.6 精度要求)
- 對比溫度計讀數,偏差 < 0.5°C
- 若發現異常儀表,立即更換並補上原廠校驗報告
❓ Q18:液冷系統故障時,應該立即停機還是降速運行?
答:根據故障類型判斷,大多數情況建議降速而非立即停機:
- 可以繼續運行(降速 50%):
- 進口溫度 24~26°C(預警區間)— 降速可讓溫度下降 2~3°C
- 差壓 1.8~2.2 bar(過濾器輕度堵塞)— 流速變慢會降低堵塞風險
- 壓力 3.0~3.3 bar(輕度超壓)— 降速讓泵浦負荷下降
- 必須立即停機:
- 進口溫度 < 8°C(冷卻過度,冷凝水風險)
- 出口溫度 > 42°C(散熱失效)
- 壓力 > 3.5 bar 持續 5 分鐘未改善(泵浦超壓風險)
- 流量突然下降 > 30%(管路堵塞或斷裂)
- 發生可聞的異常聲音(泵浦軸承損傷)
- ATLANTIS 遠程診斷:若無法判斷,可拍照發送壓力/溫度數據至 ATLANTIS,30 分鐘內給出專業建議
❓ Q19:多久需要更換冷卻液?如何判斷冷卻液是否該更換?
答:冷卻液更換不是固定週期,而是基於質量判斷:
- 傳統做法:每 6 個月強制更換(保守但浪費)
- 科學做法(ATLANTIS 推薦):
- 每月檢測冷卻液 pH 值(正常 6.5~7.5),若降至 6.0 以下表示酸性升高,液體開始老化
- 每月檢測電導率(fresh water < 10 μS/cm),若升至 50 μS/cm 表示雜質累積
- 視覺檢查:若液體從透明變為渾濁或發黃,立即更換
- 當 pH 值降至 5.5 或電導率升至 100 μS/cm 時,安排更換(通常 9~18 個月)
- 監測好處:基於科學判斷,平均延長液體壽命 50%,年度節省液體成本 NT$200,000~400,000
- ATLANTIS 附加服務:可提供液體檢測試劑或簽年度檢測合約(每季送檢一次,結果報告郵送)
❓ Q20:如果儀表壞了,液冷系統還能運行嗎?有替代方案嗎?
答:儀表故障不會直接停止系統運行,但失去監測風險很大:
- 短期應急方案(最多 1~2 週):
- 移除故障儀表,用盲塞蓋住接頭(避免漏液)
- 依賴其他儀表(如溫度計)推測故障位置
- 增加人工巡檢頻率(每 4 小時一次)
- 降低運算負荷(降速 20~30%),降低對冷卻系統的應力
- ATLANTIS 快速替換:
- 電話通知後,台灣現貨 3 天交付
- 可代為安裝(上門費用報價制)
- 故障儀表可送檢,通常可修復(成本 NT$1,000~2,000),或直接更新(成本約 NT$5,000~15,000)
- 預防措施:建議選購備用儀表(各型號各 1 支),放在機房,故障時立即替換,無須等待交期
第七章:內部連結與相關資源
若需進一步深入理解 AI 資料中心的監測技術,ATLANTIS 官網提供以下相關文章與資源:
- ATLANTIS 液冷空調專區 — 涵蓋液冷系統原理、冷媒選型、監測案例 20+ 篇
- ATLANTIS 品牌故事 — 了解昶特 30 年製造經驗與行業地位
- ATLANTIS 產品完整目錄 — 壓力錶、溫度計、傳送器、隔膜式產品全覽
- ATLANTIS 校正與技術支援服務 — TAF 認可校正實驗室、遠程診斷、現場安裝
ATLANTIS 另提供以下免費資源:
- 液冷系統監測白皮書 — 下載 PDF,涵蓋完整的選型計算、安裝指南、故障診斷流程圖
- AWS IoT 整合範例代碼 — GitHub 開源專案,Python + Lambda 完整示例
- 在線選型工具 — 輸入應用場景、伺服器數量、冷卻液類型,系統自動推薦儀表配置
- 30 分鐘技術諮詢 — 免費預約 ATLANTIS 首席工程師,電話 / 視訊討論您的具體需求
結論與行動呼籲
AI 資料中心的興起已成為新時代能源消耗的重要驅動力。傳統的風冷散熱系統已無法滿足大規模 AI 訓練、科學計算的超高熱負荷需求。液冷技術雖然提供了 40~60% 的能效提升,但隨之而來的系統複雜性也對運營團隊帶來挑戰。
精密的壓力、溫度、差壓、流量監測系統不是「奢侈品」,而是「必需品」。根據 ATLANTIS 超過 50+ AI 資料中心的導入經驗,完整監測方案能夠:
- 將非計畫停機降低 90% 以上
- 將冷卻功耗降低 40~50%
- 將維護人力成本降低 70~80%
- 實現「預測性維護」,提前 7~14 天預警故障
- 投資回報期僅需 6~18 個月,此後每年持續創造 NT$400 萬~2,600 萬的淨收益
ATLANTIS 昶特,您 AI 資料中心液冷監測的最佳夥伴。憑藉 30 年工業儀表製造經驗、TAF 認可校正實驗室、快速交付能力與 24/7 技術支援,ATLANTIS 已成為台灣科技、能源、製造業的信任之選。無論您是規劃新的 AI 中心、升級現有液冷系統,或是需要緊急技術支援,ATLANTIS 都準備好為您量身定制最適合的監測方案。
現在就聯絡我們,獲得免費的 30 分鐘技術諮詢,讓 ATLANTIS 幫您將液冷系統的潛力完全發揮,實現高效、穩定、可預測的 AI 運算環境。
立即開始您的液冷監測之旅
30 年製造經驗 × 台灣在地支援 × 快速交付 × 24/7 技術熱線
讓 ATLANTIS 昶特為您的 AI 資料中心量身定制最適合的液冷監測方案
業務一部 — Ian
電話:02-2820-3405
信箱:ian@atlantis.com.tw
業務二部 — Nori
電話:02-2820-3405
信箱:nori@atlantis.com.tw
昶特有限公司
台北市北投區致遠一路二段 109 號
傳真:02-2827-0646 / 02-2820-3406
官網:https://re-atlantis.tw