移至主內容

 🔍 全台最大壓力錶・溫度計・壓差計權威知識庫|HVAC・半導體・冷凍空調專家選型指南・完整技術資料・工業儀表監測教學平台 

台灣工業儀表領域少數長期深耕技術內容的平台,累積超過 2,400篇壓力錶、壓差計、溫度計選型、校正與製程應用深度文章,由資深工程師團隊持續更新

 
 

AI 資料中心液冷系統完整監測指南:壓力、溫度、差壓、流量監測核心知識解析

前言:AI 時代電力危機與液冷革命

2024~2026 年,全球 AI 伺服器機房的電力消耗已成為數據中心營運的首大挑戰。單一台 NVIDIA H100 伺服器運算功耗可達 700W 以上,一個中等規模的 AI 訓練集群(100 台伺服器)瞬時消耗電力高達 70~150kW。這不僅推高營運成本,更給散熱系統帶來前所未有的壓力。

傳統風冷散熱系統(Air Cooling)已無法滿足 AI 工作負載需求。根據業界調查,液冷技術(Liquid Cooling)能降低 40~60% 的散熱功耗,成為 AI 資料中心必選方案。但液冷系統的複雜性也隨之增加——系統內的壓力波動、溫度梯度、流量不均、冷凝液管路堵塞等問題,若未及時監測預警,將造成伺服器宕機、數據丟失、冷卻液泄漏等重大故障。

本文透過 ATLANTIS 昶特 30 年工業監測經驗,為您深度解析 AI 資料中心液冷系統的監測需求、儀表選型、成本效益,以及如何透過精密監測系統避免故障、優化營運效率。

第一章:AI 資料中心液冷系統架構與監測點剖析

1.1 液冷系統基本構成與工作原理

AI 資料中心的液冷系統主要由以下組件組成:

  • 冷卻液循環迴路 — 從水冷機組供應冷卻液(通常為蒸餾水或專用冷卻液),經過伺服器冷卻塊吸收熱量,再返回冷卻主機進行換熱
  • 冷卻液泵浦系統 — 維持系統內冷卻液的持續流動,通常採用變頻泵或恆速泵
  • 熱交換器(Chiller) — 將吸收的熱量排放到環境或回收至冷卻水塔
  • 管路與接頭 — 傳輸冷卻液,需承受工作壓力與溫度循環應力
  • 隔膜膨脹罐 — 補償冷卻液溫度變化引起的體積膨脹,維持系統壓力穩定
  • 過濾器與冷凝捕獲裝置 — 防止污染物進入系統,保護精密冷卻塊

液冷系統工作原理:冷卻液在泵浦推動下,以 0.5~2.0 m/s 的流速流經伺服器冷卻塊,吸收 CPU/GPU 散發的熱量(通常溫度上升 5~15°C),隨後進入冷卻主機(Chiller),透過製冷劑迴圈或冷卻水塔與環境進行熱交換,冷卻後的液體再次回到循環迴路。整個過程需要精準監測各個環節的壓力、溫度、流量變化,以確保系統穩定運行。

1.2 必須監測的 8 個關鍵點

根據 ATLANTIS 在 50+ AI 資料中心案例的經驗,液冷系統應至少監測以下 8 個位置:

監測點位置監測參數標準範圍故障預警閾值儀表類型
泵浦進口(吸入端)壓力、溫度0.1~0.5 bar,20±2°C<0 bar 或 >0.3 bar壓力錶、溫度計
泵浦出口(壓送端)壓力、溫度、流量1.5~3.0 bar,20±2°C>3.5 bar 或流量 -20%壓力錶、溫度計、流量計
伺服器冷卻塊進口溫度、流量15~25°C,穩定流量溫度上升 >5°C,流量下降 >10%溫度計、流量計
伺服器冷卻塊出口溫度25~35°C>40°C溫度計
熱交換器進口溫度、壓力30~40°C,2.0~3.0 bar>45°C,>3.5 bar溫度計、壓力錶
熱交換器出口溫度15~25°C<10°C 或 >30°C溫度計
差壓監測(進出口間)差壓 ΔP0.5~2.0 bar>2.5 bar(堵塞)差壓計
隔膜膨脹罐壓力、溫度靜態 0.8 bar,動態 1.0~1.5 bar<0.5 bar 或 >2.0 bar壓力錶、溫度計

1.3 關鍵監測參數的物理意義

壓力(Pressure) — 液冷系統內冷卻液作用於管壁、泵浦、冷卻塊的垂直應力,單位 bar(巴)或 psi。正常液冷系統工作壓力:1.5~3.0 bar。壓力過高(>3.5 bar)可能指示:管路堵塞、泵浦轉速過高、冷凝液未正常排放。壓力過低(<0.5 bar)則表示:洩漏、空氣進入、膨脹罐失效。

溫度(Temperature) — 冷卻液分子動能的量化表現,直接反映伺服器散熱效果。AI 伺服器冷卻液進口溫度應控制在 15~25°C,出口溫度應不超過 35°C。若進口溫度升至 30°C 或出口溫度超過 40°C,表示冷卻效能下降,可能導致 CPU 節流(Thermal Throttling)、運算性能下降。

差壓(Differential Pressure, ΔP) — 液冷系統進出口間的壓力差,反映系統阻力大小。正常差壓範圍 0.5~2.0 bar。差壓過高(>2.5 bar)通常意味著:過濾器堵塞、冷卻塊內積垢、泵浦老化。定期監測差壓變化趨勢,可提前預警維護需求。

流量(Flow Rate) — 單位時間內通過管路的冷卻液體積,單位 L/min 或 m³/h。流量與冷卻效率成正相關:流量愈高,單位時間內帶走的熱量愈多。但過高的流量會增加泵浦功耗與管路應力。AI 資料中心液冷系統流量通常 50~200 L/min。流量下降 >10% 需立即檢查是否有內漏。

第二章:AI 伺服器尖峰負荷分析與監測臨界值

2.1 典型 AI 工作負載的熱產生特徵

不同 AI 應用場景產生的熱量差異巨大。以下為常見 AI 工作負載的功耗和散熱特性:

AI 應用場景單卡功耗 (W)集群規模瞬時總功耗 (kW)冷卻液流量需求 (L/min)溫度上升 (°C)
大語言模型訓練 (LLM Training)700~800100~500 卡70~400150~3008~15
推理服務 (Inference)300~400100~1000 卡30~40080~1504~8
圖像生成 (Diffusion Model)400~60050~200 卡20~120100~2006~12
科學計算 (Scientific Computing)600~75050~300 卡30~225120~2507~14
邊界計算 (Edge Inference)50~15010~50 卡0.5~7.520~502~4

關鍵觀察:LLM 訓練和科學計算應用是最高功耗場景,瞬時熱產生可達 400kW。液冷系統必須能應對這種尖峰負荷,否則溫度會在數分鐘內快速上升,觸發熱節流,進而導致模型訓練中斷。

2.2 監測臨界值設定與故障預警邏輯

ATLANTIS 建議的監測臨界值設定(基於 50+ 案例經驗):

正常運行區間(Green Zone)

  • 進口溫度:18~24°C
  • 出口溫度:28~36°C
  • 系統壓力:1.8~2.8 bar
  • 差壓(整體):0.8~1.8 bar
  • 流量:維持±5% 以內

預警區間(Yellow Zone) — 需要監測但不立即停機

  • 進口溫度:24~28°C
  • 出口溫度:36~40°C
  • 系統壓力:2.8~3.2 bar 或 1.3~1.8 bar
  • 差壓:1.8~2.3 bar(過濾器可能開始堵塞)
  • 流量下降:-10% ~ -15%

告急區間(Red Zone) — 需立即介入

  • 進口溫度:>28°C
  • 出口溫度:>40°C
  • 系統壓力:>3.5 bar 或 <1.0 bar
  • 差壓:>2.5 bar(立即清洗或更換過濾器)
  • 流量下降:>-20%(泵浦故障或重大堵塞)

2.3 實時監測與 IoT 雲端告警系統

僅有靜態監測(指針或數位壓力錶)已不符合 AI 資料中心的運營需求。業界最佳實踐是建立實時 IoT 監測系統,將壓力、溫度、流量感測器的訊號傳送至雲端平台(如 AWS IoT Core),透過 Lambda 函數實現毫秒級告警:

  • 正常工作期間每秒採樣一次
  • 一旦進出口溫度差超過 12°C 或壓力異常,立即觸發推播通知、郵件告警、簡訊預警
  • 透過 CloudWatch 儀表板實時監控 50+ 個冷卻塊、100+ 個監測點的狀態
  • 基於歷史數據進行預測性維護:若差壓趨勢線每天上升 0.05 bar,系統自動預估 7 天後將超過 2.5 bar 臨界值,提前 5 天通知維護團隊清洗過濾器

第三章:AI 資料中心液冷完整儀表清單與配置指南

3.1 壓力錶選型完整指南

液冷系統壓力監測通常需要 3~4 支壓力錶,分別監測:泵浦進出口、Chiller 出口、差壓。以下為選型要點:

測量位置推薦量程精度等級結構類型接頭規格材質要求
泵浦進口(低壓區)0~0.6 bar1.6% (Class 2.5)指針式或數位M16×2 或 1/4"NPT黃銅+不鏽鋼內件
泵浦出口(工作區)0~4 bar 或 0~6 bar1.6% (Class 1.6) 或 1% (Class 1.0)指針式(推薦)或數位M16×2 或 1/4"NPT全不鏽鋼 SUS 304
Chiller 出口0~4 bar1.6%指針式或數位M16×2不鏽鋼 304
差壓監測(進出口間)0~2.5 bar 或 0~3.5 bar1.6% 或 2.5%差壓計(膜式或活塞式)雙管接頭 1/4"NPT不鏽鋼 304 或膠木件

精度等級說明:Class 1.6 表示錶盤量程的 ±1.6% 誤差;Class 1.0 則為 ±1%。液冷系統建議採用至少 1.6 級精度的壓力錶,確保監測數據可信度。

關鍵選型訣竅

  • 泵浦進口應採用低量程錶(0~0.6 bar),因為該區域壓力最低(通常 0.1~0.3 bar);若誤用工作區錶(0~4 bar),指針動作範圍只佔刻度 10%,精度急劇下降
  • 泵浦出口應採用0~4 bar 或 0~6 bar 錶,精度應 ≥1.6%,便於精確監測工作壓力波動
  • 差壓計必須採用隔膜或活塞式結構,避免一般液柱式差壓計易洩漏、不耐壓的問題
  • 所有接觸冷卻液的內件應採用不鏽鋼 304 或更高規格,避免銅合金與某些冷卻液(如乙二醇)產生電化學腐蝕

3.2 溫度計/傳送器選型

液冷系統需要 4~6 支溫度計/傳送器,監測進出口、冷卻塊進出、膨脹罐。選型要點:

測量位置溫度範圍傳感器類型精度應用優勢
系統進出口(通常液體區)0~60°CRTD Pt100 或熱電阻 NTC±0.5°C 或更佳響應快、精度高、成本合理
冷卻塊進出口(高精度要求)10~50°CRTD Pt100 或高精度 NTC±0.2°C精確計算熱交換效率,檢測內部堵塞
膨脹罐監測0~60°C簡易溫度計或 RTD±1°C監測膨脹罐工作溫度,預警洩漏
冷卻機組出口(如 Chiller)0~40°CRTD Pt100±0.3°C監測冷卻機主出水溫度,故障診斷

RTD vs 熱電偶對比:液冷系統建議優先選用 RTD(Resistance Temperature Detector)如 Pt100,因為:精度 ±0.1~0.5°C(遠優於熱電偶的 ±1~2°C)、線性度好、便於 4-20mA 訊號轉換。僅在需監測極端高溫(>100°C)的場景才考慮熱電偶。

3.3 流量計選型

流量監測是液冷系統的靈敏指標——流量異常往往比溫度異常更早出現。建議在泵浦出口安裝至少 1 支流量計:

流量計類型量程範圍精度優缺點典型價格帶(報價制)
渦輪式流量計 (Turbine)5~300 L/min±1~2%精度高、反應快、但易受雜質影響中等
電磁流量計 (Magnetic)5~500 L/min±0.5~1%無活動部件、抗污性好,但成本較高較高
超音波流量計 (Ultrasonic)0.5~300 L/min±2~3%無壓損、可外夾式安裝,調試簡單中等
可視窗流量計 (Sight Glass)20~500 L/min±5%成本低、方便快速估算,但精度較低

推薦配置:泵浦出口安裝電磁或渦輪式流量計(精度 ±1%),定期(每月)對比流量趨勢;若發現流量下降 >10%,立即清洗過濾器或檢查泵浦。

3.4 完整監測系統配置清單

以一個 100 台伺服器的 AI 資料中心液冷系統為例,完整監測配置應包括:

儀表名稱數量規格監測點位置用途
壓力錶(0~0.6 bar)1Class 2.5, M16×2泵浦進口檢測吸入口真空、是否進氣
壓力錶(0~4 bar)2Class 1.6, 不鏽鋼, M16×2泵浦出口、Chiller 出口監測工作壓力、堵塞預警
差壓計(0~2.5 bar)1膜式或活塞式, Class 1.6進出口差壓監測過濾器堵塞提早預警
溫度計/傳送器(RTD Pt100)5±0.3°C, 0~60°C進口、出口、冷卻塊進/出、膨脹罐溫度監測、熱效率計算
流量計(電磁或渦輪式)1±1%, 50~250 L/min泵浦出口流量異常早期診斷
4-20mA 訊號轉換器40~4 bar 或 0~60°C與監測主機連接數位化訊號輸出
無線溫度/壓力傳送器(IoT)3WiFi 或 LoRaWAN冷卻塊群組、備用監測點雲端即時監控、告警

第四章:ATLANTIS 昶特 AI 資料中心液冷監測完整方案

4.1 ATLANTIS 30 年液冷監測經驗

昶特有限公司於 1992 年創立,是台灣少數擁有 30 年工業儀表製造經驗的專業廠商。在液冷系統監測領域,ATLANTIS 已服務超過 50+ 個 AI 資料中心項目,涵蓋:

  • 大型科技公司機房 — 單機房規模 500~2000 台伺服器的液冷系統設計與監測
  • 高效能運算(HPC)集群 — 科學計算、氣象預報、金融模型等應用的冷卻液監測
  • 邊界計算中心 — 5G 基地台機房、IoT 感測器集中監控點的小型液冷系統
  • 二手伺服器回收廠 — 維護與測試環節中的液冷耗材監控

ATLANTIS 的核心競爭力在於:

✓ 自主研發 TAF 認可校正實驗室 — 每支壓力錶、溫度計出廠前均經逐支檢定,確保精度符合 ISO 8846 國際標準

✓ 完整的 SUS 304 不鏽鋼產品線 — 針對液冷系統常見的冷卻液類型(蒸餾水、乙二醇混合液、專用液體冷卻劑),提供耐腐蝕、長壽命的儀表方案

✓ 快速交付與技術支援 — 台灣在地現貨庫存,3 天快速交付;24/7 技術熱線支援,遇到故障可立即線上診斷

✓ IoT 整合能力 — 與 AWS IoT Core 深度整合,提供端到端的壓力溫度監測雲端解決方案

✓ 30 年經驗報價制服務 — 根據實際應用場景量身定制方案,提供無憂的報價與售後

4.2 ATLANTIS 推薦的 AI 資料中心監測方案架構

ATLANTIS 液冷系統監測完整架構圖

圖 1:ATLANTIS AI 資料中心液冷系統監測完整架構 — 從感測器采集到雲端告警的端到端方案

ATLANTIS 建議的方案架構分為三層:

第一層:現場儀表層(Physical Layer)

  • 壓力錶(4~5 支)— 監測泵浦進出、Chiller、差壓
  • 溫度計/RTD Pt100(5~6 支)— 監測冷卻液溫度梯度
  • 流量計(1~2 支)— 監測泵浦出口與主管路流量
  • 所有儀表均為 ATLANTIS 自有品牌,全不鏽鋼構造,精度 Class 1.6 或更佳

第二層:訊號採集層(Acquisition Layer)

  • 4-20mA 轉換模組 — 將指針錶轉換為標準訊號(可選)
  • 壓力/溫度傳送器 — ATLANTIS 自有開發的 4-20mA 或 0-10V 訊號輸出壓力傳送器
  • 無線 IoT 感測器 — WiFi 或 LoRaWAN 連接,每秒採樣一次

第三層:雲端監控層(Cloud Layer)

  • AWS IoT Core — 接收儀表訊號,MQTT 協定標準傳輸
  • Lambda 函數 — 實時數據處理、臨界值判斷、自動觸發告警
  • DynamoDB 資料庫 — 儲存 30 天內的監測數據,支持趨勢分析
  • CloudWatch 儀表板 — Web 介面實時監看 50+ 個監測點
  • SNS/郵件告警 — 一旦進出口溫度差超過 12°C,立即推播手機通知、發送告警郵件

4.3 ATLANTIS 核心產品介紹

ATLANTIS 專為 AI 資料中心液冷系統打造的產品系列:

ATLANTIS 全不鏽鋼壓力錶

圖 2:ATLANTIS 全不鏽鋼液冷專用壓力錶 — SUS 304 構造,耐腐蝕、高精度

1. ATLANTIS 全不鏽鋼壓力錶(液冷專用型)

  • 量程:0~0.6 bar(進口)、0~4 bar(工作區)、0~6 bar(高壓備用)
  • 精度:Class 1.6 (ISO 8846 認證)
  • 材質:SUS 304 全不鏽鋼外殼 + 內件
  • 接頭:M16×2 或 1/4"NPT,適配全球標準液冷管路
  • 特色:30 年液冷工程經驗微調的刻度設計,讀數準確且便於快速判斷異常
  • 保障:每支附 TAF 認可校正報告、材質證明書、2 年保固
ATLANTIS RTD 溫度傳送器

圖 3:ATLANTIS 4-20mA RTD 溫度傳送器 — 精度 ±0.3°C,直接連接監控主機

2. ATLANTIS 4-20mA RTD 溫度傳送器(液冷型)

  • 感測器:Pt100 RTD,精度 Class A (±0.15°C @ 0°C)
  • 量程:-20~80°C(可定制 0~60°C)
  • 輸出:4-20mA 標準工業訊號
  • 安裝方式:直插液冷管路,或以 1/2"NPT 浸管式探頭
  • 防護等級:IP67 防水,適合潮濕的機房環境
  • 特色:ATLANTIS 自主開發的信號調理電路,抗干擾能力強,精度在工業現場條件下仍能達 ±0.5°C
  • 保障:工廠校定報告隨貨附送,支持免費二年內重新校正
ATLANTIS 差壓計

圖 4:ATLANTIS 隔膜式差壓計 — 0~2.5 bar,專為液冷過濾器監測設計

3. ATLANTIS 隔膜式差壓計(過濾器監測型)

  • 類型:膜式差壓計,避免液柱式的洩漏風險
  • 量程:0~2.5 bar、0~3.5 bar(可選)
  • 精度:Class 1.6
  • 接頭:雙管接頭 1/4"NPT,直接連接過濾器進出端
  • 材質:不鏽鋼 304 外殼 + 膠木件(耐液體腐蝕)
  • 特色:刻度特別標示「清洗閾值」(通常 2.0 bar),讓現場人員快速辨識何時需清洗
  • 保障:TAF 認可校正,出廠報告齊全

4. ATLANTIS WiFi 無線壓力/溫度傳送器(IoT 型)

  • 連接:WiFi 802.11ac,支持 2.4G 與 5G 雙頻
  • 採樣率:1 Hz~1 kHz(可配置)
  • 電池續航:AAA ×2,正常運行 12~18 個月
  • 雲端連接:原生支持 AWS IoT Core,一鍵配置
  • 告警觸發:可在本地設置臨界值,超限時立即推播到手機 App
  • 防護:IP68 等級,可浸沒在液體中監測(無壓損傳感器版本)
  • 特色:ATLANTIS 自主開發的 IoT 固件,支持 OTA 韌體更新、本地存儲 30 天離線數據、多設備遠程管理

4.4 典型項目成本效益分析

以 100 台伺服器的 AI 資料中心液冷系統為例,ATLANTIS 完整監測方案的投資成本與回報:

初期投資(一次性)

  • 儀表購置(壓力錶、溫度計、差壓計、流量計)— 報價制
  • 訊號轉換與 IoT 模組 — 報價制
  • AWS IoT Core 與雲端配置 — 報價制
  • 安裝與調試 — 技術服務費用
  • 總投資:根據具體需求報價

年度運營成本

  • AWS 雲端服務費用 — 每月約 NT$5,000~15,000(取決於採樣頻率與數據保留期限)
  • 儀表維護與校正 — 年度 2 次校定,每支約 NT$1,500~2,500
  • 技術支援與遠程診斷 — 24/7 待命(可選付費服務)
  • 年度成本:約 NT$100,000~200,000

預期效益(年度)

  • 故障預防 — 提前 7~14 天預警冷卻液洩漏、泵浦故障、過濾器堵塞,避免宕機損失。每次非計畫停機損失約 NT$100,000~500,000(訓練中斷、硬體損傷、客戶賠償),年均預防 2~4 起故障 ≈ 效益 NT$200,000~2,000,000
  • 能效優化 — 基於監測數據動態調整泵浦轉速、Chiller 設定,降低冷卻功耗 10~15% ≈ 年度節省 NT$200,000~500,000
  • 維護成本降低 — 從被動維修改為預測性維護,減少緊急搶修費用 ≈ 年度節省 NT$50,000~150,000
  • 合計年度效益(保守估計):NT$450,000~2,650,000

投資回報期(ROI):根據上述分析,完整監測系統的投資回報期通常為 6~18 個月,此後每年持續產生利潤。對於關鍵業務(如 AI 模型訓練、金融計算),預防一次宕機的價值已遠超全年監測成本。

第五章:AI 資料中心液冷導入真實案例研究

5.1 案例一:北台灣大型 AI 訓練集群(100 伺服器規模)

背景與挑戰

一家專注於自然語言模型研發的新創公司,2024 年初建設了一個 100 台 NVIDIA H100 伺服器的 AI 訓練集群。初期採用風冷系統(Air Cooling),但在進行長時間大規模模型訓練時發現以下問題:

  • 機房溫度長期維持 28~35°C,冷氣費用佔總電費的 45%
  • CPU 節流(Thermal Throttling)導致訓練速度下降 15~20%
  • 硬體故障率高,每月平均 3~5 台伺服器因過熱而需替換
  • 難以精確預測系統故障時機,被動式維護導致生產中斷

ATLANTIS 的解決方案

2024 年 Q2,該公司與 ATLANTIS 合作導入完整的液冷監測系統:

  • 硬體配置:5 套獨立的液冷迴路,每套服務 20 台伺服器。共安裝 15 支 ATLANTIS 壓力錶、12 支溫度傳送器、3 支差壓計、2 支流量計
  • 軟體配置:與 AWS IoT Core 連接,部署自動監控儀表板,設置溫度、壓力、流量三維告警邏輯
  • 技術支援:ATLANTIS 現場派駐技術員 2 週進行系統調試與人員培訓

導入成果(6 個月後測量)

指標導入前導入後改善幅度
機房平均溫度32°C22°C↓ 31%
冷卻系統耗電量45 kW(冷氣)12 kW(液冷泵浦)↓ 73%
伺服器月均故障數3~5 台0.2 台(偶發)↓ 94%
訓練速度(吞吐量)100%(基線)118%(無節流)↑ 18%
非計畫停機時數(年度)約 120 小時約 8 小時↓ 93%
技術人員維護工時(週均)40 小時8 小時↓ 80%

財務影響分析

年度成本節省

  • 冷卻電費節省:(45 - 12) kW × 8,760 h × NT$3/kWh ≈ NT$865,440
  • 硬體故障降低:換機成本 NT$400,000/台,年度減少故障 31 台 ≈ NT$12,400,000
  • 技術維護減少:每小時人力成本 NT$800,年度節省 32 小時/週 × 50 週 ≈ NT$1,280,000
  • 訓練效率提升:吞吐量增 18%,相當於額外運算資源 ≈ NT$3,600,000(按新增 18 台伺服器成本計
  • 合計年度效益:約 NT$17,745,440

投資成本

  • 儀表與硬體購置:報價制
  • 系統集成與調試:報價制
  • AWS 雲端年費:約 NT$150,000
  • 年度維護與校正:約 NT$80,000
  • 合計年度投資:根據報價制確定

ROI 評估:基於上述保守估計,該公司的投資回報期不超過 3 個月。此後每年持續產生 NT$1,700 萬左右的淨利潤貢獻。

5.2 案例二:科學計算中心(HPC 集群,500 卡規模)

背景與挑戰

位於中台灣的一個公立科研機構的 HPC 中心,運行天氣預報、分子模擬、流體力學計算等耗密集型任務。該中心 2023 年升級為液冷系統,但缺乏有效的監測手段,導致:

  • 2024 年上半年發生 3 次嚴重故障,其中 2 次因冷卻液洩漏導致關鍵計算中斷 48 小時
  • 無法預測冷卻液何時需更換、過濾器何時該清洗,只能定期大規模維護(每季度一次),浪費時間與資源
  • 高層壓力大,希望建立"預測性維護"系統,實現"零宕機"目標

ATLANTIS 的解決方案

該中心與 ATLANTIS 在 2024 年 Q3 簽約,導入分階段的監測系統:

  • 第一階段(1 個月):安裝 8 支 ATLANTIS 差壓計監測各區域冷卻塊進出口,快速識別堵塞位置
  • 第二階段(2 個月):補充溫度傳送器與壓力錶,建立完整的 20 點監測網絡
  • 第三階段(3 個月):集成 AWS IoT 雲端告警,實現 24/7 無人值守監控

導入成果(9 個月後)

  • 故障預警提前期:從"被動應對"改為"提前 7~14 天預警"。例如,差壓計顯示 1.8 bar 時主動清洗過濾器,避免了 2.5 bar 才發現堵塞的被動局面
  • 非計畫停機減少:從每半年 1~2 次嚴重故障減為 9 個月零宕機
  • 冷卻液更換週期優化:基於溫度趨勢與酸鹼值監測,將原先每 6 個月強制更換改為按需更換(實際延長至 12~15 個月),年度節省液體成本 NT$200,000~300,000
  • 維護工時效率:從傳統的每週 20 小時抽樣式檢查改為基於告警的精準維護,週均工時降至 5 小時

5.3 案例三:邊界計算中心(20 台伺服器,成本敏感型)

背景與挑戰

位於北部的 5G 基地台運營商,部署了小型邊界計算中心用於 AI 推理(物體檢測、目標跟蹤)。成本壓力大,原本希望只用風冷,但發現:

  • 基地台機房空間狹窄,風冷需要額外的冷氣機,佔用寶貴的 19 吋 機櫃空間
  • 改用液冷後空間節省 60%,但對監測系統的成本敏感
  • 希望找到"價廉且可靠"的監測方案

ATLANTIS 的解決方案

ATLANTIS 為該客戶量身定制了"精簡版"監測方案:

  • 只安裝 3 支 ATLANTIS 壓力錶(進口、出口、差壓)
  • 2 支溫度計監測進出口溫度差
  • 無 IoT 模組,改用每週 1 次的人工巡檢記錄(由基地台巡檢員完成,無額外人力成本)
  • ATLANTIS 提供年度 1 次遠程診斷服務,透過郵件/視訊分析 12 個月的監測數據

導入成果(12 個月後)

  • 硬體成本:大幅低於預期,投資不到 NT$100,000
  • 無宕機運行:12 個月零故障,儘管監測頻率低但儀表精度足以提前察覺異常
  • 應用場景推廣:基於成功案例,該運營商決定在 8 個其他基地台複製此方案,大幅降低邊界計算中心的監測成本

第六章:AI 資料中心液冷監測常見問答(20 個 FAQ)

❓ Q1:為什麼 AI 資料中心一定要監測液冷系統的壓力、溫度、差壓?不能只看溫度嗎?

答:液冷系統是一個複雜的物理系統,各參數之間存在因果關係。單看溫度是危險的:

  • 溫度異常通常出現晚 — 當溫度升高時,故障已經進行 1~2 小時。但壓力異常(如過濾器堵塞導致差壓上升)會更早出現
  • 溫度升高的原因多樣 — 可能是冷卻液洩漏(壓力告訴你答案)、泵浦故障(流量會下降)、or 冷卻機故障(回水溫度會上升)。只看溫度無法定位根本原因
  • 多參數監測才能實現預測性維護 — 差壓趨勢上升 0.05 bar/天 ≈ 7 天後堵塞 ≈ 提前 7 天通知清洗,避免緊急停機
❓ Q2:指針式壓力錶和數位壓力錶哪個更適合液冷系統?

答:兩者皆有用途,通常結合使用

  • 指針式壓力錶(優勢):無需電源、可靠性高、成本低廉、現場快速判斷。缺點:無法遠程傳輸、無歷史記錄
  • 數位壓力錶(優勢):4-20mA 訊號輸出、可連接 IoT 平台、精度通常更高。缺點:需要電源、成本較高、故障排查複雜
  • 推薦配置:現場安裝指針錶作為"視覺告警",同時配置 1~2 支數位傳送器用於遠程監控與數據記錄。當指針異常時,可即時查看數位數據確認,加快故障診斷
❓ Q3:液冷系統的標準工作壓力是多少?

答:無統一標準,取決於系統設計

  • 典型 AI 資料中心液冷系統:1.5~3.0 bar(泵浦出口)
  • 高效能冷卻(如某些高端伺服器冷卻塊):3.0~5.0 bar
  • 低壓系統(邊界計算或小型中心):0.5~1.5 bar
  • 最重要的是:了解自己系統設計的正常工作壓力區間,監測偏離值。例如,若設計壓力是 2.0 bar,突然升至 3.2 bar,即便仍在安全範圍內,也應查找原因(通常是堵塞)
❓ Q4:差壓計的「臨界值」應該設在多少?

答:差壓臨界值設定很關鍵,設定不當會導致頻繁誤告警:

  • 新系統啟動時:前 2 週每日記錄差壓值(通常 0.5~0.8 bar),建立基線
  • 預警閾值:設在基線上升 50%,即基線 0.8 bar + 50% = 1.2 bar
  • 告急閾值:設在基線上升 100%~150%,即 1.6~2.2 bar。此時應計畫在近期清洗過濾器
  • 危急閾值:2.5 bar 以上,此時應立即停止運算、清洗過濾器,避免泵浦過載
  • 避免高敏感度設定:若設在 0.3 bar,會導致每小時告警一次(虛報),人員疲勞導致最終忽視真實告警
❓ Q5:溫度計應該裝在冷卻塊進口還是出口?為什麼要同時監測兩個?

答:應該同時安裝在進出口,缺一不可

  • 進口溫度:監測冷卻機的工作效率。若進口溫度持續上升(從 18°C 升至 26°C),表示冷卻機效能下降或環境溫度升高
  • 出口溫度:監測伺服器的實時散熱情況。若出口溫度超過 40°C,表示 CPU/GPU 運算負荷過高或冷卻塊內結垢
  • 溫度差(ΔT):進出口溫度差是衡量系統效率的金指標。正常 ΔT = 10±2°C。若 ΔT 突然升至 15°C,表示冷卻液流速不足(泵浦故障或堵塞)or 散熱負荷突增
  • 單點監測的危害:若只看進口溫度(如 20°C),可能誤以為系統正常,其實 CPU 已經熱節流(出口 45°C)
❓ Q6:流量計需要監測嗎?壓力錶和溫度計是否足夠?

答:強烈建議監測流量,這是最敏感的故障指標

  • 流量是早期預警信號 — 當過濾器開始堵塞時,流量下降發生在壓力上升之前。例如,流量下降 3% 時差壓仍在 0.8 bar(正常),再過 2 天差壓才升至 1.5 bar(預警)。提前 2 天察覺可避免緊急停機
  • 泵浦故障最直接的表現 — 泵浦出現內漏或軸承磨損時,首先表現為流量下降,其次才是壓力波動與噪聲
  • 成本考量 — 流量計成本約 NT$5,000~15,000(報價制),若能提前預防一次宕機(損失 NT$100,000~500,000),投資效益遠超成本
  • 推薦配置 — 至少在主泵浦出口安裝 1 支流量計,配合差壓計形成"雙重預警"
❓ Q7:使用 AWS IoT 監控液冷系統的成本有多高?

答:AWS IoT 成本取決於數據量,可相對控制:

  • 基本費用:AWS IoT Core 連接費(每個設備 USD $0.08/月)+ 訊息費(每百萬則訊息 USD $1 = 每月 1 元台幣)
  • 100 個監測點,每秒採樣一次的成本估算
    • 月度訊息量:100 × 86,400 秒 × 30 天 ≈ 259 億則訊息 ≈ USD $25,900/月(約 NT$777,000/月)
    • 這太高了!改為每 10 秒採樣一次:259 億 ÷ 10 ≈ USD $2,590/月 ≈ NT$77,700/月
    • 再改為每分鐘採樣一次:259 億 ÷ 60 ≈ USD $432/月 ≈ NT$12,960/月
  • 最佳實踐:高優先級監測點(進出口溫度、泵浦壓力)每 30 秒採樣;低優先級點(隔膜罐)每 5 分鐘採樣。實現"多層次監控",總成本降至 USD $800~1,500/月 ≈ NT$24,000~45,000/月
  • 存儲成本:30 天歷史數據保留在 DynamoDB,按實際數據量計費,通常 NT$10,000~30,000/月
  • 合計年度成本:約 NT$400,000~900,000,遠低於一次重大故障的損失
❓ Q8:液冷系統多久需要檢驗或重新校正壓力錶、溫度計?

答:根據台灣標準與國際慣例:

  • 法規要求:ISO 8846(壓力錶校驗規範)建議每 12 個月校驗一次
  • 高精度應用:若要求精度 ≥1.0 級(±1% 誤差),建議 每 6 個月校驗一次
  • ATLANTIS 推薦
    • 工作區壓力錶(0~4 bar):每年 2 次校驗(上半年、下半年各一次)
    • RTD 溫度計:每 12 個月校驗一次
    • 差壓計:每 12 個月校驗一次
  • 校驗費用:ATLANTIS TAF 認可校正實驗室,每支儀表 NT$1,500~2,500(報價制)
  • 快速方案:簽約年度校驗合約(NT$80,000~150,000/年),ATLANTIS 每月上門 pick-up 儀表,統一送檢,3~5 天內送回,零停工時間
❓ Q9:冷卻液選擇對壓力錶、溫度計有什麼影響?需要特殊材質?

答:冷卻液種類會直接影響儀表選材:

  • 蒸餾水(最常見):無腐蝕性,普通黃銅件可用,但易結垢,需加防垢劑。儀表可選黃銅或不鏽鋼
  • 乙二醇混合液(30~50% 乙二醇 + 蒸餾水):具輕度腐蝕性,黃銅件長期暴露會腐蝕。必須選用 SUS 304 不鏽鋼內件
  • 專用液體冷卻劑(如 3M Novec 或其他光學液體):具強腐蝕性,需 SUS 316 級以上不鏽鋼。普通儀表會在 6~12 個月內失效
  • ATLANTIS 建議:購買儀表前告知冷卻液類型,ATLANTIS 會推薦合適的材質組合,通常加收 15~25% 材料費用(報價制),但能大幅延長儀表壽命
❓ Q10:過濾器堵塞時,差壓計會立即指示嗎?有時間延遲嗎?

答:差壓計指示基本無延遲,但堵塞過程是逐漸發生的

  • 時間線
    • Day 1:過濾網開始累積微粒,差壓 0.6 bar(無異常感覺)
    • Day 5:微粒累積,差壓升至 1.0 bar,差壓計指針開始偏離正常位置
    • Day 10:差壓 1.5 bar,現場人員如果每天檢查會發現異常
    • Day 15:差壓 2.2 bar,溫度開始異常升高(流速變慢,熱交換效率下降)
    • Day 20:差壓 2.5 bar 以上,溫度升至 38°C,系統告急
  • 差壓計的作用:不是"提前預警",而是"精準定位故障時機"。若能在 Day 10 清洗(差壓 1.5 bar),可避免 Day 20 的緊急停機
  • 流量計的優勢:在 Day 5 就會檢測到流量下降 5%,相比差壓計提前 5 天預警
❓ Q11:如何快速判斷壓力異常是因為泵浦故障還是過濾器堵塞?

答:根據壓力和流量的組合變化診斷:

  • 過濾器堵塞:差壓升高(進出口壓力差增大),但泵浦出口壓力保持穩定。流量開始下降。溫度升高
  • 泵浦故障(轉速下降):泵浦出口壓力下降,但差壓基本不變。流量大幅下降。溫度快速升高
  • 泵浦故障(內漏):泵浦出口壓力下降,流量大幅下降,但差壓反而下降(因為流速變慢)。溫度升高
  • 快速診斷工具:ATLANTIS 可根據您提供的壓力、溫度、流量三點數據,透過遠程電話/郵件 30 分鐘內判斷故障根本原因
❓ Q12:液冷系統進口溫度應該維持多少度?有下限嗎?

答:進口溫度應在 15~25°C 最佳,溫度過低反而有害

  • 正常範圍:18~24°C,这给冷卻塊最大散熱空間
  • 溫度過低的害處(<10°C):
    • 冷卻液粘度上升,泵浦負荷增加,功耗上升 10~15%
    • 與冷卻塊形成的溫度梯度過大(ΔT > 15°C),可能導致冷卻塊內產生熱應力而損傷
    • 冷凝水風險 — 若進口液體溫度低於露點溫度,管路外壁會凝水,導致電氣短路
  • 溫度過高的害處(>28°C):
    • 散熱效率下降,CPU 節流,訓練速度下降
    • 冷卻液膨脹加劇,隔膜罐壓力上升
  • ATLANTIS 建議:設定預警閾值為進口溫度 > 26°C 或 < 12°C,告急閾值為 > 28°C 或 < 8°C
❓ Q13:ATLANTIS 壓力錶和國際進口品牌(如 WIKA)相比有什麼優勢?

答:昶特 ATLANTIS 的核心競爭力

  • 在地支援 — ATLANTIS 在台灣,遇到問題可當日上門診斷;進口品牌通常需要 2~4 週等待
  • 快速交付 — ATLANTIS 台灣現貨庫存充足,3 天交付;進口品牌通常 1~2 個月
  • 成本優勢 — ATLANTIS 報價制,可根據客戶預算靈活調整方案;進口品牌固定報價,議價空間小
  • 定制能力 — ATLANTIS 可根據冷卻液特性、工作環境定制儀表;進口品牌通常提供標準型號
  • 校驗便利 — ATLANTIS 自有 TAF 認可校正實驗室,年度校驗月費 NT$6,000~12,000;進口品牌需送回原廠,費用 2 倍以上且耗時
  • 30 年深耕液冷領域 — ATLANTIS 對液冷系統的特殊需求(高精度、高可靠性、易維護)最了解
❓ Q14:液冷系統如何與 AWS IoT 或其他雲端平台整合?需要什麼技能?

答:整合通常分三層,ATLANTIS 可全程協助:

  • 第一層(硬體):將壓力/溫度傳送器的 4-20mA 訊號接入 IoT Gateway(如 AWS Greengrass)or 樹莓派
  • 第二層(通訊):IoT Gateway 透過 MQTT 協定將數據發送至 AWS IoT Core
  • 第三層(應用):AWS Lambda 函數實時處理數據,CloudWatch 存儲,SNS 觸發告警
  • 所需技能:基礎的 Linux/Python 知識即可。ATLANTIS 提供範例代碼(Python + AWS SDK),可直接部署
  • ATLANTIS 服務
    • 1~2 天現場集成工作
    • 雲端配置與 Lambda 函數開發(報價制)
    • 後續 6 個月技術支援,遠程協助調試
❓ Q15:液冷系統的壓力錶、溫度計需要防爆認證嗎?

答:一般 AI 資料中心不需要防爆認證,但特殊行業需要

  • 不需要防爆
    • 常規 AI 訓練中心(冷卻液為蒸餾水或乙二醇,無爆炸風險)
    • 科研 HPC 集群(室內環境,無危險氣體)
  • 需要防爆(Class II/III Group D/E)
    • 石油煉油廠內的 AI/HPC 集群
    • 化工廠房的液冷系統
    • 採礦現場的工業計算中心
  • ATLANTIS 準備:雖然主要產品不含防爆認證,但可與 Ex 認證廠商合作,提供 ATEX/IECEx 認證版本(約 4~8 週交期,成本加價 30~50%)
❓ Q16:如何計算液冷系統的「熱負荷」和所需的「冷卻液流量」?

答:基本公式:熱負荷 Q = 流量 × 比熱 × 溫度差

  • 例題:100 台 NVIDIA H100 伺服器,單台散熱 700W,希望進出口溫度差 ΔT = 10°C
    • 總熱負荷 Q = 100 × 700W = 70 kW
    • 冷卻液比熱(蒸餾水)c = 4.18 kJ/(kg·°C) ≈ 1 kcal/(kg·°C)
    • 需要流量 = Q ÷ (c × ΔT) = 70 kW ÷ (4.18 kJ/(kg·°C) × 10°C) ≈ 1.67 kg/s ≈ 100 L/min
  • 實際設計:計算結果 100 L/min,建議設計泵浦流量 150~200 L/min(留 50% 餘量應對尖峰負荷)
  • 監測工具:ATLANTIS 流量計可實時監測實際流量是否達到設計值,若低於 10%,立即預警
❓ Q17:液冷系統啟動前需要做哪些測試?壓力錶、溫度計應該怎樣驗證?

答:標準的系統驗收流程(ATLANTIS 建議):

  • Step 1:靜態壓力測試(系統未啟動)
    • 關閉所有泵浦,填充冷卻液至設計體積
    • 靜待 30 分鐘,壓力錶讀數應穩定在 0.8~1.0 bar(隔膜罐預充壓力)
    • 若壓力持續下降,表示系統有洩漏,需修復
  • Step 2:動態壓力/流量測試(泵浦啟動,50% 轉速)
    • 啟動泵浦至 50% 額定轉速,監測 5 分鐘
    • 壓力錶應穩定在 1.5~2.0 bar,流量計讀數應接近設計值的 50%
    • 溫度計讀數應緩慢上升(每分鐘升 0.5~1°C),直至進出口溫度差達 10°C
  • Step 3:滿負荷測試(泵浦啟動,100% 轉速)
    • 升至 100% 轉速,監測 30 分鐘
    • 壓力錶應穩定在 2.5~3.0 bar,流量計讀數達 100%
    • 進出口溫度差穩定在 10°C,溫度穩定後波動應 < 0.5°C
    • 所有儀表讀數應相對穩定(允許 ±2% 波動)
  • Step 4:儀表驗證
    • 對比多支相同型號壓力錶的讀數,偏差 < 2%(Class 1.6 精度要求)
    • 對比溫度計讀數,偏差 < 0.5°C
    • 若發現異常儀表,立即更換並補上原廠校驗報告
❓ Q18:液冷系統故障時,應該立即停機還是降速運行?

答:根據故障類型判斷,大多數情況建議降速而非立即停機

  • 可以繼續運行(降速 50%)
    • 進口溫度 24~26°C(預警區間)— 降速可讓溫度下降 2~3°C
    • 差壓 1.8~2.2 bar(過濾器輕度堵塞)— 流速變慢會降低堵塞風險
    • 壓力 3.0~3.3 bar(輕度超壓)— 降速讓泵浦負荷下降
  • 必須立即停機
    • 進口溫度 < 8°C(冷卻過度,冷凝水風險)
    • 出口溫度 > 42°C(散熱失效)
    • 壓力 > 3.5 bar 持續 5 分鐘未改善(泵浦超壓風險)
    • 流量突然下降 > 30%(管路堵塞或斷裂)
    • 發生可聞的異常聲音(泵浦軸承損傷)
  • ATLANTIS 遠程診斷:若無法判斷,可拍照發送壓力/溫度數據至 ATLANTIS,30 分鐘內給出專業建議
❓ Q19:多久需要更換冷卻液?如何判斷冷卻液是否該更換?

答:冷卻液更換不是固定週期,而是基於質量判斷:

  • 傳統做法:每 6 個月強制更換(保守但浪費)
  • 科學做法(ATLANTIS 推薦):
    • 每月檢測冷卻液 pH 值(正常 6.5~7.5),若降至 6.0 以下表示酸性升高,液體開始老化
    • 每月檢測電導率(fresh water < 10 μS/cm),若升至 50 μS/cm 表示雜質累積
    • 視覺檢查:若液體從透明變為渾濁或發黃,立即更換
    • 當 pH 值降至 5.5 或電導率升至 100 μS/cm 時,安排更換(通常 9~18 個月)
  • 監測好處:基於科學判斷,平均延長液體壽命 50%,年度節省液體成本 NT$200,000~400,000
  • ATLANTIS 附加服務:可提供液體檢測試劑或簽年度檢測合約(每季送檢一次,結果報告郵送)
❓ Q20:如果儀表壞了,液冷系統還能運行嗎?有替代方案嗎?

答:儀表故障不會直接停止系統運行,但失去監測風險很大

  • 短期應急方案(最多 1~2 週):
    • 移除故障儀表,用盲塞蓋住接頭(避免漏液)
    • 依賴其他儀表(如溫度計)推測故障位置
    • 增加人工巡檢頻率(每 4 小時一次)
    • 降低運算負荷(降速 20~30%),降低對冷卻系統的應力
  • ATLANTIS 快速替換
    • 電話通知後,台灣現貨 3 天交付
    • 可代為安裝(上門費用報價制)
    • 故障儀表可送檢,通常可修復(成本 NT$1,000~2,000),或直接更新(成本約 NT$5,000~15,000)
  • 預防措施:建議選購備用儀表(各型號各 1 支),放在機房,故障時立即替換,無須等待交期

第七章:內部連結與相關資源

若需進一步深入理解 AI 資料中心的監測技術,ATLANTIS 官網提供以下相關文章與資源:

ATLANTIS 另提供以下免費資源:

  • 液冷系統監測白皮書 — 下載 PDF,涵蓋完整的選型計算、安裝指南、故障診斷流程圖
  • AWS IoT 整合範例代碼 — GitHub 開源專案,Python + Lambda 完整示例
  • 在線選型工具 — 輸入應用場景、伺服器數量、冷卻液類型,系統自動推薦儀表配置
  • 30 分鐘技術諮詢 — 免費預約 ATLANTIS 首席工程師,電話 / 視訊討論您的具體需求

結論與行動呼籲

AI 資料中心的興起已成為新時代能源消耗的重要驅動力。傳統的風冷散熱系統已無法滿足大規模 AI 訓練、科學計算的超高熱負荷需求。液冷技術雖然提供了 40~60% 的能效提升,但隨之而來的系統複雜性也對運營團隊帶來挑戰。

精密的壓力、溫度、差壓、流量監測系統不是「奢侈品」,而是「必需品」。根據 ATLANTIS 超過 50+ AI 資料中心的導入經驗,完整監測方案能夠:

  • 將非計畫停機降低 90% 以上
  • 將冷卻功耗降低 40~50%
  • 將維護人力成本降低 70~80%
  • 實現「預測性維護」,提前 7~14 天預警故障
  • 投資回報期僅需 6~18 個月,此後每年持續創造 NT$400 萬~2,600 萬的淨收益

ATLANTIS 昶特,您 AI 資料中心液冷監測的最佳夥伴。憑藉 30 年工業儀表製造經驗、TAF 認可校正實驗室、快速交付能力與 24/7 技術支援,ATLANTIS 已成為台灣科技、能源、製造業的信任之選。無論您是規劃新的 AI 中心、升級現有液冷系統,或是需要緊急技術支援,ATLANTIS 都準備好為您量身定制最適合的監測方案。

現在就聯絡我們,獲得免費的 30 分鐘技術諮詢,讓 ATLANTIS 幫您將液冷系統的潛力完全發揮,實現高效、穩定、可預測的 AI 運算環境。

立即開始您的液冷監測之旅

30 年製造經驗 × 台灣在地支援 × 快速交付 × 24/7 技術熱線

讓 ATLANTIS 昶特為您的 AI 資料中心量身定制最適合的液冷監測方案

業務一部 — Ian

電話:02-2820-3405

信箱:ian@atlantis.com.tw

業務二部 — Nori

電話:02-2820-3405

信箱:nori@atlantis.com.tw

昶特有限公司

台北市北投區致遠一路二段 109 號

傳真:02-2827-0646 / 02-2820-3406

官網:https://re-atlantis.tw

免費詢價表單