AI 서버는 왜 액체냉각이 필요할까? Liquid Cooling 원리
AI 서버의 냉각문제를 이해하려면 먼저 한 가지를 생각해볼 필요가 있습니다. GPU와 CPU가 사용하는 전기는 거의 대부분 결국 열로 바뀝니다. AI Rack이 100kW의 전력을 소비한다면 그 Rack에서는 거의 같은 규모의 Heat Load가 계속 발생한다고 볼 수 있습니다. 따라서 AI 서버의 전력밀도가 높아질수록 Cooling은 단순한 부가기능이 아니라 Compute Capacity 자체를 결정하는 Infrastructure가 됩니다.
과거의 Data Center는 차가운 공기를 Server 앞쪽으로 보내고 뜨거워진 공기를 뒤쪽에서 회수하는 Air Cooling만으로 충분한 경우가 많았습니다. 하지만 GPU와 HBM을 고밀도로 집적한 AI Server는 Chip 하나에서 발생하는 Heat Flux가 크게 증가했고, Rack당 Power도 수십 kW를 넘어 100kW 이상으로 올라가는 구조가 등장했습니다.
Liquid Cooling: 공기보다 열을 훨씬 효율적으로 운반하는 Liquid Coolant를 이용해 CPU와 GPU에서 발생한 열을 제거하는 Cooling 방식입니다.
Liquid Cooling이 중요한 이유는 “물은 차갑기 때문”이 아닙니다. 핵심은 같은 부피의 Fluid가 공기보다 훨씬 많은 열을 운반할 수 있다는 점입니다. 따라서 고밀도 AI Rack에서 Heat를 Chip 가까이에서 직접 받아 Facility 밖으로 옮기기에 유리합니다.
먼저 Air Cooling과 Liquid Cooling을 비교하면
| 구분 | Air Cooling | Liquid Cooling |
| 열 운반 매체 | 공기 | Water·Water/Glycol 등 Coolant |
| Heat Removal 능력 | 낮은·중간 Rack Density에 유리 | 높은 Heat Density에 유리 |
| 주요 장치 | Fan, CRAH/CRAC, Chiller | Cold Plate, Pump, CDU, Heat Exchanger |
| Chip 접근 | Heat Sink를 통해 공기로 전달 | Cold Plate가 Chip Heat를 직접 흡수 |
| Rack Density | 높아질수록 Fan·Airflow 부담 증가 | 100kW급 이상 Rack 대응에 유리 |
| 주요 리스크 | Airflow, Fan Power, Hot Spot | Leak, Fluid Quality, Pump, Condensation |
Liquid Cooling이 등장했다고 Air Cooling이 사라지는 것은 아닙니다. 실제 AI Data Center에서는 GPU와 CPU처럼 Heat Density가 높은 Component는 Liquid로 냉각하고, DIMM, SSD, PSU와 일부 Board Component는 Air로 냉각하는 Hybrid Cooling이 많이 사용됩니다.
Air Cooling은 왜 한계에 부딪힐까요?
공기로 열을 제거하려면 더 많은 Heat를 빼낼수록 더 많은 Airflow가 필요합니다. Fan Speed를 높이고 더 차가운 Supply Air를 보내야 하지만 Rack Density가 높아지면 공기가 지나갈 공간 자체가 부족해질 수 있습니다.
특히 AI Server는 GPU와 HBM, NVSwitch, NIC, Power Component가 좁은 공간에 몰려 있습니다. Front-to-back Airflow만으로 모든 Hotspot에 충분한 공기를 보내려면 Fan Power가 크게 증가하고 Acoustic과 Vibration, Dust 문제도 커집니다.
Fan의 전력은 회전속도가 높아질수록 급격히 증가할 수 있습니다. 즉 Compute Chip이 더 많은 전력을 쓰는 상황에서 Cooling을 위해 Fan Power까지 계속 늘리는 것은 효율적인 Scaling 방법이 아닐 수 있습니다.
Liquid Cooling은 Chip 가까이에서 Heat를 직접 받아가기 때문에 이 Airflow Bottleneck을 크게 완화할 수 있습니다.
Direct-to-Chip Liquid Cooling은 어떻게 작동할까요?
Direct-to-Chip(D2C) Liquid Cooling: GPU와 CPU 위에 Cold Plate를 장착하고 그 안으로 Coolant를 흘려 Chip에서 발생한 Heat를 직접 흡수하는 방식입니다.
Cold Plate: GPU나 CPU의 Heat Spreader와 접촉해 내부 Channel을 흐르는 Coolant로 Heat를 전달하는 금속 Heat Exchanger입니다.
GPU에서 발생한 열은 Thermal Interface Material과 Cold Plate를 통해 Coolant로 이동합니다. 온도가 올라간 Coolant는 Rack 밖의 Manifold와 CDU로 이동하고, Heat Exchanger를 통해 Facility Water Loop 또는 다른 Heat Rejection System으로 열을 넘깁니다. 식은 Coolant는 다시 Server로 돌아옵니다.
중요한 것은 Coolant가 Data Center Chilled Water와 항상 같은 물인 것은 아니라는 점입니다. 일반적으로 IT Equipment 쪽에는 별도의 Secondary Loop를 만들고 CDU의 Heat Exchanger를 통해 Facility Loop와 열만 교환합니다. 이렇게 하면 Server 내부의 Fluid Quality, Pressure, Temperature를 더 정밀하게 관리할 수 있습니다.
왜 Secondary Loop가 필요할까요?
Facility Water는 Building 전체 Cooling System을 돌며 여러 Equipment와 배관을 지나갑니다. Water Quality와 Pressure가 IT Equipment에 적합하지 않을 수 있고, 오염물질이 Cold Plate의 미세 Channel을 막으면 Cooling Performance가 떨어질 수 있습니다.
그래서 CDU는 Facility Water와 IT Coolant를 물리적으로 분리하는 Heat Exchanger 역할을 합니다. IT Side Coolant는 Filtering되고 일정한 Temperature와 Flow, Pressure를 유지하도록 관리됩니다.
이 구조 덕분에 고가의 GPU Server를 Facility Water System의 변동과 오염으로부터 분리할 수 있습니다. Liquid Cooling에서 CDU가 핵심 장비가 되는 이유입니다.
Liquid Cooling이라고 모두 같은 방식은 아닙니다
Direct-to-Chip은 현재 AI Server에서 가장 중요한 방식 중 하나지만 Liquid Cooling에는 여러 Architecture가 있습니다.
Rear Door Heat Exchanger(RDHx): Rack 뒤쪽 Door에 Liquid-cooled Heat Exchanger를 설치해 Server에서 나온 뜨거운 공기의 Heat를 Liquid로 제거하는 방식입니다. Server 내부를 크게 바꾸지 않고 Rack Heat를 줄일 수 있다는 장점이 있습니다.
Immersion Cooling: Server Board나 Component를 Dielectric Fluid 안에 직접 담가 Heat를 제거하는 방식입니다. Single-phase와 Two-phase 방식이 있으며 높은 Heat Density를 처리할 수 있지만 Hardware Service, Material Compatibility와 Facility Design이 크게 달라집니다.
Direct-to-Chip: 가장 뜨거운 CPU·GPU에 Cold Plate를 직접 붙이는 방식입니다. 기존 Server Architecture와 비교적 자연스럽게 결합할 수 있어 AI Rack에서 빠르게 확대되고 있습니다.
각 방식은 경쟁하면서도 공존할 수 있습니다. 같은 Data Center에서도 AI Rack에는 Direct-to-Chip을 사용하고 기존 Enterprise Server에는 Air Cooling을 유지할 수 있습니다.
NVIDIA GB200 NVL72가 Liquid Cooling을 보여주는 대표 사례입니다
NVIDIA의 GB200 NVL72 Reference Architecture는 Rack 전체에서 높은 Compute Density를 구현하기 위해 Direct Liquid Cooling을 사용합니다. NVIDIA가 Open Compute Project에 공개한 Design에서는 Rack에 약 120kW 수준의 Cooling Capacity가 필요하고, Compute와 Switch Tray에 Liquid Cooling Manifold를 적용합니다.
이 사례가 중요한 이유는 Liquid Cooling이 실험적인 HPC 기술이 아니라 Mainstream AI Rack Architecture의 기본 요소로 들어왔다는 것입니다. GPU Package Power가 올라가고 Rack-scale System이 보편화될수록 Air Cooling만으로 해결하기 어려운 영역이 늘어날 가능성이 높습니다.
Liquid Cooling은 GPU를 더 차갑게 만드는 것 이상의 의미가 있습니다
GPU는 특정 Temperature를 넘으면 Frequency를 낮추는 Thermal Throttling이 발생할 수 있습니다. Cooling이 충분하지 않으면 Chip의 Peak Performance를 유지하기 어렵습니다.
Liquid Cooling은 Junction Temperature를 안정적으로 관리해 Sustained Performance를 높일 수 있습니다. 즉 같은 GPU를 사용하더라도 Cooling Architecture에 따라 실제 Training Throughput과 System Reliability가 달라질 수 있습니다.
또 Fan Power를 줄이고 더 높은 Coolant Supply Temperature를 사용할 수 있다면 Chiller Energy를 절감할 여지도 있습니다. Data Center 전체 관점에서는 Cooling Power를 줄여 확보한 Power Budget을 추가 GPU에 사용할 수 있습니다.
따라서 Liquid Cooling의 경제성은 단순히 Cooling 장비 전력만 보는 것이 아니라 동일 MW 안에서 얼마나 많은 Compute를 배치하고 안정적으로 운영할 수 있는가로 봐야 합니다.
Warm Water Cooling이 왜 가능할까요?
전통적인 Air Cooling에서는 차가운 Supply Air가 필요하기 때문에 Chilled Water를 낮은 온도로 유지하는 경우가 많습니다. Direct Liquid Cooling은 Cold Plate가 Chip에서 직접 Heat를 받기 때문에 상대적으로 높은 Coolant Temperature에서도 충분한 Heat Transfer가 가능할 수 있습니다.
Supply Water Temperature를 높일 수 있으면 외기가 충분히 차가운 지역에서는 Chiller Compression을 덜 사용하고 Dry Cooler나 Economizer를 활용할 수 있습니다. 이른바 Free Cooling 시간을 늘려 Facility Power를 줄일 수 있습니다.
또 Return Water Temperature가 높으면 Waste Heat Recovery의 가치도 올라갈 수 있습니다. Data Center에서 나온 Heat를 District Heating이나 다른 산업용으로 활용하려면 사용 가능한 온도 수준이 중요하기 때문입니다.
Liquid Cooling의 가장 큰 리스크는 Leak일까요?
Leak은 분명 중요한 위험입니다. GPU와 Board 주변에 Liquid가 흐르기 때문에 Connector와 Hose, Manifold, Cold Plate의 Reliability가 매우 중요합니다. 그래서 Quick Disconnect와 Dripless Connector, Leak Detection Sensor, Pressure Monitoring이 사용됩니다.
하지만 실제 운영에서는 Leak만큼 Fluid Quality도 중요합니다. Coolant에 Particulate가 들어가거나 부식이 발생하면 Cold Plate Channel이 막힐 수 있고 Pump와 Seal 수명에 영향을 줄 수 있습니다.
Material Compatibility도 중요합니다. Copper, Aluminum, Stainless Steel과 다양한 Seal Material이 Coolant와 장기간 접촉하므로 Galvanic Corrosion과 Chemical Stability를 고려해야 합니다.
즉 Liquid Cooling은 단순 배관공사가 아니라 Fluid Chemistry와 Reliability Engineering이 필요한 Infrastructure입니다.
Condensation을 막아야 하는 이유
Cold Plate나 Pipe의 표면온도가 Data Center 공기의 Dew Point보다 낮아지면 표면에 물방울이 맺힐 수 있습니다. 전자장비 주변의 Condensation은 매우 위험합니다.
그래서 CDU는 Secondary Coolant Temperature를 Dew Point보다 충분히 높게 유지하도록 제어합니다. Liquid Cooling이라고 무조건 Coolant를 최대한 차갑게 만드는 것이 좋은 것이 아닙니다.
오히려 AI Data Center에서는 필요한 만큼만 차갑게 공급하고 높은 Water Temperature로 Cooling Efficiency를 높이는 것이 중요한 설계방향입니다.
Pump Power도 무시할 수 없습니다
Air Cooling에서는 Fan이 공기를 움직이고 Liquid Cooling에서는 Pump가 Coolant를 움직입니다. Cold Plate의 미세 Channel을 통과시키고 여러 Rack으로 Flow를 분배하려면 Pressure가 필요합니다.
Flow Rate를 높이면 Heat Transfer가 좋아질 수 있지만 Pump Power와 Pressure Drop도 증가합니다. 그래서 Cold Plate Channel Design, Hose Diameter, Manifold와 CDU Pump Efficiency가 중요합니다.
결국 Liquid Cooling도 무한히 효율적인 기술은 아닙니다. Heat Transfer Performance와 Pumping Power 사이의 최적점을 찾아야 합니다.
Cooling Architecture가 Server Design까지 바꿉니다
Liquid Cooling을 도입하면 Heat Sink와 Fan만 바꾸는 것이 아닙니다. Server Tray에 Cold Plate와 Hose, Quick Disconnect가 추가되고 Rack에는 Manifold가 필요합니다. CDU와 Facility Piping까지 연결해야 합니다.
이 때문에 Server ODM과 Rack Manufacturer, Cooling Vendor가 초기에 함께 설계해야 합니다. GPU Platform이 발표된 뒤 Cooling을 나중에 붙이는 방식보다 Chip, Server, Rack, Facility를 Co-design하는 방식이 중요해지고 있습니다.
AI Infrastructure에서 System Design의 중심이 Chip 단위에서 Rack 단위로 이동하는 대표적인 사례입니다.
누가 돈을 벌 수 있을까요?
Liquid Cooling Value Chain에는 Cold Plate, Quick Disconnect, Manifold, Pump, CDU, Heat Exchanger, Chiller, Dry Cooler, Fluid Management와 Engineering Service 업체가 포함됩니다.
Vertiv와 Schneider Electric 같은 Data Center Infrastructure 업체는 CDU와 Facility Cooling Solution을 확대하고 있고, Server·Rack 업체들도 Liquid-cooled System Integration 역량을 강화하고 있습니다. Cold Plate와 Connector 전문업체도 AI Rack당 Content 증가의 수혜를 받을 수 있습니다.
하지만 단순히 “Liquid Cooling 시장이 성장한다”보다 어느 업체가 Hyperscaler Qualification, 글로벌 Service, Leak Reliability, High-capacity CDU와 Rack Integration을 확보했는지 보는 것이 중요합니다.
투자 관점에서 확인할 포인트
첫 번째는 Rack Power Density입니다. 50kW에서 100kW, 이후 더 높은 Density로 갈수록 Direct Liquid Cooling의 필요성이 커집니다.
두 번째는 Liquid-cooled Rack의 실제 출하량입니다. GPU 발표보다 Server OEM과 Hyperscaler의 Production Deployment가 중요합니다.
세 번째는 CDU Capacity와 설치위치입니다. In-rack, In-row, Perimeter, Facility-level CDU 중 어떤 Architecture가 많이 채택되는지에 따라 Equipment Content가 달라집니다.
네 번째는 Service Revenue입니다. Liquid Cooling은 설치 후에도 Fluid Management, Filter 교체, Leak Test와 Maintenance가 필요해 Lifecycle Service 기회가 커질 수 있습니다.
다섯 번째는 Warm Water Cooling과 Heat Reuse입니다. Cooling 효율이 Data Center PUE와 Power Availability에 얼마나 기여하는지가 장기적인 경제성을 좌우합니다.
핵심 정리
| 질문 | 답 |
| Liquid Cooling이란? | Liquid Coolant를 이용해 CPU·GPU의 Heat를 직접 또는 간접적으로 제거하는 Cooling 방식입니다 |
| 왜 AI 서버에 필요한가요? | GPU와 HBM의 Power Density가 높아지면서 Airflow만으로 Heat를 제거하기 어려워지기 때문입니다 |
| 가장 많이 쓰이는 방식은? | AI Rack에서는 Direct-to-Chip Liquid Cooling이 빠르게 확대되고 있습니다 |
| CDU는 왜 필요한가요? | IT Coolant를 Facility Water와 분리하고 Temperature, Flow, Pressure, Fluid Quality를 제어하기 위해 필요합니다 |
| Air Cooling은 사라지나요? | 아닙니다. Liquid와 Air를 함께 사용하는 Hybrid Cooling이 일반적입니다 |
| 투자포인트는? | Rack Density, Liquid-cooled Server Volume, CDU Capacity, Service와 Facility Retrofit입니다 |
AI 서버에서 Liquid Cooling이 필요한 이유는 GPU가 단순히 뜨거워졌기 때문이 아닙니다. Compute Density가 올라가면서 Cooling이 더 이상 Chip의 주변기능이 아니라 Rack에 GPU를 얼마나 많이 넣을 수 있는지를 결정하는 Capacity Layer가 됐기 때문입니다.
앞으로 GPU 성능이 높아질수록 Power Delivery와 Liquid Cooling은 함께 움직일 가능성이 높습니다. 즉 AI Infrastructure를 볼 때 Cooling은 Data Center Facility의 뒷단이 아니라 GPU 성능을 실제 Revenue-generating Compute로 바꾸기 위한 핵심 Layer로 봐야 합니다.
curiouszip
댓글 0
첫 댓글을 남겨보세요.