CDU란? AI 데이터센터 액체냉각의 핵심 장비
AI Data Center에서 Direct Liquid Cooling을 도입하면 GPU 위의 Cold Plate만 설치해서 끝나는 것이 아닙니다. Server 수십 대에서 돌아온 뜨거운 Coolant를 모으고, Temperature와 Pressure를 맞추고, Heat를 Facility Cooling System으로 넘긴 뒤 다시 깨끗한 Coolant를 Server로 보내야 합니다.
이 역할을 담당하는 장비가 CDU(Coolant Distribution Unit)입니다.
CDU: Liquid Cooling System에서 IT Equipment 쪽 Secondary Coolant Loop의 Temperature, Flow, Pressure와 Fluid Quality를 제어하고, Heat Exchanger를 통해 Facility Cooling Loop로 열을 전달하는 장비입니다.
쉽게 말하면 CDU는 AI Rack의 냉각수 Pump Station이면서 Heat Exchanger, Control System, Safety System을 하나로 묶은 장비라고 볼 수 있습니다.
GPU가 AI Data Center의 Compute Engine이라면 CDU는 고밀도 Rack이 지속적으로 동작할 수 있도록 열을 운반하는 Thermal Infrastructure의 핵심입니다.
CDU는 왜 필요한가요?
Facility에서 사용하는 Chilled Water를 GPU Cold Plate에 바로 흘려보내면 구조가 단순해 보입니다. 하지만 실제로는 여러 문제가 있습니다.
Facility Water에는 Particle과 Chemical, Corrosion Product가 존재할 수 있고 Pressure와 Temperature가 계속 변할 수 있습니다. Cold Plate의 내부 Channel은 좁기 때문에 오염에 민감하고, Server Manufacturer가 요구하는 Coolant Chemistry와 Facility Water Specification이 다를 수 있습니다.
또 Data Center Building의 Water Loop에 문제가 생겼을 때 GPU Server까지 직접 영향을 받게 됩니다. 그래서 일반적으로 Facility Water System(FWS)과 Technology Cooling System(TCS)을 분리합니다.
CDU의 Heat Exchanger가 두 Loop 사이에서 Heat만 전달합니다. 물 자체는 섞이지 않습니다.
CDU 안에는 무엇이 들어갈까요?
| 구성 | 역할 |
| Heat Exchanger | IT Coolant의 Heat를 Facility Water나 Air로 전달 |
| Pump | Secondary Coolant를 Rack과 Server로 순환 |
| Filter | Particle과 Debris를 제거해 Cold Plate를 보호 |
| Valve | Flow와 Pressure를 조절하고 Maintenance 시 Loop를 격리 |
| Sensor | Temperature, Flow, Pressure, Conductivity 등을 측정 |
| Controller | Pump Speed와 Valve를 자동제어하고 Alarm을 관리 |
| Reservoir | Coolant Volume과 Expansion을 관리하는 데 사용될 수 있음 |
| Leak Detection | 비정상적인 Fluid Loss를 감지 |
제품과 Architecture에 따라 구성은 다르지만 핵심은 Heat Transfer와 Fluid Control, Monitoring을 동시에 수행한다는 것입니다.
Primary Loop와 Secondary Loop를 이해해야 합니다
Primary Loop: Data Center Facility의 Chilled Water나 Heat Rejection System과 연결되는 Cooling Loop입니다.
Secondary Loop: CDU에서 Rack, Manifold, Cold Plate까지 연결돼 실제 IT Equipment 가까이에서 Coolant를 순환시키는 Loop입니다.
CDU는 두 Loop 사이에 있는 Heat Exchanger를 통해 Secondary Coolant가 가져온 Heat를 Primary Loop로 넘깁니다. 이 구조 덕분에 IT Side Coolant를 더 깨끗하고 일정한 상태로 유지할 수 있습니다.
만약 Building Water Pressure가 갑자기 변해도 Secondary Loop는 CDU의 Pump와 Controller를 통해 안정적으로 관리할 수 있습니다. 고가의 GPU Hardware를 Facility System과 분리하는 Safety Barrier 역할도 합니다.
Liquid-to-Liquid CDU는 어떻게 작동할까요?
Liquid-to-Liquid CDU: Secondary Coolant가 가져온 Heat를 Heat Exchanger를 통해 Facility Water로 전달하는 방식입니다.
대형 AI Data Center에서 높은 Cooling Capacity를 처리하기에 유리합니다. Facility에 충분한 Chilled Water 또는 Warm Water Loop가 있다면 높은 Efficiency를 얻을 수 있고, 수백 kW에서 MW급 Heat Load를 처리하는 CDU도 구축할 수 있습니다.
Vertiv의 현재 CoolChip CDU Portfolio에는 In-rack부터 2MW 이상 Capacity까지 다양한 Liquid-to-Liquid Architecture가 존재합니다. 이는 AI Rack의 Cooling Density가 단순 10~20kW 수준을 넘어 훨씬 높은 수준으로 이동하고 있음을 보여줍니다.
Liquid-to-Air CDU도 있습니다
Liquid-to-Air CDU: Secondary Coolant의 Heat를 Facility Water가 아니라 Air Coil을 통해 Data Center 공기로 전달하는 방식입니다.
기존 Air-cooled Data Center에 소수의 Liquid-cooled AI Rack을 추가할 때 유용할 수 있습니다. Building에 새로운 Chilled Water Pipe를 크게 설치하지 않고 Localized Liquid Cooling을 도입할 수 있기 때문입니다.
다만 결국 Heat를 공기로 다시 버리기 때문에 Capacity와 Efficiency 면에서는 Liquid-to-Liquid보다 제한적일 수 있습니다. AI Deployment가 커지면 Facility Water Infrastructure로 이동하는 경우가 많을 수 있습니다.
즉 CDU Architecture는 Data Center가 처음부터 AI용으로 지어졌는지, 기존 Facility를 Retrofit하는지에 따라 달라집니다.
In-rack, In-row, Perimeter CDU는 무엇이 다를까요?
In-rack CDU는 Server Rack 내부에 설치됩니다. Secondary Loop가 짧아지고 Deployment가 빠르다는 장점이 있지만 Rack Space를 사용합니다. 초기 AI Testbed나 개별 Rack 단위 확장에 유리할 수 있습니다.
In-row CDU는 여러 Rack이 공유하도록 Row 안에 설치합니다. Rack Space를 절약하면서 여러 High-density Rack의 Coolant를 관리할 수 있습니다.
Perimeter 또는 Mechanical Room CDU는 더 많은 Rack을 하나의 큰 System으로 관리합니다. Hyperscale AI Data Center에서 Cooling Capacity를 집중적으로 제공하기에 유리하지만 Piping과 Redundancy Architecture가 복잡해집니다.
어떤 방식이 정답인 것은 아닙니다. Deployment Scale과 Failure Domain, Serviceability를 어떻게 설계하느냐가 핵심입니다.
CDU Capacity는 왜 급격히 커지고 있을까요?
Rack당 20kW를 냉각하는 Facility에서는 100kW CDU 하나로 여러 Rack을 처리할 수 있습니다. 하지만 AI Rack 하나가 100kW를 넘으면 같은 CDU가 Rack 한두 개만 담당하게 됩니다.
GPU Rack Density가 계속 올라가면 CDU도 수백 kW에서 MW급으로 확대됩니다. 이는 Pump, Heat Exchanger, Pipe Diameter와 Facility Water Capacity 모두를 키워야 한다는 의미입니다.
따라서 AI Server Shipment가 늘어난다는 사실만 보는 것보다 Rack당 Cooling kW와 CDU당 지원 Rack 수를 봐야 Cooling Equipment Market의 실제 규모를 이해할 수 있습니다.
왜 Temperature Control이 중요할까요?
GPU가 일정한 Temperature에서 동작하도록 Coolant Supply Temperature를 안정적으로 유지해야 합니다. Load가 갑자기 증가하면 Return Coolant Temperature가 올라가고, CDU는 Pump와 Valve를 조절해 Supply Condition을 유지합니다.
너무 차갑게 공급하면 Condensation 위험이 생길 수 있습니다. Pipe와 Cold Plate 표면이 Data Center Dew Point보다 낮아지면 물방울이 생길 수 있기 때문입니다.
따라서 CDU는 Cooling 성능뿐 아니라 Dew Point 이상의 안전한 Temperature 범위를 유지하는 Control System이기도 합니다.
Pressure와 Flow를 잘못 관리하면 어떤 문제가 생길까요?
Flow가 너무 낮으면 Cold Plate가 충분한 Heat를 운반하지 못하고 GPU Temperature가 올라갑니다. 반대로 Flow를 과도하게 높이면 Pump Power가 증가하고 Pressure가 높아져 Connector와 Hose에 부담을 줄 수 있습니다.
또 여러 Rack이 하나의 CDU를 공유하면 가까운 Rack에 Coolant가 너무 많이 흐르고 먼 Rack에는 부족한 Hydraulic Imbalance가 생길 수 있습니다. Balancing Valve와 Differential Pressure Control이 필요한 이유입니다.
즉 CDU는 물을 단순히 순환시키는 Pump가 아니라 Rack별 Thermal Demand에 맞춰 Flow를 배분하는 Distribution System입니다.
Fluid Quality가 중요한 이유
Cold Plate 내부에는 Heat Transfer Area를 늘리기 위한 좁은 Microchannel이 사용될 수 있습니다. 작은 Particle이나 Corrosion Product도 Channel을 막고 Pressure Drop을 증가시킬 수 있습니다.
그래서 CDU에는 Filter가 들어가고 Coolant의 Conductivity, pH와 Chemical 상태를 관리해야 합니다. Material Compatibility가 맞지 않으면 Galvanic Corrosion이 발생할 수 있고, 부식 부산물이 Loop 전체를 오염시킬 수 있습니다.
Hyperscale Liquid Cooling에서는 Fluid 자체가 하나의 Maintenance Item이 됩니다. Data Center Operator는 Server뿐 아니라 Coolant Chemistry와 Filter, Water Treatment Lifecycle까지 관리해야 합니다.
Redundancy가 중요한 이유
CDU Pump 하나가 고장 났다고 GPU 수백 개가 Thermal Shutdown되는 상황은 허용하기 어렵습니다. 그래서 High-availability CDU는 N+1 Pump, Dual Power Feed, Redundant Controller와 Bypass Architecture를 사용할 수 있습니다.
특히 AI Training Job은 여러 Rack이 동시에 하나의 Job에 참여합니다. Cooling Fault로 Rack 하나가 빠지면 단순 Server 장애보다 Cluster Job에 더 큰 영향을 줄 수 있습니다.
따라서 CDU의 Reliability는 Facility 수준의 문제이면서 GPU Uptime과 Training Goodput의 문제입니다.
Leak Detection은 어떻게 하나요?
Liquid Cooling에서는 Hose와 Quick Disconnect, Manifold, Cold Plate, CDU 등 연결지점이 많아집니다. 각 Joint는 Potential Leak Point가 될 수 있습니다.
System은 Drip Tray와 Cable-type Leak Sensor, Pressure Drop Monitoring, Reservoir Level Monitoring 등을 이용해 Leak를 감지할 수 있습니다. 일부 Architecture는 Flow를 즉시 차단해 특정 Rack만 Isolation하도록 설계됩니다.
중요한 것은 “Leak가 절대 발생하지 않는다”는 가정보다 Leak가 발생해도 빠르게 감지하고 Failure Domain을 작게 제한하는 것입니다.
CDU가 Facility Design을 바꾸는 이유
Air Cooling Data Center에서는 Raised Floor나 Overhead Duct를 이용해 공기를 배분했습니다. Liquid Cooling에서는 Rack까지 Supply와 Return Pipe를 설치해야 합니다.
Pipe가 늘어나면 Floor Loading, Ceiling Space, Maintenance Access, Drip Protection을 고려해야 합니다. 기존 Data Center를 Retrofit할 때는 배관을 어디로 통과시킬지 자체가 큰 Project가 됩니다.
또 CDU에서 Facility Water로 넘긴 Heat를 Cooling Tower, Dry Cooler, Chiller가 처리할 수 있어야 합니다. 따라서 CDU Capacity만 늘린다고 문제가 해결되지 않고 Facility Heat Rejection Capacity까지 함께 증설해야 합니다.
Warm Water Cooling과 CDU의 관계
Direct Liquid Cooling은 비교적 높은 Supply Water Temperature에서도 Chip Heat를 제거할 수 있습니다. CDU가 Secondary Loop를 안정적으로 제어하면 Facility 쪽에서도 더 높은 Water Temperature를 사용할 수 있는 여지가 생깁니다.
이 경우 Chiller 사용시간을 줄이고 Outdoor Air를 활용한 Economization을 늘릴 수 있습니다. 또한 Return Water Temperature가 높아지면 Waste Heat Reuse에 유리할 수 있습니다.
따라서 CDU는 Cooling Capacity를 제공하는 장비를 넘어 Data Center의 Energy Efficiency와 Heat Reuse Architecture를 연결하는 장비가 될 수 있습니다.
주요 업체는 어디에 있을까요?
Vertiv는 In-rack, In-row와 High-capacity CDU까지 다양한 Liquid Cooling Portfolio를 확대하고 있습니다. Schneider Electric도 Motivair 인수 등을 통해 CDU와 Liquid Cooling 역량을 강화하고 있으며 Data Center Power와 Cooling을 통합해서 제공하는 방향으로 움직이고 있습니다.
또 CoolIT Systems 같은 Direct Liquid Cooling 전문업체, Server OEM과 Rack Manufacturer, Pump·Heat Exchanger·Connector 업체도 Value Chain에 참여합니다.
투자 관점에서는 단순 CDU 판매량보다 GPU Platform Qualification, Capacity Range, Global Installation·Service Network, Facility Power 제품과의 Cross-sell이 중요한 경쟁요소입니다.
CDU 시장을 볼 때 주의할 점
첫 번째는 모든 Liquid-cooled Rack이 동일한 CDU Content를 필요로 하지 않는다는 것입니다. In-rack CDU를 쓰는 경우도 있고 여러 Rack이 대형 CDU를 공유할 수도 있습니다.
두 번째는 신규 Data Center와 Retrofit의 Architecture가 다릅니다. Greenfield Hyperscale Facility는 Facility Water 중심의 대형 Liquid-to-Liquid System을 설계할 수 있지만 기존 Enterprise Data Center는 Liquid-to-Air 방식으로 시작할 수 있습니다.
세 번째는 CDU Capacity 증가가 Unit Volume 감소로 이어질 수도 있습니다. 하나의 2MW CDU가 많은 Rack을 담당한다면 Rack 수와 CDU 수가 1:1로 증가하지 않습니다.
따라서 시장을 분석할 때는 Rack 수보다 총 Liquid Cooling kW와 Dollar per kW를 보는 편이 더 정확합니다.
투자 관점에서 확인할 지표
첫 번째는 Liquid-cooled AI Rack의 출하량과 Rack당 Power Density입니다. 둘이 함께 증가하면 Cooling Capacity Demand가 크게 늘어납니다.
두 번째는 CDU의 Capacity Mix입니다. 100kW급 In-rack에서 수백 kW·MW급 In-row와 Facility CDU로 이동하는지 확인할 필요가 있습니다.
세 번째는 Service와 Aftermarket입니다. Pump, Filter, Fluid, Sensor는 운영 중 Maintenance가 필요해 Installed Base가 커질수록 Recurring Revenue 기회가 생길 수 있습니다.
네 번째는 Hyperscaler Standardization입니다. 특정 CDU와 Quick Disconnect Architecture가 Major GPU Platform과 표준화되면 공급업체의 Volume과 Customer Stickiness가 높아질 수 있습니다.
핵심 정리
| 질문 | 답 |
| CDU란? | IT Side Coolant의 Temperature·Flow·Pressure·Fluid Quality를 제어하고 Facility Loop로 Heat를 전달하는 장비입니다 |
| 왜 필요한가요? | GPU Cold Plate에 안정적이고 깨끗한 Coolant를 공급하면서 Facility Water와 IT Equipment를 분리하기 위해 필요합니다 |
| Liquid-to-Liquid와 Liquid-to-Air 차이는? | Heat를 Facility Water로 넘기느냐 Data Center 공기로 넘기느냐의 차이입니다 |
| 설치 위치는? | In-rack, In-row, Perimeter·Mechanical Room 등 다양한 구조가 가능합니다 |
| 가장 중요한 기능은? | Heat Exchange뿐 아니라 Pump, Filtration, Temperature·Pressure Control, Leak Detection과 Redundancy입니다 |
| 투자포인트는? | 총 Cooling kW, Rack Density, CDU Capacity Mix, Hyperscaler Qualification, Service Revenue입니다 |
CDU는 눈에 띄는 AI Semiconductor는 아니지만 고밀도 GPU Rack을 실제 Data Center에서 지속적으로 운영하게 만드는 Thermal Infrastructure입니다. GPU Rack Density가 높아질수록 Cooling Loop는 더 복잡해지고, Coolant를 정밀하게 관리하는 CDU의 역할도 커집니다.
특히 Liquid Cooling이 일부 HPC Room의 특수기술에서 Mainstream AI Data Center Architecture로 이동하면서 CDU는 단순 Cooling Equipment가 아니라 Power Density 증가를 가능하게 하는 AI Infrastructure Capacity Layer로 봐야 합니다.
curiouszip
댓글 0
첫 댓글을 남겨보세요.