1GW AI 데이터센터에는 GPU가 몇 개 들어갈까 ― 전력에서 역산하는 AI 인프라 구조 (심화판)
Facility Power와 IT Load — PUE라는 첫 번째 감쇠 구간
데이터센터 외부에서 유입되는 전력(Facility Power)과 실제 IT 장비가 쓰는 전력(IT Load)은 같지 않습니다. 이 둘의 비율이 PUE(Power Usage Effectiveness)입니다.
PUE = 전체 시설 전력 ÷ IT 장비 전력
Uptime Institute의 2026년 Global Data Center Survey(16회차, 800개 이상 사업자 응답)는 업계 전체 단순평균 PUE를 1.52로 발표했습니다. 다만 이는 소규모의 노후 시설이 다수 섞인 산술평균이라, 용량 가중 평균으로 다시 계산하면 1.36까지 낮아집니다. 이는 최근 지어지는 대형·고효율 시설이 통계를 유의미하게 끌어내리고 있다는 뜻이며, 신축 AI 전용 캠퍼스는 PUE 1.2 전후를 목표로 설계하는 경우가 흔합니다(독일의 에너지효율법은 2026년 7월 이후 신축 데이터센터에 PUE 1.2 이하를 아예 의무화하기 시작했습니다).
이번 모델에서도 PUE 1.20을 기준값으로 사용합니다.
1,000MW ÷ 1.20 = 약 833MW (실제 IT Load)
즉 1GW를 끌어와도 약 167MW는 냉각·전력변환 설비에서 소모되고, 833MW만 서버·네트워크·스토리지로 전달됩니다.
두 개의 “Rubin Rack” — NVL8 SuperPOD와 NVL72, 무엇을 기준으로 삼을 것인가
여기서부터가 원문과 가장 크게 달라지는 지점입니다. Rubin 세대에서 실제로 존재하는 랙 아키텍처는 하나가 아니라 두 종류입니다.
(A) DGX SuperPOD with DGX Rubin NVL8 — NVIDIA가 수치를 공식화한 랙
NVIDIA의 DGX SuperPOD Rubin NVL8 Reference Architecture 문서에 따르면, 표준 랙 하나에 DGX Rubin NVL8 시스템 8대를 배치하고, 각 시스템에 Rubin GPU 8개가 들어가 랙당 총 64개의 GPU가 탑재됩니다. 이 랙의 전력 소비는 NVIDIA가 명시적으로 “약 225kW”라고 공개했습니다. 랙 하나를 이루는 전원 공급 유닛은 110kW짜리 4개를 N+N 이중화로 구성해 최대 220kW를 공급하는 구조입니다. 하나의 Scalable Unit(SU)은 이 랙 72개(=DGX Rubin NVL8 노드 576개, GPU 4,608개)로 구성되고, Reference Architecture는 SU 8개(랙 576개, GPU 36,864개) 규모까지, 확장 시 SU 72개(노드 2,000개 이상)까지 다룹니다.
(B) Vera Rubin NVL72 — 시장에서 더 널리 언급되지만 랙 전력이 비공식인 랙
한편 CES 2026과 GTC 2026에서 더 크게 부각된 것은 랙 하나에 Rubin GPU 72개와 Vera CPU 36개를 담는 Vera Rubin NVL72입니다. 이 구성은 NVLink 6 스위치로 랙 내부 GPU를 묶어 260TB/s의 집계 대역폭을 제공합니다. 문제는, NVIDIA가 이 랙의 소비전력을 공식 스펙시트에 올리지 않았다는 점입니다. 업계에서 통용되는 190kW(Max-Q, 전력 절약형)~230kW(Max-P, 최대 성능형)라는 숫자는 반도체 서플라이체인 분석가 궈밍치(Ming-Chi Kuo)가 2026년 1월 CES 직후 배포한 자료에서 출발한 추정치이며, 다수 매체가 같은 출처를 재인용하고 있을 뿐 NVIDIA가 확인한 값은 아닙니다. 이 값을 GPU 1개당으로 환산하면 Max-Q 기준 약 2.64kW/GPU, Max-P 기준 약 3.19kW/GPU입니다.
두 랙을 나란히 놓으면
| 구분 | DGX SuperPOD Rubin NVL8 | Vera Rubin NVL72 |
|---|---|---|
| 랙당 GPU 수 | 64개 | 72개 |
| 랙 전력 | 약 225kW (NVIDIA 공식) | 약 190~230kW (비공식 추정) |
| GPU당 랙 전력 환산 | 약 3.52kW | 약 2.64~3.19kW |
| 출처 신뢰도 | 높음 (공식 Reference Architecture) | 중간 (서플라이체인 추정) |
두 랙 모두 GPU 자체의 TDP(약 1.8~2.3kW, 이 또한 NVIDIA가 공식화하지 않은 Max-Q/Max-P 추정치)보다 훨씬 높은 “GPU당 전력”이 나옵니다. 그 차이는 CPU(Vera), NIC(ConnectX-9), DPU(BlueField-4), NVLink 스위치, 전원 변환 손실 등 GPU 주변 시스템 전체가 포함되기 때문입니다. GPU TDP만으로 계산하면 이 주변 인프라 전력이 통째로 누락되므로, 대규모 데이터센터를 분석할 때는 랙 단위 전력밀도를 쓰는 것이 훨씬 현실적이라는 원문의 관점은 여전히 유효합니다.
이 글에서는 원문과의 연속성을 위해 NVIDIA가 공식 수치를 공개한 (A) DGX SuperPOD Rubin NVL8(225kW/64GPU)을 기본 모델로 유지하되, (B) NVL72 기준으로 계산했을 때 결과가 어떻게 달라지는지도 병기합니다.
1GW 시설의 AI Compute Rack 배분
기준 조건은 다음과 같습니다.
| 항목 | 기준값 |
|---|---|
| Facility Power | 1,000MW |
| PUE | 1.20 |
| 실제 IT Load | 약 833MW |
| AI Compute Rack 배분 | IT Load의 70% |
| Compute Rack 전력 | 약 583MW |
IT Load 중 70%를 Compute Rack에 배분한다는 가정은 Network Rack, Storage, Control Plane, 보안 장비, 관리 서버 등 비(非)컴퓨트 IT 전력을 제외하기 위한 것으로, 뒤에서 실제 사례로 이 가정의 타당성을 검증합니다.
(A) DGX SuperPOD Rubin NVL8 기준
583MW ÷ 0.225MW/랙 ≈ 2,593랙
2,593랙 × 64GPU/랙 ≈ 165,926개
(B) Vera Rubin NVL72 기준 (Max-P 230kW 가정)
583MW ÷ 0.230MW/랙 ≈ 2,535랙
2,535랙 × 72GPU/랙 ≈ 182,522개
같은 583MW라도 어떤 랙 아키텍처를 채택하느냐에 따라 GPU 수는 약 16.6만 개에서 18.3만 개까지, 10% 정도 차이가 납니다. 랙당 GPU 수는 NVL72가 많지만 랙당 전력도 함께 높기 때문에 격차가 상쇄되는 구조입니다.
조건을 바꾸면 얼마나 달라지는가 (NVL8 기준)
| 시나리오 | PUE | Compute Rack 비중 | IT Load | 예상 GPU |
|---|---|---|---|---|
| 보수적 | 1.30 | 55% | 약 769MW | 약 12.0만 개 |
| 기준 | 1.20 | 70% | 약 833MW | 약 16.6만 개 |
| 고밀도 | 1.15 | 80% | 약 870MW | 약 19.8만 개 |
실제 사례로 검증하기 — 일본 Noetra 140MW 프로젝트
이론적 모델을 실제 발표된 프로젝트와 비교하면 이 계산 방식의 설득력을 훨씬 더 높일 수 있습니다.
2026년 7월, NVIDIA는 일본의 국가 AI 인프라 컨소시엄 Noetra Corp.과 함께 140MW 규모, Rubin GPU 27,500개, Vera CPU 13,750개로 구성된 AI 팩토리를 구축한다고 발표했습니다. 이 조합은 Vera Rubin NVL72 랙 382개(랙당 GPU 72개, CPU 36개)로 정확히 나뉩니다.
이 숫자를 거꾸로 검증해 보면:
- 랙 전력을 Max-P 230kW로 가정하면, 382랙 × 0.230MW ≈ 87.9MW가 컴퓨트 랙에 들어간 전력입니다.
- 140MW를 전체 Facility Power로, PUE를 1.20으로 가정하면 IT Load는 140 ÷ 1.20 ≈ 116.7MW입니다.
- 컴퓨트 랙 전력이 IT Load에서 차지하는 비중은 87.9 ÷ 116.7 ≈ **75.3%**입니다.
이 수치는 원문과 이 글이 가정한 “IT Load의 70%가 Compute Rack”이라는 전제와 놀랍도록 가깝습니다. 즉 이론 모델의 핵심 가정이 실제 국가급 프로젝트의 구성비와 크게 벗어나지 않는다는 뜻입니다.
같은 방식으로 GPU/MW 밀도를 구하면 27,500 ÷ 140 ≈ 196.4 GPU/MW, 이를 1GW로 환산하면:
196.4 GPU/MW × 1,000MW ≈ 196,400개
이는 이 글의 “기준” 시나리오(16.6만 개)보다는 높고 “고밀도” 시나리오(19.8만 개)에는 근접한 값으로, 앞서 제시한 12만~20만 개 범위 안에 들어옵니다. 이론적으로 역산한 모델과 실제 발표된 국가 프로젝트의 밀도가 같은 자릿수, 같은 범위 안에서 수렴한다는 것은 이 계산 방식이 실무적으로도 신뢰할 만하다는 근거가 됩니다.
NVIDIA가 말하는 “100MW = 4만 GPU”는 왜 실제보다 낙관적인가
NVIDIA는 여러 공개 행사에서 “100MW AI Factory” 단위를 마케팅 지표로 자주 사용합니다. Hot Chips 2026 발표 자료에 따르면 NVIDIA는 Rubin 기반 100MW AI Factory가 2 ZFLOPS급 NVFP4 추론 성능과 11PB의 HBM4 메모리, 800PB/s의 메모리 대역폭을 낸다고 공개했습니다. GPU당 HBM4가 288GB이므로 11PB를 역산하면 11,000,000GB ÷ 288GB ≈ 38,200개 수준으로, 원문이 언급한 “100MW당 4만 개”와 대략 일치합니다.
그런데 이 수치에는 중요한 전제가 숨어 있습니다. NVIDIA는 이 “at-scale” 수치가 DSX와 MaxLPS(Max Layer Power Steering) 기술을 적용한 결과라고 명시하고 있습니다. DSX MaxLPS는 랙·워크로드 단위로 전력을 동적으로 재배분해 “같은 전력 예산 안에 최대 40% 더 많은 GPU”를 넣을 수 있다고 주장하는 소프트웨어·전력 관리 기술입니다. 다시 말해 이 수치는 표준 정적 전력 프로비저닝이 아니라, 45°C 냉각수 온도를 견디는 액체 냉각과 실시간 전력 스티어링을 전제로 한 최적화된 상한값입니다.
반면 앞서 검증한 일본 Noetra 프로젝트는 140MW에 27,500개, 즉 100MW로 환산하면 약 19,640개입니다. NVIDIA의 이상화된 “4만 개” 수치의 정확히 절반 수준입니다.
이 차이는 다음과 같은 이유로 설명할 수 있습니다.
- Noetra 수치는 실제 조달·설계된 랙 수를 기반으로 한 값이고, NVIDIA의 100MW 수치는 DSX MaxLPS를 완전히 적용했을 때의 이론적 최대치입니다.
- 100MW라는 기준점이 Utility Input인지, IT Load인지, 혹은 컴퓨트 랙에만 배분된 전력인지가 발표마다 다르게 정의될 수 있습니다.
- 국가 단위 프로젝트는 여유율(redundancy), 단계적 증설, 초기 냉각 인프라의 보수적 설계 등으로 인해 카탈로그 스펙보다 낮은 밀도로 구축되는 경우가 많습니다.
즉 원문이 “10배하면 40만 GPU”라는 단순 계산과 “16.6만 개”라는 역산 모델 사이의 괴리를 “시스템 경계가 다르다”는 정성적 설명으로 처리했다면, 이 글은 실제 배치 사례라는 정량적 근거로 그 괴리의 크기(약 2배)와 이유를 구체적으로 짚었다는 점에서 차이가 있습니다. 앞으로 “100MW AI Factory” 같은 벤더 지표를 접할 때는 그것이 DSX MaxLPS 같은 소프트웨어 최적화를 전제로 한 상한선인지, 실제 조달 기준의 평균치인지를 구분해서 읽어야 합니다.
Memory Layer — GPU 16.6만 개는 HBM4 약 47.8PB
Rubin GPU는 GPU당 최대 288GB의 HBM4를 8개 스택으로 탑재하고, 스택당 인터페이스 폭을 HBM3e 대비 2배인 2,048비트로 넓혀 최대 22TB/s의 대역폭을 냅니다(Blackwell의 HBM3e 8TB/s 대비 2.8배).
기준 모델의 165,926개 GPU에 적용하면:
165,926 × 288GB ≈ 47.8PB (HBM4 총 용량)
165,926 × 22TB/s ≈ 3.65EB/s (단순 합산 대역폭)
이는 각 GPU의 메모리 서브시스템이 독립적으로 동작하기 때문에 하나의 공유 메모리처럼 쓸 수 있다는 의미는 아니며, Compute Capacity가 커질수록 필요한 물리적 HBM 생산량이 얼마나 큰 규모로 증가하는지를 보여주는 지표입니다. 실제로 이 물량은 HBM 공급망에도 병목으로 작용하고 있습니다. SK hynix와 삼성전자는 2025년 4분기부터 HBM4 양산에 들어갔지만 수율은 성숙한 HBM3e 대비 아직 낮은 수준으로 알려져 있고, Micron은 2026년 3월 GTC에서 Vera Rubin向 HBM4 36GB 스택(12-Hi)의 양산을 공식화했습니다.
Network Layer — Scale-up과 Scale-out을 구분해야 한다
원문은 GPU당 1.6Tb/s라는 하나의 네트워크 대역폭만 언급했지만, Rubin 세대의 네트워크는 성격이 다른 두 계층으로 나뉩니다.
Scale-up (랙 내부, NVLink 6): GPU끼리 랙 안에서 직접 통신하는 계층으로, GPU당 3.6TB/s의 양방향 대역폭을 제공합니다(NVLink 5의 1.8TB/s 대비 2배). NVL72 랙 전체로는 260TB/s의 집계 대역폭이 나옵니다.
Scale-out (랙과 랙 사이, ConnectX-9 SuperNIC): 원문이 인용한 GPU당 최대 1.6Tb/s가 바로 이 계층입니다. NVIDIA 공식 제품 페이지에 명시된 수치로, ConnectX-9가 포트당 최대 800Gb/s를 지원하므로 GPU당 2포트를 할당하는 구성으로 1.6Tb/s를 낸다고 볼 수 있습니다.
165,926개 GPU에 Scale-out 대역폭 1.6Tb/s를 단순 합산하면:
165,926 × 1.6Tb/s ≈ 265.5Pb/s
이를 102.4Tbps급 스위치 용량으로 나누면 약 2,593이 나오지만, 이는 실제 스위치 물리 대수가 아니라 Leaf-Spine 구조, Fabric Plane, 이중화, 오버서브스크립션을 걷어낸 이론적 상한 참고치일 뿐입니다. 중요한 것은 GPU가 늘어날수록 두 계층(랙 내부 NVLink, 랙 간 스케일아웃 네트워크) 모두가 거의 같은 비율로 확장돼야 한다는 점이며, 이는 Switch Silicon, Optical Transceiver, CPO(Co-Packaged Optics), 광섬유, 네트워크 제어 소프트웨어가 GPU 조달과 동시에 스케일해야 한다는 뜻입니다.
DGX SuperPOD Rubin NVL8 Reference Architecture를 기준으로 보면, 하나의 SU(72개 DGX Rubin NVL8 노드 = GPU 576개)가 최소 확장 단위이고, SU 8개를 묶으면 GPU 4,608개, SU 16개면 GPU 9,216개로 늘어나며 이에 맞춰 Leaf·Spine 스위치도 단계적으로 증설됩니다. 즉 GPU 개수보다 몇 개의 Fabric으로 나누어 어떻게 연결할 것인가라는 Topology 설계가 실질적인 확장성의 병목이 됩니다.
Cooling과 Power Delivery — 800VDC는 “이번 세대”가 아니라 “다음 세대”를 위한 것
랙 전력밀도가 200kW를 넘어가면서 기존 Air Cooling은 대응이 어려워집니다. Vera Rubin NVL72는 100% 액체 냉각을 전제로 설계되었고(공랭 구성 자체가 존재하지 않습니다), 45°C 냉각수를 그대로 흡입할 수 있는 열교환 설계를 채택해 Chiller 의존도를 낮추는 방향으로 가고 있습니다.
전력 공급 구조도 함께 바뀝니다. 같은 전력을 낮은 전압으로 보내면 전류가 급격히 커지기 때문입니다.
300kW ÷ 48V ≈ 6,250A
300kW ÷ 800V = 375A
다만 원문이 다룬 800VDC 전환의 시점은 다소 보완이 필요합니다. Vertiv가 NVIDIA와 함께 준비 중인 800VDC 포트폴리오는 2026년 하반기 출시가 맞지만, 이는 **2027년 등장 예정인 Rubin Ultra/Kyber 랙(약 600kW급)**을 겨냥한 준비이지, 현재 세대인 Vera Rubin NVL72(190~230kW)의 표준 전력 방식은 아닙니다. 다만 NVIDIA는 이와 별개로 기존 415/480VAC 시설 전력을 그대로 유지한 채 컴퓨트 랙에만 800VDC를 공급하는 하이브리드 MGX 800VDC 랙을 2026년 하반기 양산에 들어갈 예정이라고 밝혔는데, 이는 건물 전체를 개조하지 않고도 고밀도 랙만 선제적으로 800VDC로 전환할 수 있는 과도기적 설계입니다. 즉 “랙 전력밀도 상승 → 전류 증가 → 전력 변환 방식 변화”라는 흐름 자체는 원문의 지적대로 맞지만, 이 전환이 이미 이번 Rubin 세대의 표준이라기보다는 300kW를 넘는 다음 세대부터 본격화되는 과정 중에 있다고 보는 것이 더 정확합니다.
1GW를 Layer별로 펼치면
| Layer | 1GW 기준 모델 (NVL8 랙 기준) |
|---|---|
| Facility Power | 1,000MW |
| PUE | 1.20 |
| IT Load | 약 833MW |
| AI Compute Rack 전력 | 약 583MW |
| Compute Rack 수 | 약 2,593개 |
| Rubin GPU | 약 165,926개 |
| HBM4 총 용량 | 약 47.8PB |
| 단순 합산 HBM 대역폭 | 약 3.65EB/s |
| GPU Scale-out Endpoint 대역폭 | 약 265.5Pb/s |
| 최대 연간 Facility 전력량 | 8.76TWh |
1GW 시설이 연중 최대 출력으로 가동된다고 단순 가정하면 1GW × 8,760시간 = 8.76TWh입니다. 실제 소비량은 가동률, 워크로드, 유지보수, 단계별 증설에 따라 달라지지만, 1GW급 AI 캠퍼스가 일반적인 서버 시설과는 자릿수가 다른 에너지 인프라라는 점은 분명합니다.
이 모델을 실무에 적용할 때 확인해야 할 변수
- 전력 기준점 — 발표된 숫자가 Utility Connection Capacity인지 IT Load인지, 혹은 Compute Rack에만 배분된 전력인지 확인해야 합니다. 같은 “100MW”도 정의에 따라 실제 GPU 수가 2배까지 차이 납니다(5절 참고).
- 랙 아키텍처 선택 — DGX SuperPOD Rubin NVL8(공식 225kW/64GPU)과 Vera Rubin NVL72(비공식 190~230kW/72GPU) 중 어느 쪽을 기준으로 삼느냐에 따라 GPU 수 추정치가 10% 안팎 달라집니다.
- PUE — 산업 평균(1.52)과 용량가중 평균(1.36), 그리고 신축 고효율 시설의 목표치(1.15~1.2)는 서로 다른 모집단을 대표하므로 어떤 시설을 분석하느냐에 맞춰 선택해야 합니다.
- Compute 비중 — Storage, Network, 관리 인프라 비중이 커지면 GPU Rack에 쓸 수 있는 전력은 줄어듭니다. 실제 Noetra 사례는 약 75%로, 이 글의 70% 가정과 근접했습니다.
- 벤더 마케팅 지표와 실배치의 괴리 — DSX MaxLPS처럼 소프트웨어 기반 전력 최적화를 전제로 한 “이상화된 100MW” 수치는 실제 조달 기준 밀도보다 최대 2배 낙관적일 수 있습니다.
- Cooling·Power Delivery 세대 구분 — 800VDC, Kyber 같은 차세대 인프라는 현재 세대(NVL72)가 아니라 2027년 이후의 600kW급 랙을 겨냥한 준비 단계라는 점을 혼동하지 않아야 합니다.
결론 — 1GW의 진짜 의미는 GPU 개수가 아니다
Facility Power 1GW, PUE 1.20, IT Load 약 833MW, Compute 비중 70%, 225kW/64GPU 랙을 적용하면 약 16만6천 개의 Rubin GPU라는 결과가 나옵니다. 조건을 보수적으로 잡으면 약 12만 개, Compute Density를 높이면 약 20만 개까지 달라지고, 랙 아키텍처를 NVL72로 바꾸면 약 18만3천 개까지 올라갑니다. 실제 발표된 일본 140MW 국가 프로젝트를 1GW로 환산한 값(약 19.6만 개)도 이 범위 안에 들어와, 이 계산 방식이 이론에 그치지 않고 실무적으로도 유효하다는 것을 보여줍니다.
반면 NVIDIA가 마케팅 차원에서 제시하는 “100MW당 4만 GPU”라는 지표는 DSX MaxLPS 기반의 이상화된 상한값이며, 같은 방식으로 1GW를 계산하면 40만 개까지 나올 수 있지만 이는 실제 조달 사례의 약 2배에 해당합니다. “1GW AI 데이터센터”라는 표현을 GPU 수로 환산할 때는 전력의 측정 지점, 랙 아키텍처, PUE, Compute 비중, 그리고 그 수치가 이론적 상한인지 실제 배치 평균인지를 함께 확인하지 않으면 두 배 가까운 오차가 생길 수 있습니다.
1GW의 전력을 실제 AI Compute로 바꾸려면 GPU만 필요한 것이 아닙니다. 수십 PB의 HBM, 수백 Pb/s 규모의 네트워크 엔드포인트, 수천 개의 Compute Rack, 수백 MW를 처리하는 냉각 시스템, 대규모 전력 분배 인프라가 동시에 필요합니다. GW 단위의 AI 데이터센터 계획을 볼 때 중요한 질문은 “얼마나 큰가”가 아니라 “그 전력이 Compute, Memory, Network, Power, Cooling 중 어느 정도 규모로, 어떤 전제 위에서 변환되는가”입니다.
참고 자료
NVIDIA, DGX SuperPOD Rubin NVL8 Systems: Reference Architecture (docs.nvidia.com)
- NVIDIA, DGX Rubin NVL8 제품 페이지 (nvidia.com/en-us/data-center/dgx-rubin-nvl8)
- NVIDIA, Vera Rubin NVL72 제품 페이지 (nvidia.com/en-us/data-center/vera-rubin-nvl72)
- NVIDIA Developer Blog, Inside NVIDIA Rubin GPU Architecture (2026.8)
- Uptime Institute, Global Data Center Survey 2026 및 The growing PUE advantage of larger data centers
- Tom’s Hardware, Nvidia and Japan unveil world’s first national AI infrastructure — Noetra consortium (2026.7)
- ServeTheHome, NVIDIA Vera Rubin NVL72 Rack at Hot Chips 2026 (2026.8)
- Ming-Chi Kuo(궈밍치) 서플라이체인 리포트, X/2026.1
- Vertiv/NVIDIA, 800 VDC Power Architecture 관련 보도자료 시리즈 (2025.5~2026.8)
- StorageReview, NVIDIA Moves 800-VDC Power Architecture From Concept to Production (2026.8)
- Micron, HBM4 High-Volume Production for NVIDIA Vera Rubin 보도자료 (2026.3)
본 문서는 공개된 자료를 바탕으로 한 추정 모델이며, 실제 프로젝트의 전력·랙 구성·PUE는 사업자별로 달라질 수 있습니다.
curiouszip
댓글 0
첫 댓글을 남겨보세요.