본문 바로가기
Tech Layers | Under the chip Tech Layers | Under the chip
Complex tech, simply unpacked.

AI Scale-Up Network란? NVLink와 UALink가 주목받는 이유

curiouszip

AI Cluster를 크게 만든다고 해서 GPU를 Ethernet Switch에 많이 연결하면 끝나는 것은 아닙니다. 수천 개의 GPU가 하나의 Training Job이나 대형 Inference Service에 참여하려면 가까운 GPU끼리는 훨씬 더 낮은 Latency와 높은 Bandwidth로 데이터를 주고받아야 합니다. 특히 하나의 Rack 안에 수십 개 Accelerator가 들어가는 Rack-scale Architecture에서는 GPU 사이 Communication 자체가 Compute 성능의 일부가 됩니다.

Scale-Up Network: 하나의 Server, Rack 또는 AI Pod 안에서 여러 Accelerator를 매우 높은 Bandwidth와 낮은 Latency로 연결해 하나의 더 큰 Compute System처럼 동작시키는 Interconnect Fabric입니다.

Scale-up의 핵심은 “GPU가 몇 개 연결됐는가”보다 여러 GPU가 서로의 Memory와 Collective Data를 얼마나 빠르게 교환해 하나의 System처럼 움직일 수 있는가입니다.

먼저 Scale-Up과 Scale-Out을 구분해야 합니다

구분Scale-Up NetworkScale-Out Network
주요 범위Server·Rack·AI Pod여러 Server·Rack·Data Center
핵심 목표Accelerator를 하나의 큰 System처럼 연결많은 Node를 Cluster로 연결
대표 기술NVLink, UALink, Scale-up EthernetEthernet, RoCE, UET, InfiniBand
중요 지표매우 낮은 Latency, GPU-to-GPU BandwidthRouting, Congestion, Fabric Scale
Access 성격Memory-semantic·Fine-grained CommunicationPacket·RDMA 중심
주요 TrafficAllReduce, AllGather, All-to-AllDistributed Training, Storage, Cluster Traffic

Scale-up과 Scale-out은 서로 대체하는 개념이 아닙니다. Rack 내부 GPU는 Scale-up Fabric으로 매우 빠르게 연결하고, 여러 Rack은 Scale-out Network로 연결하는 Hierarchical Architecture가 일반적입니다.

왜 PCIe만으로 GPU 수십 개를 연결하기 어렵나요?

PCIe는 범용 I/O Standard로 GPU, NIC, SSD를 연결하는 데 매우 강합니다. 하지만 PCIe의 원래 목적은 수십 개 GPU가 하나의 Memory-like Fabric에서 지속적으로 All-to-All Communication을 수행하는 것이 아닙니다.

GPU가 많아지면 PCIe Root Complex와 Lane 수, Switch Hierarchy가 복잡해지고 Peer-to-peer Traffic이 여러 Hop을 거칠 수 있습니다. Bandwidth도 GPU Memory Bandwidth에 비하면 제한적입니다.

PCIe 6.0 x16은 최대 256GB/s의 Bidirectional Bandwidth를 제공하지만 NVIDIA Rubin의 NVLink 6는 GPU당 3.6TB/s를 제공합니다. 사용 목적과 Protocol이 다르기 때문에 단순 숫자 비교는 조심해야 하지만, Scale-up에서 별도의 고속 Fabric이 필요한 이유는 분명합니다.

GPU가 Network를 기다리면 Compute가 낭비됩니다

GPU는 계산과 Communication을 반복합니다. Distributed Training에서는 Local Calculation을 끝낸 뒤 Gradient와 Activation을 다른 GPU와 교환합니다.

Network가 느리면 GPU가 다음 Compute Phase로 넘어가지 못하고 기다립니다. GPU 한 개에서 몇 microseconds의 Delay는 작아 보일 수 있지만 수천 GPU가 Barrier에 맞춰 동기화될 때는 가장 느린 GPU가 전체 Step Time을 결정할 수 있습니다.

즉 Scale-up Network의 경제적 목표는 Network Benchmark 자체가 아니라 비싼 Accelerator의 Idle Time을 줄이는 것입니다.

NVLink는 무엇인가요?

NVLink: NVIDIA GPU와 CPU, NVLink Switch 사이에 높은 Bandwidth와 낮은 Latency의 Point-to-point Communication을 제공하는 NVIDIA의 Proprietary Scale-up Interconnect입니다.

NVLink는 여러 세대에 걸쳐 Bandwidth를 확대해왔습니다. Hopper 세대의 4세대 NVLink, Blackwell의 5세대, Rubin의 6세대로 발전하면서 GPU당 Link Bandwidth가 크게 증가했습니다.

NVIDIA에 따르면 NVLink 6는 Rubin Platform에서 GPU당 3.6TB/s의 GPU-to-GPU Bandwidth를 제공하며 이전 세대 대비 두 배 수준입니다. Vera Rubin NVL72 Rack은 72개의 GPU를 NVLink Switch Fabric으로 연결해 Rack 전체에서 260TB/s의 NVLink Bandwidth를 제공합니다.

이 정도 Bandwidth가 필요한 이유는 최신 MoE와 Agentic AI Workload가 GPU 사이에 엄청난 Data Movement를 만들기 때문입니다.

NVSwitch는 왜 필요할까요?

GPU 두 개를 직접 연결하는 것은 어렵지 않습니다. 하지만 GPU 72개를 서로 모두 직접 Cable로 연결하려면 Port와 Wiring Complexity가 폭발합니다.

NVLink Switch: 여러 GPU의 NVLink Connection을 Switching Fabric으로 묶어 대규모 GPU Domain 안에서 All-to-all Communication을 제공하는 NVIDIA의 Scale-up Switch입니다.

NVSwitch가 있기 때문에 GPU들은 모든 상대 GPU와 전용 Point-to-point Cable을 각각 연결하지 않아도 됩니다. Switch가 Traffic을 전달하고 전체 Rack을 하나의 큰 Accelerator Domain처럼 구성합니다.

Vera Rubin NVL72에서 NVLink Switch는 72 GPU를 Non-blocking Fabric으로 연결하고 Collective Operation을 위한 In-network Compute 기능도 제공합니다.

왜 All-to-All이 더 중요해지고 있을까요?

초기 Distributed Training에서는 AllReduce가 대표적인 Traffic Pattern이었습니다. 각 GPU가 계산한 Gradient를 합산하고 결과를 다시 모든 GPU에 전달합니다.

MoE(Mixture of Experts) Model에서는 상황이 더 복잡합니다. Token마다 다른 Expert가 선택될 수 있어 특정 GPU의 Token이 Rack 안의 다른 GPU로 이동합니다. 이때 All-to-All Communication 비중이 커질 수 있습니다.

All-to-All은 모든 GPU가 여러 상대 GPU와 동시에 데이터를 교환하기 때문에 Fabric Bandwidth와 Load Balancing에 매우 민감합니다. NVIDIA가 Rubin NVLink 6에서 All-to-all Bandwidth와 In-network Compute를 강조하는 이유입니다.

Scale-up Network에서는 Packet Rate도 중요합니다

Bandwidth가 높다고 모든 Workload가 빨라지는 것은 아닙니다. 큰 Message 몇 개만 전달하는 Workload와 작은 Message를 매우 많이 전달하는 Workload는 Network 요구가 다릅니다.

GPU Collective와 Memory-like Access에서는 작은 Packet·Transaction을 매우 빠르게 처리해야 할 수 있습니다. 이 경우 Packet Rate와 Latency가 중요합니다.

NVIDIA는 NVLink 6가 Off-the-shelf Ethernet 기반 대안 대비 GPU-to-GPU Latency와 Packet Rate에서 큰 차이를 제공한다고 자사 자료에서 강조합니다. 해당 수치는 NVIDIA의 특정 비교환경 기준이므로 모든 Network에 일반화할 수는 없지만, Scale-up Fabric에서 Bandwidth뿐 아니라 Transaction Rate가 중요하다는 점을 보여줍니다.

UALink는 왜 등장했을까요?

NVLink는 매우 강력하지만 NVIDIA Platform 중심의 Proprietary Ecosystem입니다. Cloud 업체와 AMD, Intel, Broadcom 등은 여러 Vendor Accelerator를 연결할 수 있는 Open Scale-up Standard를 원했습니다.

UALink(Ultra Accelerator Link): Accelerator와 Scale-up Switch 사이에 Low-latency, High-bandwidth, Memory-semantic Communication을 제공하기 위한 Open Industry Interconnect Standard입니다.

UALink의 목표는 단순히 NVIDIA의 NVLink를 복제하는 것이 아니라 Multi-vendor Accelerator Ecosystem에서 사용할 수 있는 Open Scale-up Fabric을 만드는 것입니다.

UALink 200G 1.0은 어느 수준인가요?

UALink 200G 1.0은 Lane당 200Gbps급 Data Rate를 제공하고 최대 1,024 Accelerator를 하나의 AI Computing Pod에서 연결하는 것을 목표로 합니다.

UALink Lane은 x1, x2, x4 형태로 묶을 수 있고 4개 Lane으로 구성된 Station은 방향별 최대 800Gbps 수준의 Bandwidth를 제공합니다.

중요한 것은 단순 Link Speed보다 Scale입니다. 하나의 Open Scale-up Domain에서 1,024 Accelerator까지 연결할 수 있도록 Addressing과 Switch Architecture, Manageability를 정의합니다.

UALink는 Ethernet과 같은 Packet Network인가요?

UALink는 Physical Layer에서 Ethernet 계열 기술을 활용하는 부분이 있지만 Communication Model은 일반 Ethernet과 다릅니다.

UALink는 Accelerator가 Scale-up Domain 안에서 Remote Memory를 Load·Store·Atomic Operation으로 접근할 수 있는 Memory-semantic Model을 제공합니다. Fine-grained Memory Access와 Low-latency Communication을 위해 설계됐습니다.

Scale-out Ethernet에서는 RDMA가 Memory-to-memory Data Movement를 제공하지만 UALink는 더 가까운 Accelerator Domain에서 Memory-semantic Scale-up Fabric을 지향합니다.

UALink Common 2.0에서는 무엇이 추가됐나요?

2026년 UALink Consortium은 Common 2.0과 여러 관련 Specification을 공개했습니다. 주요 변화 가운데 하나가 In-Network Compute입니다.

In-Network Compute: Collective Operation의 일부 계산을 Endpoint Accelerator가 아니라 Network Switch나 Fabric Component에서 처리해 Data Movement와 Latency를 줄이는 기술입니다.

또 Manageability Specification과 Chiplet Specification이 공개됐고, Multi-workload 환경과 Security, System Management를 강화하는 방향으로 발전하고 있습니다.

UALink가 단순 Electrical Link Specification에서 AI Scale-up System Architecture 전체를 다루는 Standard로 확대되고 있다는 의미입니다.

UALink Chiplet Specification과 UCIe는 어떻게 연결되나요?

UALink Chiplet 1.01 Specification은 UALink 기능을 Chiplet-based SoC에 통합하는 방법을 정의하며 UCIe 3.0과 Compliance를 맞추는 방향을 포함합니다.

이것은 미래 AI Chip의 Connectivity가 여러 Layer로 연결될 수 있음을 보여줍니다. Package 내부 Chiplet Communication은 UCIe, Package 밖 Accelerator-to-accelerator Scale-up은 UALink, 더 넓은 Rack-to-rack Scale-out은 Ethernet·UET 같은 구조입니다.

즉 UCIe와 UALink는 경쟁기술이 아니라 Package 내부와 Package 외부를 각각 담당하는 연속적인 Connectivity Layer가 될 수 있습니다.

Broadcom은 왜 Scale-up Ethernet도 밀고 있을까요?

Scale-up Network가 반드시 NVLink나 UALink만 사용하는 것은 아닙니다. Broadcom은 Tomahawk Ultra와 Tomahawk 6를 이용해 Ethernet을 Scale-up 영역까지 확대하려 하고 있습니다.

Tomahawk 6는 102.4Tbps Switching Capacity를 제공하고 한 Chip에서 512개의 200G-class Endpoint를 연결할 수 있는 High-radix Architecture를 제시합니다. Broadcom은 이를 Scale-out뿐 아니라 Scale-up AI Network에도 사용할 수 있도록 개발하고 있습니다.

이 방향이 성공하면 Data Center Operator가 Scale-up과 Scale-out을 모두 Ethernet Tooling과 Operational Model로 통합할 수 있다는 장점이 있습니다.

반면 Memory-semantic Latency와 Fine-grained Access에서 전용 Scale-up Fabric이 더 유리할 수도 있습니다. 이 경쟁은 앞으로 AI Network Architecture의 핵심 변수입니다.

Copper가 Scale-up에서 강한 이유

Scale-up은 보통 같은 Server나 Rack 내부의 짧은 거리입니다. 짧은 거리에서는 Copper가 Optical보다 저렴하고 Latency가 낮으며 Optical Conversion이 필요하지 않습니다.

Passive Copper, Co-Packaged Copper, Retimer와 AEC를 이용하면 수 m 수준의 Rack Connection을 구축할 수 있습니다. 200G-class SerDes를 가진 Tomahawk 6 같은 Switch도 Copper Reach를 최대한 활용해 Optics 수를 줄이는 방향을 지원합니다.

AI Rack에서는 Optical Module 가격과 Power가 크기 때문에 Copper를 사용할 수 있는 구간을 유지하는 것이 TCO에 중요합니다.

그런데 Copper만으로 Rack-scale을 계속 키울 수 있을까요?

Lane Speed가 200G·224G로 올라가면 Copper Channel Loss가 커지고 Cable이 두꺼워지며 Retimer Power가 증가합니다. Rack이 커지고 Multi-rack Scale-up을 시도하면 거리는 더 길어집니다.

이 때문에 Optical I/O, CPO와 새로운 Optical Scale-up Architecture가 주목받고 있습니다. Optical은 긴 Reach와 Cable Density에서 강하지만 Conversion Latency와 Power, Cost가 과제입니다.

결국 Scale-up Physical Layer는 짧은 거리 Copper와 더 긴 거리 Optical이 공존하는 Hybrid 구조가 될 가능성이 높습니다.

Scale-up과 Scale-out의 경계는 점점 흐려질 수 있습니다

과거에는 같은 Server 안은 PCIe·NVLink, Server 밖은 Ethernet·InfiniBand처럼 경계가 비교적 명확했습니다.

Rack-scale Architecture가 일반화되면서 하나의 Scale-up Domain이 Rack 전체를 차지하고, UALink가 최대 1,024 Accelerator까지 확장을 목표로 하면서 물리적 범위가 커지고 있습니다.

반대로 Ethernet도 Tomahawk Ultra 같은 제품으로 Scale-up 영역을 노리고 있습니다. 이 때문에 앞으로는 “어떤 Cable이 Scale-up인가”보다 어떤 Latency·Memory Semantic·Reliability를 요구하는 Domain인가로 구분하는 편이 더 정확해질 수 있습니다.

주요 기업은 어떻게 연결될까요?

NVIDIA는 NVLink, NVLink Switch, GPU와 NCCL Software를 End-to-end로 통합합니다. Scale-up Network가 커질수록 GPU System당 NVLink Switch와 Connectivity Content를 내부화할 수 있습니다.

AMD는 UALink Ecosystem과 Helios Rack-scale Platform을 통해 Open Scale-up Architecture를 확대하고 있습니다. Broadcom은 Merchant Switch, SerDes와 Ethernet Scale-up을 노립니다. Astera Labs는 320-lane Scorpio X-Series 같은 Memory-semantic Fabric Switch와 Custom Connectivity를 통해 Open Scale-up 시장에 참여하고 있습니다.

Credo와 Marvell 같은 Connectivity 업체는 Retimer, AEC, SerDes와 Optical Connectivity에서 기회를 얻을 수 있습니다.

투자 관점에서 무엇을 봐야 할까요?

첫 번째는 GPU당 Scale-up Bandwidth입니다. Accelerator 성능이 올라갈수록 GPU당 필요한 Fabric Bandwidth가 얼마나 증가하는지가 Switch·Cable·Optics Content를 결정합니다.

두 번째는 Domain Size입니다. 8 GPU Server에서 72 GPU Rack, 이후 수백·1,024 Accelerator Domain으로 커지면 Switch Radix와 Port 수, Fabric Complexity가 증가합니다.

세 번째는 Proprietary와 Open Ecosystem의 경쟁입니다. NVLink Vertical Integration이 계속 우세할지, UALink·Ethernet Scale-up이 Multi-vendor 시장을 만들지 확인해야 합니다.

네 번째는 Copper와 Optical Mix입니다. Link Speed와 Reach가 증가할수록 Retimer·AEC에서 Optical I/O로 Revenue Content가 이동할 수 있습니다.

리스크는 무엇일까요?

Open Scale-up Standard가 빠르게 발전해도 실제 Product와 Software Ecosystem이 충분히 성숙하지 않으면 Hyperscaler는 검증된 Proprietary Fabric을 선호할 수 있습니다.

또 Network Bandwidth를 크게 높여도 Application이 이를 활용하지 못하면 TCO가 악화될 수 있습니다. MoE와 Collective Pattern, Software Scheduler가 Fabric Architecture와 맞아야 합니다.

따라서 Scale-up Network 경쟁은 Link Speed가 가장 높은 Technology보다 GPU Utilization, Goodput, Reliability와 System Cost를 가장 잘 균형 잡는 Architecture가 승리할 가능성이 높습니다.

핵심 정리

질문
Scale-Up Network란?여러 Accelerator를 하나의 큰 Compute System처럼 연결하는 Low-latency, High-bandwidth Fabric입니다
Scale-Out과 차이는?Scale-up은 가까운 Accelerator Domain, Scale-out은 여러 Server·Rack을 연결하는 Network입니다
NVLink 6는 어느 수준인가요?Rubin GPU당 최대 3.6TB/s, NVL72 Rack 전체 260TB/s NVLink Bandwidth를 제공합니다
UALink란?200G/lane과 최대 1,024 Accelerator를 목표로 하는 Open Scale-up Standard입니다
UALink 2.0 방향은?In-Network Compute, Manageability, Chiplet Integration 등 System 기능을 확대합니다
왜 MoE에서 중요할까요?All-to-All Traffic이 커져 GPU-to-GPU Communication이 Compute Bottleneck이 될 수 있기 때문입니다
투자포인트는?GPU당 Bandwidth, Domain Size, Switch·Retimer·Copper·Optics Content와 Open Standard Adoption입니다

Scale-Up Network의 핵심은 GPU를 많이 연결하는 데 있지 않습니다. GPU 수십 개에서 수백 개가 서로 기다리지 않고 하나의 거대한 Accelerator처럼 동작하게 만드는 것이 목적입니다.

AI Model이 MoE와 Agentic Workload로 발전하고 Accelerator 성능이 올라갈수록 Scale-up Fabric은 GPU 주변의 보조장치가 아니라 Compute Architecture 자체가 됩니다. NVLink, UALink와 Scale-up Ethernet의 경쟁은 결국 어떤 Fabric이 가장 많은 Accelerator를 가장 낮은 Latency와 Power로 묶어 GPU Utilization을 높일 수 있는지의 경쟁입니다.

curiouszip

curiouszip
Tech Layers를 운영하는 에디터입니다. AI 반도체, 데이터센터, 첨단 패키징, 네트워크 기술처럼 복잡하지만 산업의 방향을 결정짓는 기술들을 조사하고, 이를 누구나 이해할 수 있는 언어로 풀어 쓰는 작업을 하고 있습니다.
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.