본문 바로가기
Tech Layers | Under the chip Tech Layers | Under the chip
Complex tech, simply unpacked.

PCIe Switch란? GPU 수십 개를 하나의 AI 서버에 연결하는 방법

curiouszip

AI Server 안에는 CPU와 GPU만 있는 것이 아닙니다. 여러 GPU, AI NIC, DPU, NVMe SSD, CXL Device가 동시에 들어가고 각각 상당한 PCIe Bandwidth를 요구합니다.

문제는 CPU가 제공하는 PCIe Root Port와 Lane 수가 무한하지 않다는 것입니다. GPU와 NIC를 모두 CPU에 직접 연결하려 하면 Lane이 부족하고 Board Routing도 복잡해집니다.

이때 필요한 것이 PCIe Switch입니다.

PCIe Switch: 하나의 PCIe Upstream Link를 여러 Downstream Port로 확장하고, PCIe Packet을 Host와 여러 Endpoint 사이에서 Routing하는 Semiconductor입니다.

쉽게 말하면 CPU가 가진 제한된 PCIe Port를 여러 Device가 효율적으로 나눠 쓸 수 있도록 만드는 고속 I/O 교환기입니다.

AI Server에서 PCIe Switch의 역할은 단순 Port 확장에 그치지 않습니다. GPU와 NIC, SSD 사이의 Peer-to-peer Data Path를 만들고 CPU를 우회하는 Data Movement를 지원하면서 AI Server 내부 Fabric에 가까운 역할로 진화하고 있습니다.

PCIe Switch를 먼저 한눈에 보면

구분PCIe RetimerPCIe Switch
핵심 역할Signal Reach 확장여러 PCIe Device 연결·Routing
Packet Routing하지 않음
Port 수보통 하나의 Link를 중계여러 Upstream·Downstream Port
적용긴·복잡한 ChannelGPU, NIC, SSD, DPU Fan-out
AI에서 중요해진 이유PCIe 6 Signal IntegrityDevice 수와 Peer-to-peer Traffic 증가

Retimer가 신호를 다시 살리는 장치라면 PCIe Switch는 Topology를 만드는 장치입니다.

왜 CPU에 GPU를 전부 직접 연결하지 않을까요?

CPU에는 일정 수의 PCIe Lane이 있습니다.

GPU 하나가 x16을 사용하고 AI NIC도 x16, SSD 여러 개가 x4를 사용한다고 생각해보겠습니다. Device 수가 많아질수록 CPU Lane Budget을 금방 소진할 수 있습니다.

CPU Socket을 추가하면 Lane을 늘릴 수 있지만 CPU Cost와 Power, Memory가 같이 증가합니다.

AI Server에서는 CPU가 목적이 아니라 GPU를 최대한 효율적으로 사용하는 것이 목적이기 때문에 PCIe Lane 때문에 CPU를 추가하는 것은 비효율적일 수 있습니다.

PCIe Switch를 사용하면 하나의 Upstream Link 아래에 여러 Endpoint를 연결할 수 있어 CPU Lane을 더 효율적으로 사용할 수 있습니다.

PCIe Switch는 Network Switch와 비슷한가요?

개념적으로 비슷한 부분이 있습니다.

Ethernet Switch는 들어온 Packet의 Destination을 보고 여러 Network Port 중 적절한 Port로 전달합니다.

PCIe Switch도 PCIe Transaction을 여러 Downstream Port로 Routing합니다.

하지만 Ethernet Network와 PCIe Fabric은 Protocol과 Addressing, Ordering, Reliability Model이 다릅니다.

PCIe Switch는 Host Root Complex와 Endpoint 사이의 PCIe Hierarchy 안에서 동작합니다.

Server 내부 I/O Fabric을 구성하는 Switch라고 보면 이해하기 쉽습니다.

Upstream Port와 Downstream Port는 무엇일까요?

Upstream Port: PCIe Switch에서 CPU나 Root Complex 방향으로 연결되는 Port입니다.

Downstream Port: GPU, NIC, SSD 같은 Endpoint 방향으로 연결되는 Port입니다.

기본적인 PCIe Switch는 하나의 Upstream Link를 여러 Downstream Link로 Fan-out합니다.

하지만 최신 AI Fabric Switch는 여러 Host와 Device를 연결하거나 Flexible Port Configuration을 제공해 더 복잡한 Topology를 만들 수 있습니다.

이 부분이 단순 서버용 PCIe Switch와 AI용 Smart Fabric Switch의 차이로 이어집니다.

GPU와 NIC 사이 Peer-to-peer가 왜 중요할까요?

GPU가 Network로 Data를 보내는 상황을 생각해보겠습니다.

전통적인 구조에서는 GPU Traffic이 CPU Root Complex를 지나 NIC로 이동할 수 있습니다.

하지만 GPU와 NIC가 같은 PCIe Switch 아래에 있고 Peer-to-peer Communication을 지원한다면 Data를 CPU Memory까지 올렸다가 다시 내려보낼 필요를 줄일 수 있습니다.

Peer-to-peer(P2P): PCIe Endpoint끼리 Host CPU의 Application Data Path를 거치지 않고 PCIe Fabric에서 직접 Transaction을 주고받는 방식입니다.

AI Server에서는 GPU-to-NIC, GPU-to-SSD Data Movement가 많기 때문에 P2P가 중요합니다.

GPUDirect RDMA와 GPUDirect Storage 같은 기술도 이런 Direct Data Path와 긴밀하게 연결됩니다.

AI Head Node에서 PCIe Switch가 중요한 이유

Training Cluster에는 GPU Compute Node뿐 아니라 Data를 공급하고 Job을 관리하는 Head Node가 필요합니다.

Head Node에는 여러 고속 NIC와 NVMe SSD, DPU가 함께 들어갈 수 있습니다.

Storage에서 읽은 Dataset을 Network로 GPU Cluster에 보내거나 Checkpoint를 저장할 때 PCIe Traffic이 매우 많습니다.

Astera Labs는 Scorpio P-Series PCIe 6 Smart Fabric Switch를 이런 Mixed Traffic AI Head Node Connectivity에 맞춰 설계하고 있으며 GPU, CPU, NIC, SSD 사이의 Predictable High-performance P2P Data Flow를 주요 Use Case로 제시합니다.

즉 PCIe Switch는 GPU Baseboard뿐 아니라 AI Storage·Network Ingest Server에서도 중요합니다.

PCIe 6 Switch에서는 무엇이 달라졌을까요?

PCIe 6는 Lane당 64GT/s PAM4입니다.

Switch는 수많은 Lane을 동시에 처리해야 하므로 SerDes Complexity가 크게 증가합니다.

Switch Fabric 내부 Bandwidth도 더 커져야 하고 FEC·FLIT Processing과 Buffer, QoS, Error Handling을 고속으로 처리해야 합니다.

즉 Gen6 PCIe Switch는 Port 수만 많은 것이 아니라 PAM4 SerDes와 매우 큰 Internal Fabric을 가진 High-performance Semiconductor입니다.

AI Server용 Switch ASP가 높아질 수 있는 이유입니다.

Astera Labs Scorpio가 대표적인 AI PCIe Switch입니다

Astera Labs의 Scorpio Smart Fabric Switch는 AI Infrastructure용 PCIe Switching Product입니다.

P-Series는 PCIe 6 기반으로 CPU, GPU, NIC와 SSD 사이의 High-bandwidth Data Flow를 처리합니다.

Astera Labs는 Scorpio를 단순 Fan-out Chip이 아니라 COSMOS Software Stack과 결합한 Smart Fabric Switch로 판매합니다. Link Telemetry와 Diagnostics를 이용해 대형 AI Fleet에서 Device Connectivity를 관리하는 방향입니다.

회사는 2026년 PCIe 6 Portfolio를 Production으로 확대하고 있으며 Scorpio와 Aries 6 Retimer가 PCI-SIG 6.x Compliance를 통과하는 등 Interoperability를 강조하고 있습니다.

Astera Labs의 전략은 Retimer로 Channel을 연결하고 Switch로 Topology를 만드는 것입니다.

Marvell은 260-lane PCIe 6 Switch를 확보했습니다

Marvell은 XConn Technologies 인수를 통해 PCIe와 CXL Switching Technology를 강화했습니다.

Marvell은 2026년 AI Data Center용 260-lane PCIe 6.0 Switch를 공개했습니다.

260개의 PCIe 6 Lane은 매우 큰 숫자입니다. 여러 CPU·GPU·NIC와 Storage Device를 하나의 Fabric에 연결할 수 있도록 설계된 것입니다.

AI Rack이 커질수록 단순 32-lane·64-lane Switch보다 초대형 Lane Count와 Flexible Port Configuration의 가치가 커질 수 있습니다.

Marvell은 이 기술을 Structera Switching Portfolio와 연결해 PCIe와 CXL 양쪽으로 확장하고 있습니다.

왜 260 Lane이 필요할까요?

GPU와 NIC 하나가 x16을 쓴다면 Device 10개만 연결해도 160 Lane이 필요합니다.

여기에 CPU Upstream과 SSD, DPU를 추가하면 Lane 수가 빠르게 늘어납니다.

특히 Rack-scale AI System에서는 여러 Tray가 하나의 PCIe Fabric으로 연결될 수 있습니다.

따라서 Switch의 Total Lane Count가 높을수록 더 많은 Device를 한 단계에서 연결하고 Switch 계층을 줄일 수 있습니다.

Switch Hop이 줄면 Latency와 Power에도 유리할 수 있습니다.

하지만 Switch Oversubscription을 이해해야 합니다

PCIe Switch의 Downstream Bandwidth 합계가 Upstream Bandwidth보다 클 수 있습니다.

모든 Device가 동시에 Full Bandwidth를 사용하지 않는다고 가정하면 경제적인 설계가 가능합니다.

Oversubscription: 여러 Downstream Port의 최대 Bandwidth 합이 Upstream 또는 Internal Fabric의 가용 Bandwidth보다 큰 Architecture입니다.

일반 Server에서는 괜찮을 수 있습니다.

하지만 AI Workload에서는 GPU와 NIC가 동시에 대량 Traffic을 발생시키기 때문에 Oversubscription이 Performance Bottleneck이 될 수 있습니다.

따라서 AI PCIe Switch는 실제 Traffic Pattern과 Non-blocking Bandwidth를 함께 봐야 합니다.

Non-blocking Switch란 무엇일까요?

Non-blocking: 여러 Port가 동시에 Traffic을 보내도 Internal Switching Capacity가 충분해 Port Speed 합계를 최대한 처리할 수 있는 Switch Architecture를 의미합니다.

실제 제품에서는 Port Configuration과 Traffic Direction에 따라 조건이 달라집니다.

AI Server에서는 특정 GPU-to-NIC Flow만 빠른 것보다 여러 GPU와 Storage가 동시에 움직일 때 Throughput이 유지되는 것이 중요합니다.

그래서 Switch Vendor는 Total Lane 수뿐 아니라 Internal Fabric Capacity와 QoS를 강조합니다.

PCIe Switch의 Latency도 중요합니다

Switch를 통과하면 Routing과 Buffering 때문에 Direct Link보다 Latency가 추가됩니다.

Storage Traffic에서는 몇십 ns 차이가 크지 않을 수 있지만 GPU Collective나 CXL Memory Path에서는 민감할 수 있습니다.

따라서 AI용 PCIe Switch는 Low-latency Switching을 중요하게 설계합니다.

Switch를 한 단계 추가해 얻는 Fan-out과 Flexibility가 추가 Latency보다 큰 가치가 있어야 합니다.

PCIe Switch가 GPU Scale-up Network를 대체할까요?

그렇지는 않습니다.

NVLink와 UALink 같은 Scale-up Fabric은 GPU-to-GPU Communication에 매우 높은 Bandwidth와 낮은 Latency를 목표로 합니다.

PCIe는 범용 I/O Protocol이기 때문에 GPU Scale-up 전용 Fabric보다 Bandwidth Density와 Collective Optimization에서 차이가 있을 수 있습니다.

PCIe Switch는 주로 GPU와 NIC, SSD, CPU, DPU를 연결하고 Scale-out·Storage Data Path를 만드는 역할이 강합니다.

즉 PCIe Switch와 NVSwitch는 같은 Switch라는 이름을 쓰지만 Layer와 목적이 다릅니다.

PCIe Switch와 NVSwitch의 차이

NVSwitch: NVIDIA NVLink Traffic을 여러 GPU 사이에서 Switching하는 Scale-up Fabric Semiconductor입니다.

PCIe Switch: PCIe Transaction을 CPU, GPU, NIC, SSD 같은 범용 Endpoint 사이에서 Switching하는 I/O Semiconductor입니다.

NVSwitch의 주요 목표는 GPU-to-GPU Bandwidth입니다.

PCIe Switch의 목표는 Device Fan-out, P2P I/O와 Flexible Connectivity입니다.

AI Server에서는 두 Switch가 동시에 들어갈 수 있습니다.

UALink 시대에도 PCIe Switch는 필요할까요?

UALink가 GPU Scale-up을 담당해도 NIC와 SSD, CPU Connection은 여전히 필요합니다.

따라서 PCIe는 사라지지 않습니다.

오히려 Rack-scale Architecture에서 GPU Scale-up Fabric과 PCIe I/O Fabric이 각각 전문화될 가능성이 높습니다.

GPU끼리는 UALink, GPU와 NIC·Storage는 PCIe를 사용하는 구조입니다.

즉 PCIe Switch의 중요성은 GPU Scale-up Protocol 경쟁과 별개로 유지될 수 있습니다.

Storage와 KV Cache Disaggregation에서도 의미가 있습니다

AI Inference가 커지면서 KV Cache와 Model Data를 Storage 또는 별도 Memory Tier에 둘 수 있습니다.

GPU가 NVMe SSD나 Storage NIC와 빠르게 Data를 주고받아야 합니다.

PCIe Switch는 여러 SSD와 NIC를 GPU 가까운 P2P Fabric에 배치하는 데 활용될 수 있습니다.

즉 AI Workload가 Training에서 Inference와 Disaggregated Storage로 확대될수록 GPU-to-I/O Data Path가 더 중요해질 수 있습니다.

PCIe Switch는 CXL Switch와도 겹치는 영역이 있습니다

CXL은 PCIe Physical Layer를 공유하고 CXL.io는 PCIe Transaction Model과 연결돼 있습니다.

따라서 일부 Switch Silicon은 PCIe와 CXL을 함께 지원할 수 있습니다.

하지만 CXL Switch는 Memory Pooling과 Fabric Management, CXL.mem Semantics 같은 추가 기능이 필요합니다.

즉 PCIe Switch보다 CXL Switch가 더 복잡한 Memory Fabric 역할을 합니다.

Marvell Structera S 같은 제품이 PCIe와 CXL 양쪽을 지원하는 이유입니다.

PCIe Switch와 CXL Switch를 구분해야 하는 이유

PCIe Switch를 이용해 SSD와 NIC를 연결하는 것과 CXL Switch로 여러 Host가 Memory Resource를 Pooling하는 것은 다른 Architecture입니다.

PCIe는 Device Transaction Routing에 강합니다.

CXL은 Memory Semantics와 Coherency를 추가해 Remote Memory를 System Memory Architecture 안으로 가져옵니다.

따라서 CXL Switch가 확대되면 PCIe Switch 시장을 완전히 대체하기보다 Memory Fabric이라는 새로운 Layer를 추가할 가능성이 높습니다.

PCIe Switch에는 RAS도 중요합니다

AI Server에서 Switch 하나가 여러 GPU와 NIC를 연결하면 Switch Failure의 영향범위가 커집니다.

따라서 Error Isolation과 Port Containment, Hot-plug, Telemetry가 중요합니다.

특정 Endpoint가 Error를 발생시켜도 Fabric 전체가 멈추지 않도록 해야 합니다.

Smart Fabric Switch가 단순 Packet Routing을 넘어 Diagnostics와 Management Software를 제공하는 이유입니다.

Astera Labs의 경쟁력은 COSMOS와 함께 봐야 합니다

Scorpio Switch 자체의 Port와 Lane 수만 비교하면 Commodity Switch처럼 보일 수 있습니다.

Astera Labs는 Aries Retimer와 Leo CXL Controller까지 동일한 COSMOS Management Framework에서 Telemetry를 제공하는 전략을 사용합니다.

Hyperscaler는 여러 종류의 Connectivity Chip을 하나의 Software로 관리할 수 있습니다.

즉 Hardware Design Win이 Software Lock-in 또는 Platform Stickiness로 이어질 수 있는 구조입니다.

Marvell의 전략은 대형 Fabric 통합입니다

Marvell은 XConn 인수 후 PCIe와 CXL Switch를 Structera Portfolio로 통합하고 있습니다.

회사는 260-lane PCIe 6 Switch와 260-lane CXL 3.x Switch를 AI Data Center에 공급하는 방향입니다.

큰 Lane Count와 CXL Memory Fabric, Retimer, Optics를 함께 갖춘 점이 차별화 요소입니다.

즉 Marvell은 Server 내부 Switch에서 Rack-scale Fabric까지 Connectivity Stack을 넓히는 전략입니다.

투자 관점에서는 Switch ASP보다 Lane Content가 중요합니다

AI Server가 커지면 Switch Chip 하나의 가격만 오르는 것이 아니라 Switch에 연결되는 Lane 수와 Port Speed가 함께 증가합니다.

PCIe 5 32GT/s에서 PCIe 6 64GT/s로 올라가면 동일 Lane Count에서도 Silicon Complexity와 Power가 증가합니다.

또 Device 수가 늘면 더 큰 Switch가 필요합니다.

따라서 시장을 볼 때 Server Unit보다 PCIe Switch Lane shipped 같은 관점이 더 유용할 수 있습니다.

투자자가 볼 첫 번째 지표는 PCIe 6 Switch Volume입니다

2026년은 PCIe 6 Switch가 초기 Production으로 이동하는 구간입니다.

Astera Labs와 Marvell Product가 실제 Hyperscaler Platform에서 얼마나 Volume을 만들지 확인해야 합니다.

Sampling과 Qualification을 넘어 Revenue가 크게 증가하는 시점이 중요합니다.

두 번째는 GPU-to-NIC P2P Architecture입니다

AI Networking Bandwidth가 올라갈수록 GPU와 NIC를 CPU Root Complex에만 의존해 연결하기 어려워질 수 있습니다.

PCIe Switch를 이용한 P2P Architecture가 확대되면 Server당 Switch Content가 증가합니다.

특히 800G NIC와 여러 GPU가 같은 Fabric에 붙는 Design이 중요한 Demand Driver가 될 수 있습니다.

세 번째는 CXL과의 Convergence입니다

PCIe Switch 업체가 CXL Switching까지 확장할 수 있다면 Addressable Market이 커집니다.

단순 Device Fan-out뿐 아니라 Memory Pooling Market까지 들어갈 수 있기 때문입니다.

Marvell과 Astera Labs의 Portfolio Expansion을 볼 때 이 점이 중요합니다.

네 번째는 Switch와 Retimer 통합입니다

Switch 주변의 모든 Port에 별도 Retimer가 필요하면 Power와 BOM이 커집니다.

Switch SerDes가 더 강한 Reach를 제공하거나 Retimer Function이 일부 통합되면 External Retimer 수가 줄 수 있습니다.

반대로 복잡한 Rack Topology가 늘면 별도 Retimer와 AEC가 더 필요할 수 있습니다.

따라서 PCIe Switch Market과 Retimer Market은 서로 Complementary하면서 일부 Function에서는 경쟁합니다.

핵심 정리

질문
PCIe Switch란?하나의 PCIe Upstream을 여러 Endpoint로 확장하고 PCIe Packet을 Port 사이에서 Routing하는 Semiconductor입니다
왜 AI Server에서 필요한가요?CPU PCIe Lane은 제한돼 있고 GPU·NIC·SSD 수는 빠르게 늘어나기 때문입니다
Retimer와 차이는?Retimer는 Signal을 복원하고 Switch는 Traffic 경로와 Topology를 만듭니다
NVSwitch와 같은가요?아닙니다. NVSwitch는 GPU Scale-up NVLink Fabric이고 PCIe Switch는 범용 I/O Fabric입니다
대표 기업은?Astera Labs, Marvell 등 AI Connectivity 업체가 중요합니다
CXL과 관계는?동일 PHY 기반이며 일부 Switch는 PCIe와 CXL을 함께 지원합니다
투자포인트는?PCIe 6 Volume, GPU-to-NIC P2P, Switch Lane Count와 CXL Convergence입니다

PCIe Switch가 중요한 이유는 AI Server가 더 이상 CPU 중심의 단순한 Peripheral 구조가 아니기 때문입니다. GPU와 NIC, SSD가 직접 대량의 Data를 주고받으면서 Server 내부에도 하나의 Fabric이 필요해지고 있습니다.

PCIe Switch는 이 Device들을 연결하고 CPU Lane 제약을 완화하며 P2P Data Path를 만듭니다.

하지만 PCIe Switch가 주로 Device Transaction을 연결한다면 CXL Switch는 한 단계 더 나아가 Memory 자체를 여러 Host가 공유할 수 있는 Resource로 바꾸려 합니다.

그 차세대 Memory Fabric의 핵심이 CXL Switch입니다.

curiouszip

curiouszip
Tech Layers를 운영하는 에디터입니다. AI 반도체, 데이터센터, 첨단 패키징, 네트워크 기술처럼 복잡하지만 산업의 방향을 결정짓는 기술들을 조사하고, 이를 누구나 이해할 수 있는 언어로 풀어 쓰는 작업을 하고 있습니다.
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.