RDMA란? AI 서버가 CPU를 거치지 않고 데이터를 보내는 이유
AI 서버의 GPU가 아무리 빨라도 다른 서버의 GPU와 데이터를 주고받는 동안 기다린다면 전체 AI Cluster의 성능은 떨어집니다.
특히 대규모 AI Training에서는 GPU 수천 개가 하나의 Model을 나눠 계산합니다. 한 GPU가 계산한 결과를 다른 GPU로 계속 전달해야 하고, AllReduce, AllGather, All-to-All 같은 Collective Communication이 반복됩니다.
이때 단순히 Ethernet 속도를 100G에서 400G, 800G로 높이는 것만으로는 충분하지 않습니다.
문제는 데이터가 Network에 들어가고 나오는 과정 자체에도 있기 때문입니다.
전통적인 Network Communication에서는 Application Memory에 있는 데이터를 CPU와 Operating System이 처리하고, 여러 Buffer를 거쳐 NIC(Network Interface Card)로 전달합니다. 반대쪽 Server에서도 NIC가 받은 데이터를 OS와 CPU가 처리해 Application Memory로 옮깁니다.
Network가 느리던 시절에는 큰 문제가 아니었습니다.
하지만 NIC가 400G·800G까지 빨라지고 GPU가 수 TB/s 수준의 Memory Bandwidth를 사용하는 시대에는 상황이 달라집니다.
Network가 빨라졌는데 데이터를 옮기느라 CPU가 계속 개입한다면 CPU와 Memory Copy 과정이 새로운 병목이 될 수 있습니다.
그래서 AI와 HPC에서는 데이터를 움직이는 방식을 바꿉니다.
바로 RDMA(Remote Direct Memory Access)입니다.
RDMA: Network를 통해 한 Server의 Application Memory와 다른 Server의 Application Memory 사이에서 데이터를 직접 이동시키고, 실제 Data Movement 과정에서 CPU 개입과 불필요한 Memory Copy를 크게 줄이는 기술입니다.
쉽게 말하면 RDMA의 핵심은 이것입니다.
CPU가 데이터를 직접 나르는 대신 NIC가 Memory에서 데이터를 가져와 상대편 Memory까지 직접 전달하게 만드는 것입니다.
AI Cluster가 커질수록 이 차이가 매우 중요해집니다.
RDMA를 먼저 한눈에 보면
| 구분 | 일반적인 Network I/O | RDMA |
|---|---|---|
| Data Movement | CPU·OS 중심 | NIC Hardware 중심 |
| Memory Copy | 여러 번 발생 가능 | 중간 Copy 최소화 |
| Kernel 개입 | 상대적으로 많음 | Data Path에서 크게 감소 |
| CPU 사용량 | 높을 수 있음 | 낮음 |
| Latency | 상대적으로 높음 | 낮음 |
| 주요 용도 | 일반 Application Traffic | AI, HPC, Storage, Database |
| 대표 구현 | TCP/IP | InfiniBand, RoCE, UET 등 |
여기서 한 가지는 정확하게 짚어야 합니다.
RDMA에서 “CPU를 거치지 않는다”는 표현은 CPU가 아예 필요 없다는 뜻이 아닙니다. Connection 설정, Memory 등록, Queue 관리, Application Logic 같은 Control 작업에는 CPU가 관여할 수 있습니다.
핵심은 실제 대용량 Data가 이동하는 Fast Path에서 CPU가 매 Packet을 직접 복사하고 처리하지 않아도 된다는 것입니다.
일반 Network에서는 데이터가 어떻게 이동할까요?
Server A에 있는 Application이 Server B로 1GB Data를 보내야 한다고 생각해보겠습니다.
전통적인 Network Stack에서는 Application Memory의 Data가 Operating System과 Kernel Network Stack을 거치고, NIC가 사용할 Buffer로 이동한 뒤 Network로 나갑니다.
Server B에서도 NIC가 받은 Data를 OS가 처리하고 최종적으로 Application이 사용하는 Memory까지 전달해야 합니다.
실제 구현은 Operating System과 Application에 따라 다르지만 핵심은 CPU와 System Memory가 Data Movement 과정에 상당히 관여할 수 있다는 것입니다.
문제는 Network Bandwidth가 높아질수록 CPU가 처리해야 하는 Data도 급격히 증가한다는 것입니다.
100Gbps Network와 800Gbps Network를 비교하면 같은 시간에 처리해야 하는 Data 양이 8배 차이납니다.
CPU가 AI 계산도 해야 하고 Network Packet 처리도 해야 한다면 좋은 구조라고 보기 어렵습니다.
RDMA에서는 NIC가 데이터를 직접 움직입니다
RDMA를 사용하면 Application이 미리 Memory Region을 등록하고, RDMA-capable NIC가 해당 Memory에 직접 접근할 수 있습니다.
RDMA NIC: RDMA Protocol과 DMA Engine을 Hardware에서 처리해 Host Memory 또는 지원되는 Accelerator Memory와 Network 사이에서 데이터를 직접 이동시키는 Network Interface Card입니다. 흔히 RNIC(RDMA-capable NIC)라고도 부릅니다.
Server A의 RDMA NIC는 지정된 Memory에서 데이터를 읽어 Network로 보내고, Server B의 RDMA NIC는 받은 데이터를 미리 지정된 Memory Region에 직접 기록할 수 있습니다.
즉 RDMA가 하는 일은 단순히 Network를 빠르게 만드는 것이 아닙니다.
Data가 Network를 통과하는 경로에서 CPU와 OS를 가능한 한 비켜가는 것입니다.
왜 Memory Copy가 그렇게 문제일까요?
1GB Data를 Network로 전송한다고 생각해보겠습니다.
Data가 Application Memory에서 Kernel Buffer로 복사되고, 다시 NIC Buffer 방향으로 처리된다면 Network로 보내는 것 외에도 Server 내부 Memory Bus를 계속 사용합니다.
이 과정에는 CPU Cycle뿐 아니라 Memory Bandwidth와 Power도 필요합니다.
AI Server에서는 이 문제가 더 중요합니다.
CPU Memory는 Network Traffic만 처리하는 것이 아닙니다. Storage, Application, GPU I/O 등 여러 Data Path가 동시에 Memory Bandwidth를 사용합니다.
따라서 불필요한 Copy를 줄이는 것은 단순 Latency 개선뿐 아니라 Server 전체 Data Movement Efficiency를 높이는 것과 연결됩니다.
Zero-Copy란?
Zero-Copy: Application Data를 전송하기 위해 CPU가 여러 중간 Buffer 사이에서 반복적으로 복사하는 과정을 제거하거나 최소화하는 Data Movement 방식입니다.
여기서도 “Data가 물리적으로 한 번도 복사되지 않는다”고 지나치게 문자 그대로 이해할 필요는 없습니다.
핵심은 Application Data를 전송하기 위해 Application Buffer, Kernel Buffer, Network Buffer를 계속 복사하는 전통적인 경로를 줄이는 것입니다.
Kernel Bypass도 RDMA에서 중요합니다
일반 Network Application은 Operating System의 Kernel Network Stack을 이용합니다.
Application이 System Call을 하고, Kernel이 Packet을 처리하고, Network Driver를 통해 NIC에 전달합니다.
이 과정은 범용성 측면에서는 훌륭합니다.
하지만 AI Training처럼 매우 짧은 시간에 엄청난 양의 Message를 반복적으로 주고받는 환경에서는 Software Overhead가 커질 수 있습니다.
Kernel Bypass: Network Data의 Fast Path에서 Operating System Kernel의 반복적인 Packet Processing을 우회하고 User Application과 Network Hardware가 보다 직접적으로 통신하게 하는 방식입니다.
즉 RDMA의 장점은 하나의 기술에서 나오는 것이 아닙니다.
Direct Memory Access, Zero-Copy, Kernel Bypass, Hardware Offload가 함께 Data Path를 단축합니다.
RDMA에서는 아무 Memory나 마음대로 읽을 수 있을까요?
그렇지 않습니다.
그렇게 된다면 엄청난 Security 문제가 생길 것입니다.
RDMA Application은 NIC가 접근할 수 있는 Memory Region을 미리 등록합니다.
Memory Registration: Application이 특정 Memory 영역을 RDMA NIC가 읽거나 쓸 수 있도록 등록하고 접근권한과 주소정보를 설정하는 과정입니다.
즉 Remote Server가 전체 Memory를 마음대로 읽는 것이 아닙니다.
허용된 Memory Region에 대해 정해진 Permission과 Key를 사용해 접근합니다.
이 과정 때문에 RDMA는 단순 Packet Transmission보다 Memory Management와 Network가 훨씬 밀접하게 연결되어 있습니다.
Queue Pair란 무엇일까요?
RDMA를 조금 더 깊게 보면 QP(Queue Pair)라는 용어가 자주 등장합니다.
Queue Pair: RDMA Communication에서 Send Queue와 Receive Queue를 한 쌍으로 묶어 Work Request와 Data Transfer를 관리하는 기본 Communication Object입니다.
Application은 NIC에 “이 Memory Data를 저쪽으로 보내라”, “저 Memory에서 이쪽으로 읽어와라” 같은 작업을 Queue에 등록합니다.
NIC는 Queue에 들어온 Work Request를 Hardware에서 처리합니다.
즉 CPU가 Network Packet 하나하나를 직접 만드는 방식보다 작업 단위로 NIC에 일을 맡기는 구조에 가깝습니다.
RDMA Read와 RDMA Write의 차이
RDMA에는 여러 Operation이 있지만 개념적으로 가장 쉽게 이해할 수 있는 것이 Read와 Write입니다.
RDMA Read: Local Server가 Remote Server의 허용된 Memory Region에서 데이터를 직접 읽어오는 Operation입니다.
RDMA Write: Local Server가 데이터를 Remote Server의 허용된 Memory Region에 직접 기록하는 Operation입니다.
중요한 것은 Remote CPU가 Data Packet 하나하나를 받아 Application Buffer에 복사할 필요가 없다는 점입니다.
NIC가 Memory Access를 직접 수행하기 때문입니다.
바로 이것이 RDMA의 Remote Direct Memory Access라는 이름에 들어 있는 의미입니다.
그런데 RDMA는 Network Protocol 이름이 아닙니다
이 부분은 매우 중요합니다.
RDMA 자체는 특정 Cable이나 특정 Network 하나를 의미하지 않습니다.
RDMA는 Memory-to-Memory Data Movement 방식에 가깝고, 이를 실제 Network에서 구현하는 Transport는 여러 종류가 있습니다.
대표적인 것이 InfiniBand, RoCE, iWARP, UET입니다.
| 기술 | Network | 특징 |
|---|---|---|
| InfiniBand RDMA | InfiniBand | AI/HPC에 특화된 고성능 Fabric |
| RoCE | Ethernet | Ethernet 위에서 RDMA 구현 |
| iWARP | TCP/IP Ethernet | TCP 기반 RDMA |
| UET | Ultra Ethernet | AI/HPC용 차세대 Ethernet RDMA Transport |
즉 “RDMA와 Ethernet 중 무엇이 좋은가?”라는 질문은 정확하지 않습니다.
Ethernet 위에서도 RDMA를 사용할 수 있기 때문입니다.
InfiniBand가 AI에서 강했던 이유도 RDMA와 연결됩니다
InfiniBand는 오래전부터 HPC와 Supercomputer에서 사용됐습니다.
가장 중요한 이유 중 하나가 낮은 Latency와 Native RDMA Architecture입니다.
AI Training도 HPC와 상당히 비슷한 문제가 있습니다. 수많은 Compute Node가 하나의 작업을 위해 계속 Data를 교환합니다.
그래서 HPC에서 검증된 RDMA Fabric이 AI Cluster에서도 중요해졌습니다.
그렇다면 RoCE는 무엇일까요?
RoCE: RDMA over Converged Ethernet의 약자로, Ethernet Network 위에서 RDMA를 사용할 수 있도록 만든 표준입니다.
발음은 흔히 “Rocky”라고 합니다.
RoCE가 중요한 이유는 Ethernet Infrastructure를 유지하면서 RDMA의 낮은 CPU Overhead와 낮은 Latency를 활용할 수 있기 때문입니다.
이것이 AI Data Center에서 매우 중요한 선택지가 됐습니다.
InfiniBand와 RoCE의 차이를 단순하게 보면
| 구분 | InfiniBand | RoCE |
|---|---|---|
| Network 기반 | 전용 InfiniBand Fabric | Ethernet |
| RDMA | Native | Ethernet 위에서 구현 |
| 강점 | 낮은 Latency, 검증된 HPC/AI Fabric | Ethernet 생태계·유연성 |
| Switch | InfiniBand Switch | Ethernet Switch |
| 주요 시장 | HPC, 대형 AI Cluster | Cloud, AI Ethernet, Storage |
| 핵심 과제 | 전용 생태계 | Congestion·Loss 관리 |
InfiniBand와 RoCE 모두 RDMA를 사용합니다.
차이는 RDMA Traffic을 어떤 Fabric 위에 올리느냐입니다.
왜 RoCE에서는 Congestion Control이 그렇게 중요할까요?
RDMA는 CPU Overhead가 낮고 빠르지만 Network가 혼잡해 Packet이 계속 손실되면 성능이 크게 떨어질 수 있습니다.
특히 AI Training에서는 Traffic Pattern이 일반 Web Service와 다릅니다.
GPU 수백 개가 동시에 특정 GPU나 Switch Port로 Data를 보내는 Incast가 발생할 수 있고, All-to-All Communication에서는 여러 대형 Flow가 동시에 Network를 가득 채울 수 있습니다.
AI Network에서는 평균 Latency보다 Tail Latency가 중요할 수 있습니다.
대부분 GPU의 Data가 빨리 도착해도 한 GPU의 Data가 늦으면 Collective Operation 전체가 기다릴 수 있기 때문입니다.
그래서 RoCE 기반 AI Ethernet에서는 Congestion Control이 매우 중요합니다.
PFC는 무엇일까요?
PFC: Priority Flow Control의 약자로, Ethernet Traffic Class별로 Pause Frame을 사용해 Buffer Overflow와 Packet Loss를 줄이는 Data Center Bridging 기술입니다.
RoCE는 오랫동안 PFC와 ECN 같은 Mechanism을 이용해 Loss를 줄이고 안정적인 RDMA Network를 구축해왔습니다.
하지만 Cluster가 수십만 GPU까지 커지면 단순히 Network를 거의 Lossless하게 유지하는 것만으로 모든 문제가 해결되지는 않습니다.
AI 시대에는 RDMA 자체도 진화하고 있습니다
RDMA는 오래된 기술입니다.
하지만 AI Cluster 규모가 HPC보다 훨씬 커지면서 기존 RDMA Transport에도 새로운 요구가 생겼습니다.
한 Flow를 하나의 Path에 고정하면 특정 Link에 Traffic이 몰릴 수 있고, Packet 하나가 손실됐다고 너무 많은 Data를 다시 보내면 Bandwidth를 낭비할 수 있습니다.
그래서 최신 AI Network에서는 Multipathing, Packet Spraying, Selective Retransmission, Programmable Congestion Control 같은 기능이 중요해지고 있습니다.
이것이 2026년 AI Ethernet의 중요한 변화 중 하나입니다.
Ultra Ethernet은 RDMA를 버리는 것이 아닙니다
Ultra Ethernet Consortium이 등장하면서 “Ultra Ethernet은 RDMA 대신 새로운 방식을 쓰는 것인가?”라고 생각하기 쉽습니다.
그렇지 않습니다.
UEC의 핵심은 오히려 AI와 HPC에 맞게 RDMA Transport를 현대화하는 것입니다.
Ultra Ethernet Transport(UET): AI와 HPC의 대규모 Ethernet Fabric을 위해 Multipathing, Flexible Ordering, Congestion Control, Telemetry 등을 강화한 차세대 RDMA Transport입니다.
즉 AI Ethernet의 방향은 RDMA를 없애는 것이 아니라 AI Scale에 맞게 RDMA를 다시 설계하는 것에 가깝습니다.
UET는 기존 RDMA에서 무엇을 바꾸려고 할까요?
Ultra Ethernet Transport는 대규모 AI Cluster에서 기존 RDMA가 겪는 문제를 줄이기 위해 여러 기능을 추가합니다.
대표적으로 여러 Network Path에 Packet을 분산하는 Multipath Packet Spraying, Packet이 다른 순서로 도착해도 처리할 수 있는 Flexible Ordering, 더 확장성 높은 Congestion Control, End-to-end Telemetry, 여러 Transport Delivery Service 등이 있습니다.
즉 기존 Network가 “Packet을 순서대로 안전하게 전달하는 것”에 더 집중했다면 최신 AI Transport는 수십만 Accelerator가 동시에 움직일 때 Network 전체를 최대한 효율적으로 사용하는 것에 더 가깝습니다.
왜 Packet을 여러 Path에 뿌릴까요?
AI Cluster에서 Server A와 Server B 사이에는 물리적으로 여러 Network 경로가 존재할 수 있습니다.
기존 ECMP 방식에서는 하나의 큰 Flow가 특정 Path에 배정됩니다.
문제는 그 Path가 혼잡한데 다른 Path는 비어 있을 수 있다는 것입니다.
Packet Spraying: 하나의 큰 Flow를 Packet 단위 또는 더 세밀한 단위로 여러 Network Path에 분산시켜 전체 Fabric Bandwidth를 더 고르게 사용하는 기술입니다.
장점은 Network Utilization을 높일 수 있다는 것입니다.
하지만 단점도 있습니다.
Packet이 서로 다른 Path를 지나면 도착 순서가 바뀔 수 있습니다.
그래서 차세대 RDMA NIC는 Out-of-order Packet Processing과 In-order Message Delivery를 Hardware에서 처리하는 방향으로 발전하고 있습니다.
AMD Pollara 400이 바로 이런 AI NIC입니다
AMD의 Pensando Pollara 400 AI NIC는 최대 400Gbps Ethernet을 지원하며 RoCEv2와 UEC-ready RDMA 기능을 지원합니다.
특히 Intelligent Packet Spray, Out-of-order Packet Handling, Selective Retransmission, Path-aware Congestion Control, Telemetry 같은 기능을 Hardware에서 처리하도록 설계됐습니다.
AMD는 Pollara가 기존 RoCEv2뿐 아니라 UEC-ready RDMA를 Software를 통해 지원할 수 있도록 Programmable Networking Engine을 사용합니다.
즉 NIC가 단순히 Packet을 보내는 Network Card가 아니라 AI Transport Algorithm을 실행하는 Programmable Networking Processor로 변하고 있는 것입니다.
AMD는 왜 NIC 사업까지 강화할까요?
AMD는 이제 CPU와 GPU만 공급하려는 회사가 아닙니다.
Helios Rack-scale AI Platform에는 EPYC CPU, Instinct GPU뿐 아니라 Pensando Networking도 중요한 구성요소로 들어갑니다.
투자 관점에서 더 중요한 변화는 AMD가 CPU + GPU에서 CPU + GPU + NIC + Rack-scale Network로 사업범위를 넓히고 있다는 점입니다.
800G AI NIC도 이미 등장했습니다
400G가 끝이 아닙니다.
Broadcom은 Thor Ultra 800G AI Ethernet NIC를 공개했고 PCIe 6.0 기반 800G Adapter 제품군을 확대하고 있습니다.
Thor Ultra는 Advanced RoCE와 UEC 기능을 지원하며 Packet-level Multipathing, Out-of-order Data Placement, Hardware Selective Retransmission, Programmable Congestion Control 등을 제공합니다.
즉 Network Link가 400G에서 800G로 빨라지면서 NIC가 해야 하는 일도 단순 Packet Forwarding에서 훨씬 복잡한 RDMA Transport Processing으로 바뀌고 있습니다.
Broadcom이 RDMA에서 중요한 이유
Broadcom은 AI Network를 Switch ASIC만으로 공략하지 않습니다.
Switch 쪽에서는 Tomahawk 계열 Ethernet Switch Silicon을 공급하고, Host 쪽에서는 Thor Ultra 같은 AI NIC를 공급합니다.
즉 Broadcom 입장에서는 GPU에서 Network로 Data가 나오는 Endpoint와 그 Data를 전달하는 Switch Fabric 양쪽에 Silicon Content를 넣을 수 있습니다.
AI Ethernet 시장에서 Broadcom이 계속 등장하는 이유입니다.
NVIDIA에서는 RDMA가 더 직접적으로 GPU와 연결됩니다
NVIDIA는 GPUDirect RDMA를 제공합니다.
GPUDirect RDMA: Network Adapter 같은 PCIe Device가 CPU System Memory를 중간 Buffer로 사용하지 않고 NVIDIA GPU Memory에 직접 접근할 수 있도록 하는 기술입니다.
이 기술을 사용하면 Remote System의 GPU끼리 Data를 주고받을 때 Host Memory를 Bounce Buffer로 사용하는 과정을 줄일 수 있습니다.
일반 RDMA와 GPUDirect RDMA는 무엇이 다를까요?
일반적인 RDMA는 주로 Host Memory와 Network 사이의 Direct Data Movement를 생각하면 쉽습니다.
GPUDirect RDMA는 한 단계 더 나아가 GPU Memory와 Network Adapter 사이의 Direct Data Path를 만듭니다.
| 구분 | 일반 RDMA | GPUDirect RDMA |
|---|---|---|
| 주요 Memory | Host DRAM | GPU Memory |
| 중간 CPU Memory Copy | 크게 감소 | Host Bounce Buffer도 제거 가능 |
| 주요 대상 | Server Application | AI/HPC GPU Workload |
| NIC 역할 | Host Memory DMA | GPU Peer Memory 접근 |
AI Cluster에서는 이 차이가 중요합니다.
Bounce Buffer란?
Bounce Buffer: 두 Device가 직접 데이터를 주고받지 못할 때 System Memory에 임시 Buffer를 만들고 Data를 한 번 거쳐 보내는 방식입니다.
GPU A의 Data를 다른 Server의 GPU B로 보내는데 GPU A에서 CPU Memory로 복사하고, CPU Memory에서 NIC로 보낸다면 Host Memory가 Bounce Buffer 역할을 합니다.
반대쪽에서도 NIC에서 Host Memory를 거쳐 GPU B로 다시 복사한다면 Copy가 또 발생합니다.
GPUDirect RDMA는 이 중간경로를 줄여 NIC와 GPU Memory 사이의 Direct Data Path를 만듭니다.
이것이 AI Training에서 왜 그렇게 중요할까요?
GPU는 일정 시간 계산한 뒤 다른 GPU와 결과를 교환합니다.
그동안 GPU가 Network Data를 기다리면 계산을 못 할 수 있습니다.
GPU가 8개일 때는 작은 Delay일 수 있습니다.
하지만 GPU가 10,000개라면 한 GPU의 Delay가 Collective Communication 전체에 영향을 줄 수 있습니다.
즉 AI Cluster에서는 GPU 하나의 FLOPS보다 GPU가 서로 데이터를 얼마나 빨리 교환하는지가 System Performance를 결정하는 순간이 많아집니다.
RDMA는 바로 그 Data Movement Overhead를 줄입니다.
AllReduce에서 RDMA가 중요한 이유
AllReduce: 여러 Accelerator가 가진 Data를 서로 교환하고 Reduce Operation을 수행한 뒤 결과를 모든 Accelerator에 다시 전달하는 Collective Communication입니다.
GPU 수천 개가 AllReduce를 반복하면 Network에 엄청난 Traffic이 발생합니다.
이때 CPU가 모든 Data Movement에 관여하면 Network 처리 때문에 CPU Resource가 소모되고 Latency가 증가할 수 있습니다.
RDMA와 GPUDirect RDMA를 이용하면 NIC와 GPU가 Data Movement의 상당 부분을 직접 처리할 수 있습니다.
즉 AI Training Network에서는 GPU가 계산하고 NIC가 데이터를 옮기는 역할분담이 만들어집니다.
그래서 AI NIC는 점점 더 중요해집니다
기존 NIC의 이미지는 단순했습니다.
Server를 Network에 연결하는 부품이었습니다.
AI 시대의 NIC는 완전히 달라지고 있습니다.
최신 AI NIC는 RDMA Engine, Congestion Control, Packet Scheduling, Multipathing, Selective Retransmission, Telemetry, Encryption, GPU Direct Memory Access 같은 기능을 Hardware에서 처리합니다.
즉 NIC가 AI Cluster의 Transport Processor가 되고 있습니다.
400G·800G AI NIC의 가격과 기술 Content가 일반 Server NIC보다 높아지는 이유도 여기에 있습니다.
NVIDIA Spectrum-X도 결국 RDMA Transport 문제를 해결합니다
NVIDIA의 Ethernet AI Network인 Spectrum-X에서도 RoCE가 핵심 Data Transport 중 하나입니다.
Spectrum-X는 Switch와 SuperNIC을 함께 설계해 Adaptive Routing, Programmable Congestion Control, Telemetry 등을 Hardware에서 처리합니다.
즉 Ethernet Switch 하나만 빠르게 만드는 것이 아니라 Switch와 RDMA NIC가 서로 Network 상태를 이해하면서 Traffic을 조정하도록 만드는 것입니다.
왜 Switch와 NIC를 같이 설계하려 할까요?
Congestion은 Switch에서 발생하지만 실제 Data를 보내는 것은 NIC입니다.
Switch가 “이 Path가 막혔다”는 것을 알고 있어도 Sender NIC가 계속 같은 속도로 데이터를 보내면 문제가 해결되지 않습니다.
반대로 NIC가 Network 안쪽 상태를 모르고 있으면 어느 Path를 사용해야 할지 판단하기 어렵습니다.
그래서 최신 AI Ethernet에서는 Switch Telemetry와 NIC Congestion Control을 함께 설계하는 방향이 중요해지고 있습니다.
MRC도 새로운 RDMA 방식입니다
MRC: Multipath Reliable Connection의 약자로, 하나의 RDMA Connection이 여러 Network Path를 동시에 사용할 수 있도록 확장한 Multipath RDMA Transport입니다.
하나의 Flow를 여러 Path에 분산하면 특정 Link에 Traffic이 몰리는 문제를 줄이고 전체 Fabric Bandwidth를 더 효율적으로 사용할 수 있습니다.
이것은 UET와 마찬가지로 대형 AI Ethernet에서 Multipath RDMA가 중요해지고 있음을 보여줍니다.
RDMA 경쟁이 RoCE냐 InfiniBand냐에서 끝나지 않는 이유
몇 년 전까지 AI Network를 단순하게 보면 InfiniBand 또는 RoCE Ethernet 정도로 생각할 수 있었습니다.
하지만 이제는 훨씬 복잡해졌습니다.
InfiniBand는 계속 진화하고 있고, RoCE 역시 Advanced RoCE로 발전하고 있습니다. 여기에 Ultra Ethernet의 UET, MRC 같은 새로운 Transport가 등장하고 있습니다.
즉 현재 AI Network 경쟁의 본질은 RDMA를 사용할 것인가 말 것인가가 아닙니다.
더 중요한 질문은 수십만 GPU 환경에서 RDMA를 어떤 방식으로 확장할 것인가입니다.
기존 RDMA의 가장 큰 문제 중 하나는 Path입니다
대형 AI Network에는 Source와 Destination 사이에 여러 Path가 존재합니다.
한 RDMA Flow가 특정 Path에 고정되면 다른 Path는 비어 있는데도 한쪽 Link가 막힐 수 있습니다.
AI Traffic은 Flow가 크기 때문에 이런 문제가 특히 심할 수 있습니다.
그래서 UET, MRC, Advanced RoCE 모두 Multipath 활용을 강화하고 있습니다.
즉 차세대 AI Network의 핵심 키워드는 단순 Lossless가 아니라 Multipath RDMA로 이동하고 있습니다.
Packet 순서가 바뀌어도 괜찮게 만드는 이유
여러 Path를 사용하면 Packet이 도착하는 순서가 달라질 수 있습니다.
Path A의 Packet이 늦게 오고 Path B의 Packet이 먼저 도착할 수 있습니다.
기존 Transport가 반드시 Packet 순서를 유지하려 한다면 이를 처리하기 어려워집니다.
그래서 최신 AI NIC는 Network에서는 Packet을 여러 Path로 자유롭게 보내고, Endpoint에서 최종 Message 순서를 맞추는 방식으로 발전합니다.
이것은 Switch보다 NIC Intelligence가 중요해지는 대표적인 사례입니다.
Packet 하나가 손실됐다고 전부 다시 보내면 낭비입니다
Network에서 Packet 하나가 손실될 수 있습니다.
예를 들어 1,000개의 Packet 중 501번 Packet 하나가 사라졌다고 생각해보겠습니다.
단순한 Transport에서는 특정 지점 이후의 많은 Packet을 다시 보내야 할 수 있습니다.
AI Network에서는 Data Volume이 매우 크기 때문에 엄청난 Bandwidth 낭비가 됩니다.
Selective Retransmission: 손실된 Packet이나 필요한 작은 Data 범위만 선택적으로 다시 전송하는 방식입니다.
최신 AI RDMA Transport가 이런 기능을 강화하는 이유입니다.
RDMA에서 Latency보다 Tail Latency가 더 중요할 수도 있습니다
평균 Packet Latency가 낮아도 일부 Packet이 매우 늦게 도착하면 AI Collective에서는 문제가 될 수 있습니다.
수많은 GPU가 서로 기다리기 때문입니다.
Tail Latency: 전체 요청 중 가장 느린 일부 요청이 경험하는 지연시간으로, P99나 P99.9 같은 Percentile로 표현합니다.
AI Cluster에서는 평균적으로 빠른 Network보다 거의 모든 GPU가 예측 가능한 시간 안에 Data를 받는 Network가 더 중요할 수 있습니다.
RDMA와 Storage도 밀접하게 연결됩니다
RDMA는 GPU Communication에만 사용하는 기술이 아닙니다.
Storage에서도 중요합니다.
NVMe SSD가 빨라지면서 Server가 Storage Data를 가져올 때 CPU가 Network Protocol을 처리하는 것도 병목이 될 수 있습니다.
그래서 NVMe over Fabrics(NVMe-oF)와 RDMA를 결합합니다.
또 GPUDirect Storage 같은 기술을 이용하면 Storage와 GPU Memory 사이의 Data Path에서 CPU Memory의 Bounce Buffer를 줄일 수 있습니다.
즉 Storage에서 GPU까지의 Data Movement도 점점 Direct Path로 바뀌고 있습니다.
이것이 AI Checkpoint에도 중요합니다
AI Training은 중간 결과를 Storage에 주기적으로 저장합니다.
이를 Checkpoint라고 합니다.
Model이 매우 크면 Checkpoint Data도 매우 커집니다.
수천 GPU가 동시에 Storage로 Data를 쓰면 Network Traffic이 폭증할 수 있습니다.
이때 CPU와 Host Memory를 계속 거치면 Storage Traffic 자체가 Server Resource를 많이 사용합니다.
그래서 RDMA는 GPU Communication뿐 아니라 AI Storage Fabric에서도 중요한 기술입니다.
RDMA와 CXL은 무엇이 다를까요?
둘 다 Remote Memory라는 표현이 등장할 수 있지만 목적이 다릅니다.
| 구분 | RDMA | CXL |
|---|---|---|
| 기본 목적 | Network를 통한 빠른 Data Movement | Memory·Device Coherency와 Resource 연결 |
| 거리 | Network Scale | 주로 Server·Rack Fabric |
| Memory Access | RDMA Operation | Load/Store Memory Semantics |
| Network | InfiniBand, Ethernet 등 | PCIe PHY 기반 CXL Fabric |
| CPU Bypass | 중요한 특징 | 핵심 목적은 아님 |
| 대표 활용 | GPU 통신, Storage, HPC | Memory Expansion·Pooling |
RDMA는 Data를 빠르게 옮기는 것에 강합니다.
CXL은 Remote Resource를 Memory Architecture 안에 넣는 것에 강합니다.
따라서 둘은 경쟁기술이라기보다 서로 다른 Layer에서 사용될 수 있습니다.
Optical CXL과 RDMA Ethernet도 경쟁영역이 생길 수 있습니다
Memory를 같은 Rack이나 가까운 Rack에서 Memory처럼 사용하고 싶다면 CXL이 유리할 수 있습니다.
하지만 거리가 더 멀어지면 CXL의 Latency 장점이 줄어들 수 있습니다.
반대로 RDMA Ethernet은 더 넓은 Network에서 대규모 Resource에 접근하는 데 강합니다.
즉 미래 Disaggregated Data Center에서는 가까운 Memory Resource는 CXL, 더 먼 Resource는 RDMA Network처럼 서로 다른 Technology가 계층을 형성할 가능성이 있습니다.
경계는 결국 Latency, Distance, Bandwidth, Cost가 결정합니다.
RDMA는 CPU가 필요 없어지는 기술이 아닙니다
RDMA를 사용해도 CPU는 필요합니다.
Application을 실행하고, Connection을 설정하고, Memory Region을 등록하고, Work Queue를 관리하고, Error를 처리해야 합니다.
RDMA가 제거하려는 것은 CPU 자체가 아니라 CPU가 Data Packet을 하나하나 운반하는 비효율입니다.
즉 CPU는 관리자가 되고 NIC는 실제 운송작업을 담당하게 됩니다.
이 역할분담이 중요합니다.
AI NIC가 비싸져도 경제성이 있을 수 있는 이유
일반 NIC보다 RDMA Engine과 고급 Congestion Control이 들어간 AI NIC는 더 복잡하고 비쌀 수 있습니다.
그런데 GPU는 훨씬 비쌉니다.
Network가 느려 GPU 수천 개가 몇 %씩 Idle 상태가 된다면 NIC 가격을 아끼는 것이 오히려 전체 System에서는 더 비싼 선택일 수 있습니다.
그래서 AI Network를 볼 때는 NIC 가격보다 GPU Utilization을 얼마나 높일 수 있는가가 더 중요한 경제성 지표가 됩니다.
이것이 AI Networking Semiconductor의 Content가 계속 증가하는 이유입니다.
NVIDIA가 RDMA 시장에서 강한 이유
NVIDIA의 강점은 단순 ConnectX NIC 하나가 아닙니다.
GPU, ConnectX SuperNIC, BlueField DPU, Spectrum-X Ethernet Switch, InfiniBand Switch, GPUDirect RDMA, NCCL Software까지 하나의 Stack으로 연결할 수 있습니다.
특히 GPUDirect RDMA를 통해 GPU Memory와 NIC를 직접 연결할 수 있다는 점은 NVIDIA GPU Cluster에서 강력한 장점입니다.
즉 NVIDIA는 GPU를 파는 동시에 그 GPU가 서로 통신하는 Data Path도 함께 공급할 수 있습니다.
Broadcom은 Open Ethernet 쪽에서 강한 위치를 노립니다
Broadcom은 GPU를 직접 주력으로 판매하는 회사가 아닙니다.
대신 Ethernet Infrastructure에서 Switch ASIC과 NIC를 모두 공급합니다.
Tomahawk 계열 Switch와 Thor Ultra 800G NIC를 결합하면 Host Endpoint부터 Fabric Core까지 Silicon Content를 공급할 수 있습니다.
즉 Hyperscaler가 Proprietary Network 대신 Open Ethernet을 확대할수록 Broadcom에는 중요한 기회가 될 수 있습니다.
AMD도 RDMA Network Stack을 직접 확보하려 합니다
AMD는 Pensando 인수를 통해 NIC와 DPU Technology를 확보했습니다.
현재 Pollara 400 AI NIC는 RoCEv2와 UEC-ready RDMA를 지원하고 있고, 차세대 Vulcano 800 AI NIC는 최대 800Gbps Ethernet Connectivity를 목표로 합니다.
AMD 입장에서는 Instinct GPU와 Pensando NIC를 함께 공급하면 Helios 같은 Rack-scale Platform의 Network Architecture까지 더 직접적으로 통제할 수 있습니다.
즉 AI Accelerator 경쟁이 점점 GPU 성능만이 아니라 GPU + Network + Software + Rack Architecture 경쟁으로 바뀌고 있습니다.
RDMA Value Chain을 보면 누가 돈을 버는지 더 잘 보입니다
| Layer | 역할 | 기업 예시 |
|---|---|---|
| GPU / XPU | 실제 AI Compute | NVIDIA, AMD 등 |
| AI NIC / SuperNIC | RDMA Transport 처리 | NVIDIA, AMD, Broadcom |
| Switch ASIC | RDMA Traffic 전달 | NVIDIA, Broadcom 등 |
| Optical / Cable | Physical Connection | 다양한 광통신·Cable 업체 |
| RDMA Software | Communication Library·Driver | GPU·NIC Platform 업체 |
| Test / Validation | High-speed Network 검증 | Network Test 업체 |
즉 RDMA는 Software Protocol 하나가 아닙니다.
RDMA Traffic이 늘어날수록 NIC Silicon, Switch ASIC, PCIe Interface, Optics, Cable, Software Stack이 함께 움직입니다.
AI Infrastructure에서 하나의 기술이 여러 Layer의 Revenue로 연결되는 대표적인 사례입니다.
투자 관점에서는 RDMA 관련주를 찾는 것보다 NIC Attach를 보는 편이 낫습니다
GPU Cluster 하나를 구축하려면 GPU만 필요한 것이 아닙니다.
GPU 또는 Server Node마다 Network Interface가 필요하고, Cluster가 커질수록 더 많은 Switch Port와 Optical Link도 필요합니다.
특히 Network Bandwidth가 400G에서 800G로 올라가고 NIC가 단순 Ethernet Adapter에서 Programmable AI NIC로 바뀌면 Server당 Networking Content도 증가할 수 있습니다.
따라서 중요한 질문은 AI GPU가 몇 개 팔리는가뿐 아니라 GPU당 몇 Gbps의 Scale-out Network가 필요한가, NIC당 Silicon Content가 얼마나 증가하는가, Switch Port와 Optics가 얼마나 함께 늘어나는가입니다.
하지만 모든 AI Server에 고급 RDMA NIC가 같은 수량으로 들어가는 것은 아닙니다
Architecture에 따라 다릅니다.
GPU 수, Scale-up Network 구성, Scale-out Bandwidth, NIC Sharing 방식, Multi-rail Architecture에 따라 NIC 수가 달라질 수 있습니다.
따라서 단순히 GPU 1개 = RDMA NIC 1개처럼 계산하면 안 됩니다.
AI Networking 시장을 볼 때는 Accelerator 수 × Network Bandwidth per Accelerator × NIC/Switch Architecture를 함께 봐야 합니다.
앞으로 가장 먼저 볼 것은 800G AI NIC 전환입니다
현재 400G AI NIC는 이미 실제 시장에서 사용되고 있습니다.
다음 단계는 800G NIC입니다.
Network가 800G로 올라가면 NIC뿐 아니라 PCIe Host Interface도 빨라져야 하고, Switch, Optical Transceiver, SerDes도 함께 세대교체됩니다.
즉 800G NIC는 단순 NIC Upgrade가 아니라 AI Scale-out Network 전체의 Upgrade Cycle과 연결됩니다.
두 번째는 RoCE가 어떻게 진화하느냐입니다
RoCE는 이미 대규모 Data Center에서 사용되고 있습니다.
하지만 최신 AI Cluster에서는 Multipathing과 Congestion Control 문제가 더 중요해지고 있습니다.
NVIDIA는 Spectrum-X에서 Advanced RoCE와 MRC를 확대하고 있고, Broadcom은 Thor Ultra에서 UEC와 Advanced RoCE를 지원하며, AMD Pollara 역시 RoCEv2와 UEC-ready RDMA를 지원합니다.
즉 RoCE가 사라지는 것이 아니라 AI Scale에 맞게 확장되는 과정을 보고 있는 것입니다.
세 번째는 UET가 실제 Production으로 얼마나 들어가느냐입니다
Ultra Ethernet의 규격이 나온 것과 실제 Hyperscaler Cluster에 UET가 대량 배치되는 것은 다른 문제입니다.
이제 중요한 것은 실제 NIC와 Switch가 UET 기능을 어느 정도 구현하고, 고객이 Production Cluster에서 이를 얼마나 사용하는가입니다.
즉 UEC도 Specification 단계에서 실제 Product Configuration 단계로 이동하는지 확인할 필요가 있습니다.
네 번째는 MRC와 UET의 역할입니다
둘 모두 대형 AI Ethernet에서 기존 RDMA의 Multipath와 Reliability 문제를 개선하려 합니다.
하지만 동일한 기술은 아닙니다.
MRC는 기존 RoCE Ecosystem을 확장하는 Multipath Reliable Connection이고, UET는 Ultra Ethernet Consortium이 정의하는 더 포괄적인 차세대 Transport Architecture입니다.
앞으로 Hyperscaler들이 어떤 Transport 조합을 선택하는지는 NIC와 Switch 경쟁구도에도 영향을 줄 수 있습니다.
다섯 번째는 NIC의 Programmability입니다
AI Network Transport가 빠르게 변하고 있습니다.
몇 년마다 새로운 Hardware를 교체해서는 속도를 따라가기 어렵습니다.
그래서 Programmable Pipeline과 Programmable Congestion Control을 지원하는 NIC가 중요해지고 있습니다.
즉 미래 AI NIC의 경쟁력은 몇 Gbps인가뿐 아니라 새로운 RDMA Algorithm을 Hardware 교체 없이 얼마나 빠르게 적용할 수 있는가까지 확대되고 있습니다.
여섯 번째는 GPU Memory Direct Access입니다
AI Network에서는 CPU Memory를 거치는 것조차 낭비가 될 수 있습니다.
그래서 Network Adapter가 GPU Memory에 직접 접근하는 기술이 중요합니다.
NVIDIA GPUDirect RDMA가 대표적인 사례이고 다른 AI NIC 업체도 Peer Memory Direct 계열 기능을 강화하고 있습니다.
이 흐름이 확대되면 NIC는 CPU Peripheral이 아니라 GPU Memory System의 일부처럼 움직이기 시작합니다.
일곱 번째는 Network가 GPU Utilization을 얼마나 높이는가입니다
AI Networking의 최종 성능지표는 NIC Benchmark 자체가 아닙니다.
중요한 것은 Job Completion Time과 GPU Utilization입니다.
Network Latency가 줄고 Tail Latency가 안정되면 GPU가 Communication을 기다리는 시간이 줄어듭니다.
따라서 AI Network 업체들은 단순 Throughput보다 Job Completion Time, Collective Performance, Cluster Availability 같은 지표를 점점 더 강조하고 있습니다.
RDMA의 가장 큰 장점은 CPU를 아끼는 것이 아닐 수도 있습니다
처음 RDMA를 배우면 가장 눈에 들어오는 것은 CPU Offload입니다.
물론 중요합니다.
하지만 AI Data Center 규모에서는 더 본질적인 가치가 있습니다.
GPU가 Network Data를 기다리는 시간을 줄이는 것
입니다.
CPU 몇 %를 절약하는 것보다 수만 개의 비싼 GPU가 더 높은 Utilization으로 동작하게 만드는 것이 훨씬 큰 경제적 효과를 만들 수 있습니다.
그래서 RDMA가 AI Infrastructure에서 다시 중요해진 것입니다.
핵심 정리
| 질문 | 답 |
|---|---|
| RDMA란? | Remote Server의 Memory 사이에서 CPU 개입과 Memory Copy를 줄여 Data를 직접 이동시키는 기술 |
| 왜 AI에 필요한가? | GPU 수천 개가 지속적으로 대량 Data를 교환하기 때문 |
| CPU가 정말 필요 없나? | 아닙니다. Control에는 필요하지만 Data Fast Path의 CPU 개입을 크게 줄입니다 |
| Zero-Copy란? | 중간 Buffer 사이의 반복적인 Data Copy를 제거하거나 최소화하는 방식 |
| InfiniBand와 RDMA는 같은가? | 아닙니다. InfiniBand는 RDMA를 지원하는 Fabric 중 하나입니다 |
| RoCE란? | Ethernet 위에서 RDMA를 구현하는 표준 |
| UET란? | AI·HPC Scale에 맞게 RDMA를 현대화한 Ultra Ethernet Transport |
| GPU와 직접 연결할 수 있나? | GPUDirect RDMA 같은 기술을 이용하면 가능합니다 |
| 누가 돈을 버나? | AI NIC, Switch ASIC, Optics, Cable, RDMA Software를 공급하는 업체들이 연결됩니다 |
RDMA를 이해하면 AI Networking을 보는 방식이 달라집니다.
Network에서 중요한 것은 단순히 400G인가, 800G인가가 아닙니다.
같은 800G Network라도 CPU가 계속 Packet을 처리하고 Memory Copy를 반복한다면 GPU는 Network의 전체 성능을 제대로 활용하지 못할 수 있습니다.
RDMA는 이 Data Path 자체를 바꿉니다.
CPU는 Application과 Control에 집중하고, NIC가 Memory에서 데이터를 직접 가져와 Network를 통해 다른 Server의 Memory까지 전달합니다. GPU 환경에서는 한 단계 더 나아가 GPU Memory와 NIC를 직접 연결합니다.
그래서 AI Network에서 NIC의 역할도 변하고 있습니다.
과거의 NIC가 Server를 Ethernet Cable에 연결하는 Adapter였다면 최신 AI NIC는 RDMA Engine, Congestion Control, Multipathing, Retransmission, Telemetry, GPU Memory Access까지 담당하는 Transport Processor에 가까워지고 있습니다.
AI Cluster가 커질수록 Compute 자체보다 Compute 사이에서 데이터를 이동시키는 비용이 더 중요해집니다.
GPU가 계산을 마친 뒤 Network를 기다리는 순간, 수십억 달러 규모의 AI Infrastructure 일부가 멈춰 있는 것과 같기 때문입니다.
따라서 RDMA의 핵심을 한 문장으로 정리하면 이렇게 볼 수 있습니다.
RDMA는 Network를 단순히 빠르게 만드는 기술이 아니라, 비싼 CPU와 GPU가 데이터를 옮기는 일에 시간을 낭비하지 않도록 Data Movement를 Hardware에 맡기는 기술입니다.
바로 이 때문에 RDMA는 오래된 HPC 기술에서 끝나지 않고 대규모 AI Factory를 움직이는 핵심 Networking Layer로 다시 중요해지고 있습니다.
curiouszip
댓글 0
첫 댓글을 남겨보세요.