본문 바로가기
Tech Layers | Under the chip Tech Layers | Under the chip
Complex tech, simply unpacked.

AI NIC란? GPU와 Ethernet 사이에서 RDMA를 처리하는 반도체

curiouszip

AI 서버를 보면 가장 눈에 띄는 부품은 당연히 GPU입니다. 하지만 GPU가 수천 개, 수만 개로 늘어나면 GPU 자체의 연산성능만큼 중요한 부품이 하나 더 생깁니다.

바로 NIC(Network Interface Card)입니다.

일반 서버에서도 NIC는 필요합니다. 서버가 Ethernet Network와 통신하려면 Network Interface가 있어야 하기 때문입니다.

하지만 AI 서버의 NIC는 일반 서버 NIC와 역할이 크게 달라지고 있습니다.

대규모 AI Training에서는 GPU가 계산한 데이터를 다른 서버의 GPU로 계속 보내야 합니다. RDMA를 처리해야 하고, Network Congestion이 발생하면 전송속도를 조절해야 하며, 여러 Network Path 가운데 어느 길로 Packet을 보낼지도 결정해야 합니다. Packet 일부가 손실되면 필요한 Data만 다시 보내고, Network에 문제가 발생하면 빠르게 다른 Path로 Traffic을 이동시켜야 합니다.

여기에 GPU Memory와 직접 데이터를 주고받는 기능까지 필요합니다.

결국 최신 AI NIC는 단순히

“서버에 Ethernet Port를 하나 만들어주는 카드”

가 아닙니다.

AI NIC: GPU Cluster의 Scale-out Network에서 RDMA, GPU Direct Memory Access, Congestion Control, Multipathing, Packet Recovery, Telemetry 등을 Hardware로 처리해 GPU 사이의 Data Movement를 가속하는 Network Semiconductor입니다.

그래서 NVIDIA는 이런 제품을 SuperNIC, AMD와 Broadcom은 AI NIC라는 표현으로 부르기 시작했습니다.

이름은 조금씩 다르지만 방향은 같습니다.

NIC가 Network Adapter에서 AI Data Movement Processor로 바뀌고 있는 것입니다.

일반 NIC와 AI NIC는 무엇이 다를까요?

먼저 차이부터 보면 이해하기 쉽습니다.

구분일반 서버 NICAI NIC / SuperNIC
주요 목적Server Network 연결GPU Cluster Data Movement
주요 TrafficWeb, Enterprise, Storage 등AI Collective Communication
BandwidthWorkload에 따라 다양400G·800G급으로 빠르게 증가
RDMA제품에 따라 지원핵심 기능
GPU Memory 접근일반적으로 핵심기능 아님Direct GPU Memory Access 중요
Congestion Control일반 Ethernet 중심AI Traffic 특화 기능 강화
Multipathing일반 Load BalancingPacket-level Multipath 확대
TelemetryNetwork MonitoringGPU Job Performance와 연결
역할Network AdapterAI Transport Processor

가장 큰 차이는 Bandwidth 숫자 자체보다 NIC가 직접 처리해야 하는 Network Logic의 양이 크게 늘었다는 것입니다.

과거에는 Packet을 빨리 보내고 받는 것이 중요했다면 AI 시대에는 GPU가 Network를 기다리지 않도록 만드는 것이 중요합니다.

왜 GPU 시대에 NIC가 갑자기 중요해졌을까요?

GPU 하나가 독립적으로 계산한다면 Network의 중요성은 상대적으로 작습니다.

하지만 최신 AI Model은 GPU 한 개에 들어가지 않습니다.

Model Parameter와 Activation, Gradient 등을 여러 GPU가 나눠 처리합니다. 그러면 GPU들은 계산과 Communication을 계속 반복합니다.

예를 들어 Distributed Training에서는 GPU가 일정 부분을 계산한 뒤 다른 GPU와 Gradient를 교환합니다. MoE(Mixture of Experts)에서는 특정 Token을 담당하는 다른 Expert GPU로 Data를 보내야 하기 때문에 All-to-All Traffic도 크게 증가할 수 있습니다.

Network가 느리면 GPU는 다음 계산을 시작하지 못하고 기다립니다.

이때 중요한 것은 하나입니다.

GPU가 계산하지 않고 Network Data를 기다리는 시간에도 GPU 가격과 전력비는 계속 발생한다는 것입니다.

수만 개 GPU가 설치된 AI Cluster에서는 Network 때문에 GPU Utilization이 몇 % 떨어지는 것만으로도 막대한 비용차이가 발생할 수 있습니다.

그래서 NIC는 저렴한 주변장치가 아니라 GPU Utilization을 결정하는 핵심 Infrastructure Component가 됩니다.

AI NIC가 하는 첫 번째 일은 RDMA입니다

34번에서 RDMA를 살펴봤습니다.

RDMA: CPU가 Network Packet마다 직접 개입하고 Memory를 반복적으로 복사하는 과정을 줄이고, NIC가 한 System의 Memory와 다른 System의 Memory 사이 Data Movement를 Hardware로 처리하는 기술입니다.

AI NIC에는 RDMA Engine이 들어갑니다.

Application은 NIC에 “이 Memory의 Data를 저쪽 Memory로 보내라”는 작업을 맡기고, NIC가 DMA Engine과 Network Transport Hardware를 이용해 실제 Data Movement를 처리합니다.

이 과정에서 CPU가 Data를 계속 복사할 필요가 줄어듭니다.

AI Cluster에서는 여기서 한 단계 더 나아갑니다.

Host Memory조차 거치지 않으려 합니다

GPU A에서 생성된 Data를 다른 Server의 GPU B로 보내는 상황을 생각해보겠습니다.

중간에 CPU Memory를 사용하면 GPU Memory의 Data를 Host DRAM으로 복사하고, NIC가 Host DRAM에서 Data를 읽어 Network로 보낸 뒤 상대편에서도 다시 Host DRAM을 거쳐 GPU Memory에 전달하는 방식이 될 수 있습니다.

이렇게 되면 불필요한 Data Movement가 증가합니다.

그래서 AI에서는 NIC가 GPU Memory와 보다 직접적으로 Data를 주고받는 방식이 중요합니다.

NVIDIA의 대표적인 기술이 GPUDirect RDMA입니다.

GPUDirect RDMA: NVIDIA GPU Memory와 Network Adapter 같은 PCIe Device가 Host Memory를 중간 Buffer로 사용하는 과정을 줄이고 직접 Data를 주고받을 수 있게 하는 기술입니다.

결국 AI NIC의 Data Path는 점점 GPU Memory와 Network를 직접 연결하는 방향으로 발전하고 있습니다.

NIC가 CPU보다 GPU에 가까워지는 것입니다

예전 NIC를 생각하면 NIC는 CPU의 Peripheral Device였습니다.

CPU가 Application을 실행하고 NIC가 CPU가 요청한 Network 작업을 처리했습니다.

AI Server에서는 구조가 달라지고 있습니다.

Network Traffic의 핵심 Source와 Destination이 CPU Memory가 아니라 GPU Memory가 되는 경우가 많아졌기 때문입니다.

그래서 AI NIC 설계에서는 NIC와 GPU 사이의 Bandwidth가 매우 중요합니다.

Network Port가 800Gbps인데 NIC와 GPU 사이 Host Interface가 충분히 빠르지 않다면 새로운 병목이 생깁니다.

즉 AI NIC에는 두 가지 속도가 모두 중요합니다.

Network 쪽 Bandwidth와 GPU·Host 쪽 I/O Bandwidth입니다.

그래서 PCIe 6.0이 AI NIC와 같이 등장합니다

28번에서 PCIe 6.0을 살펴봤습니다.

PCIe 6.0은 Lane당 64GT/s PAM4를 사용합니다.

AI NIC의 Network Bandwidth가 400G에서 800G로 올라가면서 Host Interface도 PCIe 5에서 PCIe 6로 전환되고 있습니다.

Broadcom의 Thor Ultra 800G AI NIC는 PCIe Gen6 x16 Host Interface를 사용합니다.

NVIDIA ConnectX-8 SuperNIC도 PCIe Gen6 x16 Interface를 지원합니다. NVIDIA의 2026년 ConnectX-8 Hardware Documentation에는 PCIe Gen6 64GT/s x16 Host Interface가 명시돼 있습니다.

즉 800G Network 시대에는 NIC만 빨라지는 것이 아니라 PCIe Host Connectivity도 함께 Generation Upgrade가 필요합니다.

PCIe가 병목이면 800G NIC도 의미가 줄어듭니다

NIC를 하나의 물류센터라고 생각해보겠습니다.

Network 쪽 고속도로는 8차선입니다.

그런데 GPU와 NIC 사이 도로는 2차선이라면 Network가 아무리 빨라도 GPU Data를 충분히 공급하지 못합니다.

그래서 AI NIC Architecture에서는 Network Port Speed뿐 아니라 GPU와 NIC를 연결하는 PCIe Lane, PCIe Switch, GPU I/O Topology까지 함께 설계해야 합니다.

이 부분에서 NVIDIA와 AMD는 점점 더 적극적으로 GPU와 NIC를 하나의 System Architecture로 묶으려 하고 있습니다.

NVIDIA는 왜 NIC를 SuperNIC이라고 부를까요?

NVIDIA는 AI Networking 제품에서 SuperNIC이라는 용어를 사용합니다.

SuperNIC: NVIDIA가 대규모 AI Cluster의 East-West Traffic을 가속하기 위해 Network Acceleration, RDMA, Congestion Control, GPU Connectivity 등을 강화한 AI Network Adapter Category입니다.

현재 대표적인 제품이 ConnectX-8 SuperNIC입니다.

NVIDIA는 ConnectX-8을 최대 800Gb/s Total Network Bandwidth를 제공하는 SuperNIC으로 설명하고 있습니다.

다만 Ethernet과 InfiniBand Configuration은 구분해서 봐야 합니다.

ConnectX-8 C8180의 경우 기본 Configuration에서는 800Gb/s XDR InfiniBand를 지원하며, Ethernet으로 구성하면 2개의 400GbE Port로 사용할 수 있습니다.

즉 “ConnectX-8 = 단일 800GbE Ethernet Port”라고 단순하게 표현하면 정확하지 않습니다.

NVIDIA ConnectX-8에서 PCIe Switch 기능도 중요합니다

ConnectX-8의 흥미로운 특징은 Network Interface 기능만 있는 것이 아니라 일부 System Architecture에서 PCIe Switching 기능까지 결합할 수 있다는 점입니다.

NVIDIA는 ConnectX-8을 이용해 기존 Server Architecture에서 필요했던 별도의 PCIe Switch 수를 줄이고 GPU와 NIC 사이 Connectivity를 단순화하는 구조를 제시하고 있습니다.

NVIDIA의 RTX PRO Server Architecture 사례에서는 기존 4개의 ConnectX-7 NIC와 별도 PCIe Switch를 사용하던 구조를 ConnectX-8 기반으로 변경해 PCIe Gen6 Switching과 Network Connectivity를 하나의 Device에 결합하고, GPU당 Network Bandwidth를 높이는 구조를 설명합니다. 회사의 특정 구성에서는 NCCL All-to-All Performance가 최대 2배 개선됐다고 제시합니다. 이는 NVIDIA의 특정 Platform 비교 결과입니다.

즉 AI NIC는 Network Card와 PCIe Fabric의 경계까지 확장되고 있습니다.

이것이 중요한 이유는 Component 수를 줄일 수 있기 때문입니다

AI Server 안에는 이미 GPU, CPU, HBM, NIC, PCIe Switch, Retimer와 많은 Power·Cooling Component가 들어갑니다.

Component가 하나 늘어날 때마다 비용만 증가하는 것이 아닙니다.

Power Consumption이 증가하고, PCB Layout이 복잡해지며, Signal Integrity와 Cooling 문제도 커집니다.

NIC가 PCIe Switching 기능 일부까지 통합할 수 있다면 System Architecture를 단순화할 가능성이 있습니다.

즉 AI NIC의 경쟁은

NIC Chip의 성능

뿐 아니라

Server 전체 BOM과 Architecture를 얼마나 단순화할 수 있는가

까지 확대되고 있습니다.

AMD Pollara 400은 조금 다른 방향에서 시작했습니다

AMD는 Pensando 인수를 통해 Networking Technology를 확보했습니다.

현재 대표적인 AI NIC가 Pensando Pollara 400입니다.

Pollara 400: 최대 400Gbps Ethernet을 지원하며 RoCEv2와 UEC-ready RDMA, Programmable P4 Networking Engine을 결합한 AMD의 AI Scale-out NIC입니다.

Pollara가 특히 흥미로운 이유는 Programmability입니다.

AI Network Transport가 계속 변하고 있기 때문입니다.

RoCEv2가 있고, MRC가 등장하며, Ultra Ethernet의 UET도 발전하고 있습니다.

NIC Hardware에 하나의 Transport Logic을 완전히 고정하면 새로운 Network Standard가 등장할 때 Hardware를 다시 교체해야 할 수 있습니다.

AMD는 Pollara의 3세대 Programmable P4 Engine을 이용해 새로운 Transport와 Congestion Control 기능을 Software로 업데이트할 수 있다는 점을 강조합니다.

AI NIC에서 Programmability가 중요한 이유

일반 Network Traffic은 비교적 오랜 기간 Protocol 변화가 느렸습니다.

AI는 다릅니다.

Model Architecture가 변하면 Traffic Pattern도 바뀝니다.

Dense Model과 MoE Model의 Communication Pattern이 다르고, Training과 Distributed Inference의 Network 요구도 다릅니다.

오늘 가장 좋은 Congestion Control Algorithm이 2년 뒤에도 가장 좋다는 보장이 없습니다.

그래서 미래 AI NIC에서는

고정된 Hardware 기능

보다

새로운 Transport Algorithm을 빠르게 적용할 수 있는 Hardware

가 더 중요해질 수 있습니다.

이것이 AMD가 Pensando의 Programmable Networking을 AI Infrastructure 전략의 핵심으로 가져가는 이유입니다.

Pollara 400은 RoCEv2와 Ultra Ethernet을 모두 지원합니다

35번과 36번에서 RoCEv2와 Ultra Ethernet을 살펴봤습니다.

흥미로운 점은 이 두 기술이 현재 완전히 별개의 Hardware를 요구하지 않는다는 것입니다.

AMD Pollara 400은 기존 RoCEv2를 지원하면서 UEC-ready RDMA 기능도 제공합니다. AMD는 Software Configuration을 통해 UEC 기능을 계속 적용할 수 있다는 점을 강조합니다.

즉 고객은 기존 RoCE Environment에서 출발해 향후 Ultra Ethernet 기능으로 이동할 수 있습니다.

이 구조는 Data Center 고객에게 꽤 중요합니다.

새로운 Network Standard가 나올 때마다 NIC 수만 장을 모두 교체하는 것은 현실적으로 부담이 크기 때문입니다.

AMD의 다음 세대는 Vulcano 800입니다

2026년 AMD AI Networking에서 가장 주목할 제품 중 하나가 Pensando Vulcano 800 AI NIC입니다.

Vulcano 800: 최대 800Gbps Ethernet Connectivity를 제공하는 AMD의 차세대 Programmable AI NIC입니다.

AMD는 Vulcano를 Helios Rack-scale Platform의 Scale-out Networking 핵심 Component로 사용하고 있습니다.

여기서 상당히 흥미로운 숫자가 하나 등장합니다.

GPU당 최대 2.4Tbps Scale-out Bandwidth입니다.

NIC 한 개가 2.4Tbps라는 뜻은 아닙니다.

Vulcano NIC 한 개는 최대 800Gbps이며 AMD가 제시한 특정 MI455X Architecture에서는 GPU 하나에 최대 3개의 Vulcano 800 NIC를 연결해 총 2.4Tbps를 구성하는 방식입니다.

이 구분은 중요합니다.

왜 GPU 하나에 NIC를 세 개나 붙이려고 할까요?

GPU Compute 성능이 올라갈수록 Network Data도 더 많이 움직여야 하기 때문입니다.

특히 대형 MoE Model에서는 All-to-All Communication 비중이 커질 수 있습니다.

GPU가 매우 빠르게 계산을 마쳤는데 800G Network 하나 때문에 다음 단계로 넘어가지 못한다면 Network가 새로운 병목이 됩니다.

그러면 해결방법은 두 가지입니다.

NIC 하나의 Speed를 더 높이거나, 여러 NIC를 동시에 사용해 GPU당 Scale-out Bandwidth를 높일 수 있습니다.

AMD는 Vulcano 800에서 후자의 Architecture까지 적극적으로 사용합니다.

GPU 성능이 올라갈수록 NIC Attach와 Network Bandwidth per GPU도 함께 증가할 수 있다는 것입니다.

이것은 AI NIC 시장의 경제성을 볼 때 매우 중요한 변화입니다.

AMD는 GPU와 NIC 연결에도 UALink를 활용합니다

AMD의 2026년 MI400 Series Scale-out Topology에서는 GPU와 Vulcano 800 AI NIC 사이를 UALink를 이용해 연결하는 구조가 등장합니다.

AMD Documentation에 따르면 MI455X GPU의 OXRP(Open xGMI Root Port)를 통해 UALink로 AI NIC를 연결하면서 Operating System에는 일반 PCIe Device처럼 보이도록 구성할 수 있습니다. AMD는 이 구조가 CPU, GPU, AI NIC 사이의 Bottleneck을 줄이고 추가 NIC를 GPU에 연결할 수 있게 한다고 설명합니다.

이것은 꽤 중요한 Architecture 변화입니다.

UALink를 단순히 GPU-to-GPU Scale-up Network로만 볼 수 없기 때문입니다.

GPU와 NIC 사이의 I/O Architecture에도 활용되고 있습니다.

결국 Scale-up과 Scale-out의 경계가 연결되기 시작합니다

기존에는 비교적 구분이 명확했습니다.

Scale-up Network는 Rack 내부 GPU끼리 연결하고, Scale-out Network는 Rack이나 Server 밖의 GPU Cluster를 Ethernet 또는 InfiniBand로 연결합니다.

그런데 GPU와 Scale-out NIC를 연결하는 Host Interface에도 UALink 같은 High-speed Fabric이 활용되기 시작하면 두 영역이 Architecture 차원에서 점점 더 밀접해집니다.

즉 AI Rack 전체를 보면

GPU 내부 HBM, GPU-to-GPU Scale-up Fabric, GPU-to-NIC I/O, AI NIC, Ethernet Scale-out Fabric이 서로 독립적인 Layer가 아니라 하나의 Data Movement Pipeline으로 연결됩니다.

Broadcom Thor Ultra는 800G Open Ethernet을 겨냥합니다

Broadcom 역시 AI NIC 시장에 본격적으로 들어왔습니다.

대표제품이 Thor Ultra입니다.

Thor Ultra: 800Gbps Ethernet, PCIe Gen6 x16, Ultra Ethernet Consortium 기능과 Advanced RoCE를 지원하도록 설계된 Broadcom의 AI Scale-out NIC입니다.

Broadcom은 2025년 10월 Thor Ultra를 발표하면서 이를 UEC Specification을 지원하는 800G AI Ethernet NIC로 소개했습니다.

특히 Packet-level Multipathing, Out-of-order Data Placement, Hardware Selective Retransmission과 Programmable Congestion Control 같은 기능을 강조했습니다.

즉 앞에서 UET를 설명할 때 등장했던 기능들이 실제 NIC Silicon 안에 들어오기 시작한 것입니다.

AI NIC 경쟁은 결국 Traffic Management 경쟁입니다

400G인지 800G인지도 중요합니다.

하지만 모든 업체가 동일한 800G PHY를 사용할 수 있다고 생각해보겠습니다.

그러면 차이는 어디에서 발생할까요?

Network에 Congestion이 발생했을 때 얼마나 빨리 대응하는지, 여러 Path에 Traffic을 얼마나 효율적으로 분산하는지, Packet이 순서와 다르게 도착해도 얼마나 빠르게 처리하는지, Packet Loss가 발생했을 때 필요한 Data만 얼마나 빠르게 다시 보내는지가 차이를 만듭니다.

즉 AI NIC에서 실제 차별화가 발생하는 곳은 점점

PHY Bandwidth보다 Transport Intelligence

쪽으로 이동합니다.

Multipathing이 AI NIC의 기본기능이 되는 이유

대형 AI Cluster에는 Source와 Destination 사이에 여러 Network Path가 존재합니다.

기존 ECMP 방식은 Flow Hash를 이용해 특정 Flow를 한 Path에 배정합니다.

문제는 매우 큰 AI Flow 몇 개가 우연히 같은 Path에 배정될 수 있다는 것입니다.

AI NIC는 이 문제를 해결하기 위해 Packet을 여러 Path로 분산시키는 기능을 강화합니다.

AMD Pollara는 Intelligent Packet Spray를 지원하고 Broadcom Thor Ultra도 Packet-level Multipathing을 지원합니다. NVIDIA Spectrum-X 역시 Switch의 Adaptive Routing과 SuperNIC의 Traffic Control을 결합합니다.

즉 Network Load Balancing을 Switch만 담당하는 것이 아니라 NIC도 적극적으로 Path 선택에 참여하기 시작합니다.

하지만 여러 Path를 사용하면 Packet 순서가 바뀝니다

Packet을 Path A, B, C에 분산시키면 도착 순서가 달라질 수 있습니다.

기존 RDMA Transport는 Packet Ordering에 민감한 경우가 있습니다.

그래서 차세대 AI NIC에는 Out-of-order Processing 기능이 중요합니다.

Out-of-order Processing: Packet이 전송된 순서와 다르게 도착하더라도 NIC가 각 Packet을 올바른 Memory 위치에 배치하고 Application에 필요한 Message 상태를 유지하는 기능입니다.

AMD Pollara와 Broadcom Thor Ultra 모두 이 기능을 AI Networking의 주요 차별화 요소로 제시합니다.

결국 Packet Ordering 문제를 NIC Hardware가 해결하면서 Network는 여러 Path를 더 자유롭게 활용할 수 있게 됩니다.

Selective Retransmission도 NIC가 직접 처리합니다

Network에서 Packet 일부가 손실될 수 있습니다.

과거처럼 손실된 Packet 이후의 많은 Data를 다시 전송하면 800G Network에서는 Bandwidth 낭비가 큽니다.

Selective Retransmission: 손실된 Packet 또는 필요한 Data 범위만 골라 다시 전송하는 Recovery 방식입니다.

Broadcom Thor Ultra는 Hardware Selective Retransmission을 지원하며 AMD Pollara 역시 Loss Recovery를 AI Transport 기능으로 제공합니다.

즉 AI NIC는 Packet을 보내는 것뿐 아니라 Network Error가 발생했을 때 Recovery까지 Hardware에서 처리하는 Device가 되고 있습니다.

Congestion Control도 NIC 내부 기능이 됩니다

35번에서 RoCEv2의 PFC, ECN, DCQCN을 살펴봤고 36번에서는 UET Congestion Control을 살펴봤습니다.

이 모든 Congestion Control에서 실제 Data 전송속도를 조절하는 주체 중 하나가 Sender NIC입니다.

Switch가 “Congestion이 발생했다”고 알려줘도 NIC가 계속 Wire Rate로 데이터를 보내면 문제는 해결되지 않습니다.

따라서 AI NIC에는 Network 상태를 보고

전송속도를 줄이고, Path를 바꾸고, 상황이 좋아지면 다시 속도를 높이는 Traffic Control Logic이 필요합니다.

AI NIC가 점점 Programmable해지는 가장 큰 이유 중 하나입니다.

Telemetry도 일반 NIC와 다른 핵심기능입니다

AI Cluster 수만 개 GPU 가운데 Training Job이 갑자기 느려졌다고 생각해보겠습니다.

원인이 GPU인지, NIC인지, Switch인지, Optical Link인지 찾기 쉽지 않습니다.

AI NIC는 Latency, Congestion, Drop, Retransmission, Link Health 같은 데이터를 실시간으로 수집합니다.

Telemetry: Network Device가 Traffic과 Hardware 상태를 지속적으로 측정해 Network 운영 Software가 장애와 Performance Bottleneck을 분석할 수 있도록 제공하는 기능입니다.

AMD는 Pollara와 Vulcano에서 Near-real-time Latency, Congestion, Drop Statistics와 Rapid Fault Detection을 주요 운영기능으로 강조하고 있습니다.

AI Cluster에서는 이 기능이 단순 Monitoring을 넘어 GPU Downtime을 줄이는 기술이 됩니다.

왜 Fault Detection이 GPU 경제성과 연결될까요?

GPU 수천 개가 하나의 Job을 수행한다고 생각해보겠습니다.

특정 NIC나 Optical Link 하나에 문제가 생겼습니다.

문제를 찾는 데 한 시간이 걸린다면 그동안 GPU 수천 개 일부가 정상적인 Performance를 내지 못할 수 있습니다.

따라서 Network 운영에서는

장애를 얼마나 빨리 감지하는가, 원인을 얼마나 빨리 찾는가, Traffic을 다른 Path로 얼마나 빨리 옮기는가

가 중요합니다.

NIC의 Telemetry와 Fast Failover가 중요한 이유입니다.

AI Networking에서는 성능뿐 아니라 RAS(Reliability, Availability, Serviceability)가 직접적인 비용문제가 됩니다.

일반 NIC와 DPU는 무엇이 다를까요?

AI NIC를 설명하면 자연스럽게 DPU(Data Processing Unit)와 헷갈릴 수 있습니다.

둘 다 Network Card처럼 보이고 Programmable Processor가 들어가기 때문입니다.

하지만 주력 역할은 다릅니다.

구분AI NIC / SuperNICDPU
핵심 목표GPU Scale-out Data MovementInfrastructure Service Offload
주요 TrafficGPU-to-GPUCloud·Security·Storage·Network
RDMA핵심지원 가능
Congestion Control매우 중요Network 기능 중 하나
GPU Collective 최적화핵심상대적으로 부차적
Security / Virtualization지원 가능핵심 영역
CPU Core 탑재제품에 따라 다름일반적으로 적극 활용
대표제품ConnectX-8, Pollara, Vulcano, Thor UltraBlueField, Pensando Salina 등

쉽게 말하면 AI NIC가 GPU를 위한 고속 Network Transport Processor라면 DPU는 CPU가 하던 Infrastructure 작업을 대신 처리하는 별도의 Infrastructure Processor에 가깝습니다.

둘의 기능영역이 일부 겹치지만 목적은 다릅니다.

NVIDIA도 SuperNIC과 DPU를 구분합니다

NVIDIA에는 ConnectX SuperNIC뿐 아니라 BlueField DPU가 있습니다.

SuperNIC은 AI Compute Fabric에서 Network Acceleration과 Performance Isolation을 강조하고, BlueField DPU는 Network, Storage, Security와 Data Center Infrastructure Service를 CPU에서 Offload하는 역할까지 확대합니다.

NVIDIA는 현재 BlueField-3 SuperNIC과 ConnectX-8 SuperNIC을 AI Network Accelerator로 제공하면서 BlueField DPU 제품군도 별도로 운영하고 있습니다.

즉 AI Server에서 NIC와 DPU가 항상 같은 위치를 차지하는 것은 아닙니다.

이 차이는 다음 AI Infrastructure Layer를 이해할 때 중요합니다.

Front-end NIC와 Back-end AI NIC도 다릅니다

Data Center에는 Network가 하나만 있는 것이 아닙니다.

Front-end Network: User Request, Storage, Management와 일반적인 Server Traffic을 처리하는 Network입니다.

Back-end Network: GPU와 Accelerator가 Training·Inference Communication을 위해 사용하는 고성능 Scale-out Network입니다.

AI NIC가 가장 중요해지는 곳은 Back-end Network입니다.

AMD Pollara 400 역시 AI Compute Node의 Back-end Scale-out NIC로 사용할 수 있으며 필요하면 Front-end Host NIC 역할도 수행할 수 있도록 설계돼 있습니다.

하지만 두 Network의 Traffic 요구는 다릅니다.

Front-end에서는 Security, Virtualization, General-purpose Network Service가 중요하고 Back-end에서는 낮은 Tail Latency, Collective Communication, RDMA와 GPU Utilization이 더 중요합니다.

그래서 AI Data Center Network가 점점 Front-end와 Back-end로 전문화되고 있습니다.

Scale-up NIC라는 표현은 조심해서 봐야 합니다

AI Networking을 볼 때 Scale-up과 Scale-out을 구분해야 합니다.

Scale-up: 같은 Rack 또는 System Domain 안의 Accelerator를 매우 높은 Bandwidth와 낮은 Latency로 연결하는 Network입니다. NVLink, UALink 등이 대표적입니다.

Scale-out: 여러 Server와 Rack의 Accelerator를 더 큰 Cluster로 연결하는 Network입니다. Ethernet, RoCE, UET, InfiniBand가 대표적입니다.

AI NIC의 핵심시장 역시 Scale-out입니다.

다만 앞에서 본 AMD Vulcano처럼 GPU와 NIC 사이를 UALink로 연결하는 Architecture가 등장하면서 Scale-up Technology가 Scale-out NIC의 Host Interface와 결합하는 사례도 나타나고 있습니다.

즉 두 Layer의 물리적인 경계는 점차 복잡해지고 있습니다.

AI NIC 수요를 GPU 출하량만으로 계산하면 안 됩니다

“GPU가 100만 개 팔리면 NIC도 100만 개 필요하지 않을까?”라고 단순하게 계산하기 쉽습니다.

실제 Architecture는 훨씬 다양합니다.

GPU 1개당 NIC 1개를 사용할 수도 있고, 여러 GPU가 NIC 하나를 공유할 수도 있습니다. 반대로 AMD의 특정 차세대 Architecture처럼 GPU 한 개에 여러 NIC를 연결할 수도 있습니다.

따라서 AI NIC 시장을 볼 때는 단순 GPU 숫자보다

GPU 수, GPU당 Scale-out Bandwidth, NIC Speed, GPU-to-NIC Ratio, Multi-plane Architecture

를 함께 봐야 합니다.

이 가운데 특히 중요한 지표가 Network Bandwidth per GPU입니다.

GPU당 Network Bandwidth가 계속 올라가고 있습니다

GPU Compute 성능과 HBM Bandwidth가 빨라지면서 Network도 따라가야 합니다.

400G NIC 시대에는 GPU 몇 개가 NIC를 공유하는 Architecture가 가능했습니다.

하지만 차세대 AI Rack에서는 GPU당 요구되는 Scale-out Bandwidth 자체가 계속 높아지고 있습니다.

AMD는 Vulcano 800을 여러 개 사용해 특정 MI455X Architecture에서 GPU당 최대 2.4Tbps Scale-out Bandwidth를 제시하고 있습니다.

NVIDIA 역시 ConnectX-8에서 최대 800Gb/s Total Network Bandwidth와 PCIe Gen6 Connectivity를 제공하며 AI Network Bandwidth를 확대하고 있습니다.

즉 AI NIC 시장의 성장동력은 단순히 더 많은 Server가 아닙니다.

GPU 한 개가 요구하는 Network Content 자체가 증가하고 있다는 것입니다.

400G에서 800G로 넘어가면 Value Chain 전체가 움직입니다

AI NIC가 400G에서 800G로 올라가면 NIC Chip 하나만 교체되는 것이 아닙니다.

Host 쪽에는 PCIe 6 같은 더 빠른 Interface가 필요하고, Network 쪽에는 800G Optical Module이나 Cable이 필요하며, Switch에는 더 높은 Port Bandwidth와 Switching Capacity가 필요합니다.

여기에 224G-class SerDes, Retimer, DSP와 Signal Integrity Validation도 따라옵니다.

800G AI NIC 전환은 AI Network 전체의 세대교체입니다.

이 때문에 AI NIC는 Tech Layers에서 이미 살펴본 PCIe 6, SerDes, Retimer, AEC, Optical Networking과 모두 연결됩니다.

800G 다음은 결국 1.6T입니다

현재 800G NIC가 차세대 AI Cluster의 중심으로 올라오고 있지만 Network Roadmap은 여기서 끝나지 않습니다.

Ethernet Switching은 이미 1.6T Port Generation을 향해 움직이고 있습니다.

GPU당 Network Bandwidth가 계속 증가한다면 AI NIC 역시 장기적으로 더 높은 Speed가 필요할 수 있습니다.

그러면 1.6T Optical Transceiver와 200G/lane Electrical Interface, CPO와 Optical I/O의 중요성도 함께 커집니다.

즉 AI NIC는 단순 Network Adapter 시장이 아니라 AI Optical Networking Upgrade Cycle을 촉발하는 Endpoint이기도 합니다.

NVIDIA가 AI NIC 시장에서 강한 이유

NVIDIA의 가장 큰 장점은 ConnectX Chip 하나만 잘 만드는 것이 아닙니다.

GPU, SuperNIC, Spectrum-X Ethernet Switch, Quantum InfiniBand, GPUDirect RDMA, NCCL Communication Library를 모두 가지고 있습니다.

AI Workload가 어떤 Collective Communication을 발생시키는지 GPU Software Stack에서 알고 있고, Network Endpoint와 Switch Fabric까지 함께 최적화할 수 있습니다.

즉 NVIDIA는 GPU Compute와 Network Data Path를 하나의 System으로 설계할 수 있습니다.

Spectrum-X에서 SuperNIC과 Switch를 하나의 Platform으로 묶는 이유도 여기에 있습니다.

Vertical Integration이 AI Network에서 중요한 경쟁력이 되는 것입니다.

하지만 Vertical Integration에는 반대쪽 시장도 존재합니다

모든 Hyperscaler가 GPU부터 NIC와 Switch까지 하나의 Vendor에서 구매하고 싶어 하는 것은 아닙니다.

Multi-vendor Environment를 선호하는 고객도 있습니다.

바로 여기에서 AMD, Broadcom, Arista와 Ultra Ethernet Ecosystem이 기회를 얻습니다.

AMD Pollara와 Vulcano는 Open Ethernet과 UEC를 강조하고, Broadcom Thor Ultra 역시 UEC Specification을 기반으로 합니다.

즉 AI NIC 시장에는 두 가지 경쟁축이 있습니다.

NVIDIA처럼 GPU와 Network를 통합해 최적화하는 방식Open Ethernet Standard를 이용해 여러 Vendor가 조합되는 방식입니다.

어느 쪽이 더 높은 Performance와 낮은 TCO를 제공하는지가 중요한 경쟁포인트가 됩니다.

Broadcom은 왜 AI NIC에서 주목할 필요가 있을까요?

Broadcom의 장점은 NIC 하나만 파는 회사가 아니라는 것입니다.

Host Endpoint에는 Thor Ultra를 공급할 수 있고, Fabric에는 Tomahawk·Jericho 계열 Switch Silicon을 공급합니다.

그다음 Physical Link에는 SerDes와 Optical DSP, CPO Technology도 보유하고 있습니다.

즉 Open Ethernet AI Cluster가 성장하면 Broadcom은 NIC부터 Switch와 Optics까지 여러 Layer에서 Content를 확보할 수 있습니다.

이것이 Broadcom의 AI Networking Position을 볼 때 중요한 부분입니다.

단순히 “Thor Ultra NIC가 몇 개 팔리는가”보다 AI Ethernet Rack 하나에서 Broadcom Silicon이 얼마나 많이 들어갈 수 있는가를 보는 것이 더 중요합니다.

AMD의 AI NIC 전략도 GPU 판매량과 연결해서 봐야 합니다

AMD는 현재 NVIDIA보다 AI GPU 시장점유율이 작습니다.

하지만 Instinct Platform이 확대될수록 Pensando Networking을 함께 공급할 수 있다면 GPU System당 Content가 늘어날 수 있습니다.

AMD는 Helios Rack-scale Solution에 Instinct GPU, EPYC CPU와 Pensando Networking을 결합하고 있습니다.

즉 Pensando의 의미는 독립적인 NIC Revenue뿐 아니라

AMD가 GPU Vendor에서 Full AI Infrastructure Platform Vendor로 이동할 수 있는가

와 연결됩니다.

Vulcano 800이 특히 중요한 이유입니다.

그렇다고 현재 AMD Data Center 성장을 NIC 때문이라고 보면 안 됩니다

이 부분은 투자 관점에서 구분해야 합니다.

현재 AMD Data Center 사업의 주요 Revenue Driver는 EPYC CPU와 Instinct GPU입니다.

Pensando AI NIC는 전략적으로 중요하지만 AMD 전체 Data Center 매출에서 독립적으로 얼마나 큰 비중을 차지하는지는 별도로 공개되지 않습니다.

따라서

AMD AI Revenue 성장 = Pollara·Vulcano 성장

으로 연결하면 안 됩니다.

AI NIC는 현재 AMD에게 미래 Rack-level Content를 확대할 수 있는 전략적 Layer로 보는 편이 더 적절합니다.

NVIDIA도 Networking 매출을 NIC 하나로 보면 안 됩니다

NVIDIA Networking 사업에는 InfiniBand, Ethernet Switch, SuperNIC, DPU와 여러 제품이 포함됩니다.

ConnectX 자체는 중요한 제품이지만 NVIDIA AI Networking Growth를 단순 SuperNIC 판매량 하나로 설명하기는 어렵습니다.

투자자가 봐야 할 것은 더 큰 구조입니다.

GPU Cluster가 커질수록 GPU당 Network Bandwidth와 Network Content가 증가하고 있는가, NVIDIA가 그 증가분을 Spectrum-X·InfiniBand·SuperNIC으로 얼마나 내부화하고 있는가를 보는 것이 중요합니다.

AI NIC가 만드는 새로운 Semiconductor Content

일반 NIC보다 AI NIC가 복잡해지면 Chip 안에 필요한 Logic도 증가합니다.

High-speed SerDes, PCIe Controller, RDMA Engine, DMA Engine, Packet Scheduler, Congestion Control, Telemetry, Security, Programmable Packet Processing이 필요합니다.

즉 단순 PHY Chip에서 복잡한 High-performance Networking Processor로 발전합니다.

여기에 800G Network와 PCIe 6를 동시에 처리해야 하므로 Process Node와 Packaging, Power Management도 중요해집니다.

AI NIC가 Networking Semiconductor ASP를 높일 수 있는 구조적 이유입니다.

Power도 점점 중요한 문제가 됩니다

AI NIC 기능이 많아지고 Bandwidth가 증가하면 Power Consumption도 커집니다.

800G SerDes를 동작시키고, PCIe 6 Interface를 처리하고, Packet Processing과 Congestion Control을 수행해야 합니다.

GPU Server 안에는 이미 GPU 자체가 엄청난 전력을 소비합니다.

NIC 수까지 GPU당 증가한다면 Networking Power도 무시할 수 없습니다.

따라서 앞으로 AI NIC에서는 Gbps당 Power, GPU당 Network Power가 중요한 경쟁지표가 될 가능성이 높습니다.

Network를 빨리 만드는 것뿐 아니라 GPU가 얻는 Performance Improvement 대비 얼마나 적은 전력을 사용하는지가 중요합니다.

Cable과 Cooling도 NIC Architecture에 영향을 줍니다

GPU 하나에 NIC를 여러 개 연결하면 Network Cable 수도 증가합니다.

800G Cable 여러 개가 한 Rack에서 나오면 Cable Density와 Airflow 문제가 생깁니다.

Copper Cable은 굵고 무거울 수 있고 Optical Module은 Power와 Heat를 발생시킵니다.

즉 AI NIC Bandwidth 증가가

NIC → Cable → Optics → Cooling

문제로 이어집니다.

이것이 AI Networking이 결국 CPO와 Optical I/O까지 연결되는 이유입니다.

Network Endpoint의 Bandwidth 증가가 Data Center의 Physical Architecture까지 영향을 미치기 시작합니다.

AI NIC가 많아질수록 Switch도 커져야 합니다

GPU에 연결된 NIC가 증가하면 Network Port 수도 증가합니다.

각 NIC가 800G Traffic을 발생시키면 Switch의 Total Switching Capacity도 함께 커져야 합니다.

그래서 Broadcom Tomahawk 6 같은 102.4Tbps Switch Silicon이 등장하고 있습니다.

즉 AI NIC 수요와 Switch ASIC 수요는 따로 움직이는 시장이 아닙니다.

NIC가 만들어낸 Traffic을 Switch가 받아야 하고, Switch에서 다시 Optical Link를 통해 다른 NIC로 보내야 합니다.

AI NIC가 Endpoint라면 Switch ASIC은 Fabric Core입니다.

둘은 하나의 시장구조로 봐야 합니다.

AI NIC와 Optics도 직접 연결됩니다

AI NIC의 Network Port에는 실제 Cable이 연결됩니다.

짧은 거리에서는 Passive Copper나 AEC를 사용할 수 있지만 Rack 간 거리가 늘어나면 Optical Link가 필요합니다.

400G NIC가 800G NIC로 교체되면 Optical Module 역시 400G에서 800G로 올라갑니다.

장기적으로 1.6T NIC가 등장한다면 1.6T Optical Module과 Silicon Photonics, LPO, CPO 같은 기술이 다시 연결됩니다.

즉 AI NIC의 Bandwidth Roadmap은 Optical Transceiver 시장의 Demand Driver 중 하나입니다.

AI NIC Value Chain을 보면 구조가 더 분명합니다

Layer역할대표 기업 예시
GPU / XPUAI ComputeNVIDIA, AMD 등
AI NIC / SuperNICGPU Scale-out Data TransportNVIDIA, AMD, Broadcom
PCIe / Host I/OGPU와 NIC 연결GPU·NIC 업체, Connectivity 업체
Switch ASICAI Traffic SwitchingNVIDIA, Broadcom 등
Retimer / AECElectrical Reach 확장Credo, Astera Labs, Marvell 등
OpticalRack 간 고속 LinkOptical Ecosystem
Network SoftwareRDMA·Collective·Traffic ManagementNVIDIA, AMD 등
Test / Validation400G·800G·PCIe 6 검증Test 업체

이 표에서 중요한 것은 NIC가 혼자 존재하지 않는다는 것입니다.

AI NIC 한 개가 늘어나면 Host-side PCIe Bandwidth가 필요하고 Network Port가 하나 더 필요하며, Switch Capacity와 Optical Connectivity도 함께 필요해집니다.

따라서 AI NIC는 AI Networking Value Chain의 출발점 중 하나라고 볼 수 있습니다.

투자 관점에서 가장 먼저 볼 것은 800G 전환입니다

현재 AI NIC 시장의 가장 명확한 Generation Change는 400G에서 800G로의 이동입니다.

NVIDIA ConnectX-8은 최대 800Gb/s Total Network Bandwidth와 PCIe Gen6를 지원하고, Broadcom Thor Ultra는 800G Ethernet과 PCIe Gen6 x16을 결합합니다. AMD는 Vulcano 800으로 800G Generation을 준비하고 있습니다.

이 전환은 NIC 교체만 의미하지 않습니다.

PCIe 6, 800G Optics, 102.4T Switch, 224G-class SerDes가 함께 움직입니다.

800G AI NIC Volume Ramp 자체가 여러 Semiconductor Layer의 수요 신호가 될 수 있습니다.

두 번째는 GPU당 NIC 수를 봐야 합니다

NIC 한 개의 Speed보다 더 중요한 숫자가 될 수 있습니다.

GPU가 빨라지면서 NIC 하나로 충분한지, 여러 GPU가 NIC 하나를 공유하는지, GPU 하나에 NIC 여러 개가 필요한지가 AI Networking TAM에 큰 영향을 줍니다.

AMD의 Vulcano Architecture가 GPU당 최대 3개의 800G NIC를 사용해 2.4Tbps를 구성할 수 있다는 것은 이 변화의 극단적인 사례입니다.

모든 AI System이 이런 구성을 사용하는 것은 아닙니다.

하지만 방향은 분명합니다.

GPU당 Scale-out Network Content가 올라갈 가능성입니다.

세 번째는 UEC와 MRC 같은 Transport Adoption입니다

AI NIC가 Programmable해지는 이유는 Network Transport가 아직 빠르게 진화하고 있기 때문입니다.

RoCEv2가 계속 사용되고 있고 MRC가 등장했으며 UET도 상용 Hardware에 들어오기 시작했습니다.

AMD는 Pollara와 Vulcano에서 MRC를 구현하고 있으며 Pollara가 OpenAI와 공동 Validation됐다고 2026년 밝혔습니다. Vulcano는 MI400 Series Cluster를 대상으로 Qualification 중입니다.

즉 앞으로 AI NIC의 경쟁력은 새로운 Transport Standard가 나왔을 때 얼마나 빨리 실제 Production Hardware에서 사용할 수 있느냐와 연결될 수 있습니다.

네 번째는 NIC와 Switch Co-design입니다

NVIDIA는 이 부분에서 강점이 있습니다.

Spectrum-X Switch와 ConnectX SuperNIC을 함께 설계할 수 있기 때문입니다.

반면 Open Ethernet 진영에서는 Broadcom Switch와 AMD NIC, Arista System 같은 Multi-vendor Combination을 구성할 수 있습니다.

결국 중요한 경쟁은

한 Vendor가 End-to-end로 최적화한 Fabric

Open Standard 기반 Multi-vendor Fabric

사이에 형성될 가능성이 높습니다.

성능뿐 아니라 TCO, 공급망, 운영편의성까지 함께 비교해야 합니다.

다섯 번째는 Programmability입니다

AI Network Algorithm의 변화속도가 빨라질수록 Programmable NIC의 가치가 커질 수 있습니다.

AMD는 Pensando P4 Engine을 이용해 UEC와 MRC 같은 새로운 Transport 기능을 Software로 적용할 수 있다는 점을 강하게 강조합니다.

Broadcom 역시 Thor Ultra에서 Programmable Congestion Control을 지원합니다.

즉 Network Transport가 ASIC에 완전히 고정된 기능에서 Software-updatable Hardware Function으로 바뀌고 있습니다.

이 흐름은 AI Network가 Model Architecture 변화에 더 빠르게 대응할 수 있게 합니다.

여섯 번째는 NIC Power와 Cost입니다

GPU당 NIC 수가 증가할수록 Network Power와 BOM도 증가합니다.

800G NIC 세 개를 GPU 하나에 붙이는 Architecture가 등장한다면 Bandwidth는 커지지만 NIC Silicon, Optical Port, Switch Port도 추가로 필요합니다.

따라서 무조건 Network Bandwidth를 높이는 것이 답은 아닙니다.

핵심은

추가 Networking Cost와 Power보다 GPU Utilization 개선으로 얻는 경제적 가치가 더 큰가

입니다.

AI NIC 업체들이 Job Completion Time과 Cluster Uptime 같은 System-level Metric을 강조하는 이유입니다.

AMD는 Vulcano 800에 대해 특정 Modeling Environment에서 최대 13% 빠른 AI Job Completion Time을 제시하고 있습니다. 이는 8,000개 MI455X GPU를 가정한 AMD의 Simulation Result이므로 실제 모든 System에 일반화해서는 안 됩니다.

일곱 번째는 AI NIC가 어디까지 역할을 가져가는지입니다

현재 AI NIC의 중심은 Scale-out Networking입니다.

하지만 일부 제품은 PCIe Switching, Security, Storage Offload, Front-end Networking 기능까지 가져가고 있습니다.

기능이 더 커지면 AI NIC와 SmartNIC, DPU의 경계가 흐려질 수 있습니다.

반대로 Scale-out Performance에 집중하기 위해 Infrastructure Service는 별도의 DPU가 맡는 Architecture도 가능합니다.

즉 앞으로는 “NIC가 몇 Gbps인가”만 볼 것이 아니라

NIC가 어떤 기능까지 통합하는가, DPU와 역할을 어떻게 나누는가, GPU와 얼마나 직접 연결되는가

를 함께 봐야 합니다.

핵심 정리

질문
AI NIC란?GPU Cluster의 Scale-out Data Movement를 RDMA·Multipathing·Congestion Control 등으로 가속하는 NIC입니다
일반 NIC와 다른 점은?GPU Collective Traffic과 낮은 Tail Latency를 위해 훨씬 많은 Transport 기능을 Hardware로 처리합니다
왜 중요한가?Network가 느리면 비싼 GPU가 Data를 기다리며 Idle 상태가 되기 때문입니다
RDMA가 왜 필요한가?CPU 개입과 Memory Copy를 줄여 Data Movement를 NIC Hardware가 처리할 수 있기 때문입니다
GPU Memory와 직접 통신할 수 있나?GPUDirect RDMA 같은 기술을 이용하면 가능합니다
왜 PCIe 6가 필요한가?800G NIC의 Network Bandwidth를 GPU·Host 쪽에서도 충분히 처리해야 하기 때문입니다
대표 제품은?NVIDIA ConnectX-8, AMD Pollara 400·Vulcano 800, Broadcom Thor Ultra 등이 있습니다
SuperNIC과 DPU는 같은가?아닙니다. SuperNIC은 AI Network Transport에, DPU는 Infrastructure Service Offload에 더 집중합니다
투자포인트는?800G 전환, GPU당 NIC 수, Network Bandwidth per GPU, UEC·MRC Adoption, Optics·Switch Content 증가입니다

AI NIC의 변화는 AI Infrastructure에서 상당히 중요한 신호입니다.

과거에는 GPU가 주인공이고 NIC는 주변부품에 가까웠습니다.

하지만 AI Cluster가 커질수록 GPU 자체의 연산성능만으로는 전체 System 성능을 설명하기 어려워지고 있습니다.

GPU가 계산을 끝냈는데 다른 GPU의 Data를 기다린다면 GPU의 FLOPS는 아무 의미가 없습니다.

그래서 NIC가 맡는 역할이 계속 늘어납니다.

RDMA를 처리하고, GPU Memory와 직접 데이터를 주고받으며, 여러 Network Path를 활용하고, Congestion을 감지하고, Packet Loss를 복구하며, Network 상태를 실시간으로 측정합니다.

그리고 Network Bandwidth가 400G에서 800G로 올라가면서 Host Interface도 PCIe 6로 이동하고 있습니다.

AMD처럼 특정 Architecture에서는 GPU 하나에 여러 개의 800G NIC를 연결해 GPU당 수 Tbps Scale-out Bandwidth를 구성하려는 시도까지 등장했습니다.

이 변화의 산업적 의미는 명확합니다.

GPU 한 개가 빨라질수록 GPU 주변에 필요한 Networking Semiconductor Content도 커질 수 있습니다.

AI NIC가 하나 추가되면 NIC Silicon만 필요한 것이 아닙니다. 더 많은 PCIe Bandwidth, Switch Port, SerDes와 Optical Link가 함께 필요합니다.

즉 GPU 투자 확대가 NIC → Switch ASIC → SerDes → Optics로 전파됩니다.

그래서 AI NIC는 단순 Network Card가 아니라 AI Infrastructure의 경제성을 이해하기 위한 중요한 Layer입니다.

그리고 앞으로 AI Network 경쟁에서 봐야 할 질문도 달라집니다.

“어느 NIC가 가장 빠른가?”

보다 중요한 것은

“어느 Network Architecture가 GPU 한 개당 더 많은 Effective Bandwidth를 제공하면서 더 낮은 Power와 Cost로 GPU Utilization을 높일 수 있는가?”

입니다.

바로 이 경쟁 때문에 NIC는 평범한 서버 부품에서 AI Factory의 핵심 Data Movement Semiconductor로 올라오고 있습니다.

curiouszip

curiouszip
Tech Layers를 운영하는 에디터입니다. AI 반도체, 데이터센터, 첨단 패키징, 네트워크 기술처럼 복잡하지만 산업의 방향을 결정짓는 기술들을 조사하고, 이를 누구나 이해할 수 있는 언어로 풀어 쓰는 작업을 하고 있습니다.
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.