본문 바로가기
Tech Layers | Under the chip Tech Layers | Under the chip
Complex tech, simply unpacked.

AI Switch ASIC이란? Broadcom·NVIDIA·Arista가 AI 네트워크에서 중요한 이유

curiouszip

AI Network를 구성할 때 GPU, NIC와 Optical Fiber만 있어서는 수천 개 Accelerator를 연결할 수 없습니다. 수백 개 Port에서 동시에 들어오는 Packet을 올바른 Destination으로 보내고, 여러 Path에 Traffic을 분산하며, Congestion이 생기면 우회하고, 장애가 발생하면 빠르게 다른 Link로 전환해야 합니다.

이 모든 작업을 초당 수십에서 수백 Terabit 규모로 처리하는 핵심 Semiconductor가 Switch ASIC입니다.

Switch ASIC: Network Switch 내부에서 Packet Parsing, Forwarding, Routing, Buffering, Scheduling, Congestion Control과 Telemetry를 Hardware로 처리하는 고성능 Network Processor입니다.

AI 시대에 Switch ASIC이 중요해진 이유는 단순 Port Speed가 빨라졌기 때문이 아닙니다. Network가 GPU Utilization을 결정하기 시작하면서 Switch가 Compute Efficiency의 일부가 됐기 때문입니다.

일반 Data Center Switch와 AI Switch의 차이는 무엇일까요?

구분일반 Data Center SwitchAI Backend Switch
주요 TrafficWeb, VM, Storage 등 다양한 FlowRDMA, Collective, 대형 동기화 Flow
핵심 목표범용 Throughput·ConnectivityGPU Job Completion Time·Fabric Utilization
Latency중요Tail Latency까지 매우 중요
RoutingECMP 중심Adaptive Routing·Packet-level Load Balancing 강화
Congestion범용 Queue·ECNRDMA·UEC·AI Traffic 특화
TelemetryNetwork 운영GPU Straggler·Job 성능과 직접 연결
Switch Radix일반 Port Density최대한 높은 Radix와 적은 Tier가 중요

AI Traffic은 일반 Cloud Traffic과 Pattern이 다릅니다. 적은 수의 매우 큰 Flow가 동시에 움직이고 GPU들이 Synchronization하기 때문에 한 Link의 Congestion이 전체 Job을 지연시킬 수 있습니다.

Switch ASIC은 실제로 어떤 일을 할까요?

Packet이 Switch Port로 들어오면 ASIC은 Header를 읽고 Destination을 찾습니다. Routing·Forwarding Table을 확인해 Egress Port를 결정하고 Queue에 넣은 뒤 Scheduler가 전송순서를 결정합니다.

여러 Flow가 같은 Port로 몰리면 Buffer를 관리하고 ECN Marking이나 Congestion Signaling을 할 수 있습니다. 특정 Path가 혼잡하면 Adaptive Routing으로 다른 Path를 선택하고 Link Failure를 감지하면 Traffic을 우회할 수 있습니다.

이 모든 동작이 Software CPU가 아니라 Hardware Pipeline에서 매우 짧은 시간에 처리됩니다. 그래야 100Tbps급 Total Traffic을 Wire Speed로 Forwarding할 수 있습니다.

왜 51.2T에서 102.4T로 올라가고 있을까요?

Endpoint Speed가 400G에서 800G·1.6T로 올라가면 Switch Total Bandwidth도 함께 커져야 합니다.

51.2Tbps Switch는 800G Port를 64개 수준으로 구성할 수 있습니다. 102.4Tbps로 두 배 올라가면 800G Port 128개 또는 1.6T Port 64개 수준의 Total Capacity를 구성할 수 있습니다. 실제 System Port Configuration은 ASIC Architecture와 Breakout 방식에 따라 달라질 수 있습니다.

Switch Bandwidth가 커지면 같은 GPU 수를 더 적은 Switch와 적은 Tier로 연결할 가능성이 생깁니다. AI Cluster에서 Tier 하나를 줄이면 Switch뿐 아니라 Inter-switch Optical Link 수도 줄어들 수 있어 Latency와 TCO에 큰 영향을 줍니다.

Broadcom Tomahawk 6가 중요한 이유

Broadcom Tomahawk 6는 102.4Tbps Ethernet Switching Capacity를 제공하며 100G와 200G SerDes를 지원합니다. Broadcom은 2026년 3월 Tomahawk 6가 Production Volume으로 출하되고 있다고 발표했습니다.

Broadcom은 Tomahawk 6를 AI Scale-out뿐 아니라 Scale-up에도 사용할 수 있도록 설계하며 최대 1M+ XPU Cluster를 겨냥한 Routing과 Congestion 기능을 강조합니다.

한 Chip에서 512개의 200G 또는 1,024개의 100G SerDes를 구성할 수 있는 High-radix Architecture는 Network Tier와 Optics 수를 줄이는 데 도움이 될 수 있습니다.

즉 Tomahawk 6의 의미는 “Switch가 두 배 빨라졌다”보다 AI Cluster Topology 자체를 더 단순하게 만들 수 있는 Radix와 Bandwidth가 나온 것에 있습니다.

High-radix가 왜 그렇게 중요할까요?

Radix: 하나의 Switch ASIC이 제공할 수 있는 독립적인 고속 Connection 수를 의미합니다.

GPU 10만 개를 연결한다고 생각해보겠습니다. Switch 한 개가 연결할 수 있는 Endpoint 수가 적으면 여러 Tier의 Switch를 거쳐야 합니다.

Tier가 늘어나면 Packet이 더 많은 ASIC을 통과하면서 Latency가 증가하고 Switch와 Optical Module, Cable 수도 늘어납니다. 또한 Routing과 Congestion Control이 복잡해집니다.

High-radix ASIC은 더 많은 Endpoint를 한 Stage에 연결하고 Fabric Stage 수를 줄일 수 있어 Port당 Silicon Cost보다 전체 Network TCO를 낮출 가능성이 있습니다.

Switch Unit가 줄어도 Semiconductor 시장이 작아지는 것은 아닙니다

102.4T Switch가 51.2T 두 개를 대체한다면 Switch Unit 수는 줄 수 있습니다. 하지만 102.4T ASIC은 더 큰 Die와 더 빠른 SerDes, 고급 Packaging을 사용하고 ASP도 높을 수 있습니다.

또 Port Speed가 400G에서 800G·1.6T로 올라가면 Optical Module과 DSP, Retimer의 ASP도 올라갈 수 있습니다.

따라서 AI Switch 시장을 볼 때 Unit Shipment만 보면 안 됩니다. Total Network Bandwidth와 Silicon Content per Port, Optics Content를 함께 봐야 합니다.

AI Traffic에서는 Congestion Control이 성능을 결정합니다

GPU 수천 개가 AllReduce를 수행하면 많은 Sender가 같은 Destination Port로 Data를 보낼 수 있습니다. Switch Buffer가 빠르게 차고 Queueing Delay가 발생합니다.

일반 TCP Traffic은 Packet Loss가 생기면 Window를 조정해 복구할 수 있지만 RDMA와 GPU Collective에서는 순간적인 Congestion이 Tail Latency와 GPU Idle Time으로 바로 이어질 수 있습니다.

그래서 최신 AI Switch ASIC에는 ECN, Packet Trimming, Congestion Signaling, Adaptive Routing과 Telemetry가 Hardware 기능으로 들어갑니다.

Broadcom Tomahawk 6의 Cognitive Routing 2.0도 고해상도 Telemetry와 Dynamic Congestion Control, Rapid Failure Detection을 강조합니다.

Packet Trimming이란 무엇인가요?

Packet Trimming: Congestion으로 Packet을 완전히 Drop하는 대신 Payload 일부를 제거하고 Header와 Congestion 정보를 Endpoint에 전달해 Loss를 더 빨리 감지하고 Recovery하도록 돕는 방식입니다.

Ultra Ethernet Transport에서 중요하게 다뤄지는 기능이며 Switch ASIC이 적극적으로 Congestion Control에 참여하는 사례입니다.

과거 Switch가 “Packet을 어느 Port로 보낼지”만 결정했다면 AI 시대에는 Endpoint NIC가 Network 상태를 이해할 수 있도록 Feedback을 제공하는 역할까지 맡습니다.

Adaptive Routing은 ECMP와 무엇이 다를까요?

ECMP(Equal-Cost Multi-Path): 여러 동일 Cost Path 가운데 Flow Hash를 이용해 하나의 Path를 선택하는 방식입니다.

ECMP는 일반 Traffic에서는 단순하고 효율적이지만 큰 AI Flow 몇 개가 우연히 같은 Path에 배정되면 특정 Link만 혼잡해질 수 있습니다.

Adaptive Routing: 실제 Queue와 Congestion 상태를 확인해 Packet이나 Flow를 현재 더 여유 있는 Path로 보내는 방식입니다.

AI Fabric에서는 Network 전체 Bandwidth를 고르게 사용하는 것이 중요하기 때문에 Adaptive Routing의 가치가 커집니다. 특히 Multi-plane Architecture와 Rail-optimized Topology에서 Switch가 실시간 상태를 반영할 수 있어야 합니다.

Buffer는 무조건 클수록 좋을까요?

큰 Buffer는 순간 Burst를 흡수할 수 있어 Packet Loss를 줄입니다. 하지만 Packet이 Buffer에 오래 머물면 Queueing Latency가 증가해 Bufferbloat가 생길 수 있습니다.

AI Backend Network는 낮은 Latency와 높은 Utilization을 동시에 원합니다. 따라서 단순 Buffer Capacity보다 Queue Architecture, Scheduling과 Congestion Response가 중요합니다.

Long-haul이나 Large-scale Routed Fabric에서는 Deep Buffer가 유리할 수 있고, 짧은 Scale-up에서는 매우 낮은 Latency가 더 중요할 수 있습니다. Broadcom이 Tomahawk와 Jericho, Tomahawk Ultra처럼 다른 Architecture를 운영하는 이유도 Use Case가 다르기 때문입니다.

NVIDIA는 Switch를 GPU와 함께 설계합니다

NVIDIA는 Quantum InfiniBand와 Spectrum-X Ethernet Network를 모두 보유합니다. Spectrum-X에서는 Spectrum Switch와 ConnectX SuperNIC을 함께 설계해 Adaptive Routing, Congestion Control과 Telemetry를 결합합니다.

NVIDIA의 차별점은 GPU와 NCCL Communication Software까지 갖고 있다는 것입니다. 어떤 Collective가 Network에 어떤 Traffic을 만드는지 Software Stack에서 알 수 있고, Endpoint NIC와 Switch Behavior를 함께 최적화할 수 있습니다.

즉 NVIDIA의 Switch 경쟁력은 단순 ASIC Throughput보다 GPU Workload에서 End-to-end Goodput을 높일 수 있는 Vertical Integration에 있습니다.

Broadcom의 강점은 Open Merchant Silicon입니다

Broadcom은 GPU를 직접 주력으로 판매하지 않습니다. 대신 여러 System Vendor와 Hyperscaler가 사용할 수 있는 Merchant Ethernet Silicon을 공급합니다.

Tomahawk·Jericho Switch, Thor AI NIC, Agera Retimer, Sian Optical DSP와 CPO까지 Portfolio가 연결됩니다.

Open Ethernet이 AI Backend에서 점유율을 높일수록 Broadcom은 특정 GPU Vendor에 종속되지 않고 NVIDIA GPU, AMD Instinct, Custom XPU 등 다양한 Accelerator Ecosystem에 Silicon을 공급할 수 있습니다.

따라서 Broadcom의 투자포인트는 Switch Chip 하나보다 Open AI Ethernet 전체의 Silicon Content를 얼마나 가져갈 수 있는가입니다.

Arista는 Switch ASIC 회사가 아닌데 왜 중요할까요?

Arista는 Broadcom처럼 Merchant Switch ASIC을 주력으로 설계해 판매하는 Semiconductor Company가 아닙니다. Broadcom 등 Merchant Silicon을 이용해 Switch System과 EOS Network Operating System을 제공합니다.

AI Network가 커질수록 Hardware만큼 Routing Software, Configuration Automation, Telemetry와 Troubleshooting이 중요합니다.

GPU 10만 개 Network에서 Link 하나가 불안정할 때 어떤 Job과 Path가 영향을 받는지 빠르게 찾을 수 있어야 합니다. Arista의 강점은 Open Ethernet Fabric을 실제 운영 가능한 System과 Software로 만드는 Layer에 있습니다.

따라서 “Broadcom·NVIDIA·Arista가 AI Switch에서 경쟁한다”는 표현은 역할을 구분해야 합니다. Broadcom은 Merchant ASIC, NVIDIA는 Integrated Platform, Arista는 System·Software Layer에서 강점이 있습니다.

Switch와 SerDes는 분리할 수 없습니다

102.4Tbps Logic Core가 있어도 외부로 Data를 보내지 못하면 의미가 없습니다. Switch ASIC에는 수백 개의 100G·200G SerDes가 필요합니다.

SerDes Speed가 올라가면 Signal Integrity와 Power가 어려워지고 PCB Reach가 줄어듭니다. 이 문제를 해결하기 위해 Retimer, AEC, CPO와 Optical I/O가 함께 발전합니다.

즉 Switch ASIC Roadmap은 사실상 SerDes Roadmap과 같은 방향으로 움직입니다. Tomahawk 6가 200G SerDes와 CPO Option을 강조하는 이유입니다.

Switch와 Optics도 하나의 System으로 봐야 합니다

Switch Port Speed가 800G·1.6T로 올라가면 Front-panel Optical Module의 Speed도 올라갑니다. Port 수가 많아지면 Network Power의 상당 부분을 Optics가 차지할 수 있습니다.

CPO는 Optical Engine을 Switch ASIC 가까이 가져가 Electrical Reach와 DSP Power를 줄입니다. Broadcom Tomahawk 6-Davisson과 NVIDIA Spectrum-X Photonics가 대표적인 사례입니다.

따라서 AI Switch 업체의 경쟁은 “누가 ASIC을 빠르게 만드나”에서 누가 Switch + SerDes + Optics를 가장 낮은 Power로 통합하나까지 확대되고 있습니다.

Scale-up까지 Ethernet이 들어오면 시장이 더 커질 수 있습니다

Ethernet Switch의 전통적인 AI 역할은 Rack 간 Scale-out입니다. 그러나 Broadcom Tomahawk Ultra와 Tomahawk 6는 Rack 내부 Scale-up까지 Ethernet을 확대하려 합니다.

Scale-up에 Ethernet이 성공하면 하나의 Technology Stack으로 Rack 내부와 Rack 외부를 모두 운영할 수 있어 Hyperscaler의 운영 단순화에 장점이 있습니다.

반면 NVLink·UALink 같은 Memory-semantic 전용 Fabric의 Latency와 Bandwidth 장점도 강합니다. 앞으로 Scale-up Network에서 Ethernet이 어느 정도 Share를 가져가는지는 Switch ASIC TAM에 큰 영향을 줄 수 있습니다.

투자 관점에서 무엇을 봐야 할까요?

첫 번째는 Switching Capacity Growth입니다. 51.2T에서 102.4T로 이동하고 이후 더 높은 Generation이 얼마나 빠르게 Volume Ramp하는지 봐야 합니다.

두 번째는 Network Tier입니다. High-radix Switch가 Tier를 줄이면 Switch Unit는 감소할 수 있지만 고성능 ASIC과 Optics Mix는 올라갈 수 있습니다.

세 번째는 200G SerDes와 1.6T Port Adoption입니다. Switch Silicon의 세대교체가 Retimer와 Optical DSP, Module 매출로 어떻게 전파되는지 중요합니다.

네 번째는 AI Routing Feature의 실제 성능입니다. Adaptive Routing, Packet Trimming과 Telemetry가 Job Completion Time을 얼마나 개선하는지가 고객 Design Win을 결정할 수 있습니다.

다섯 번째는 Merchant Silicon과 Vertical Integration의 경쟁입니다. Broadcom+Arista 같은 Open Stack과 NVIDIA Spectrum-X가 어떤 Customer Segment에서 강한지를 봐야 합니다.

리스크는 무엇일까요?

AI Network에서 Bandwidth Growth가 예상보다 느리거나 GPU Cluster Architecture가 더 적은 Switch Port를 사용하는 방향으로 바뀌면 Switch Silicon Growth가 둔화될 수 있습니다.

CPO가 빠르게 확산되면 Pluggable Optical Ecosystem과 Switch System Architecture가 크게 바뀔 수 있고, 반대로 Reliability와 Serviceability 문제로 CPO Adoption이 느려질 수도 있습니다.

또 Hyperscaler가 자체 Switch Silicon을 개발하면 Merchant Vendor의 Share에 영향을 줄 가능성도 있습니다. 따라서 전체 AI Network Capex와 Vendor Mix를 함께 봐야 합니다.

핵심 정리

질문
AI Switch ASIC이란?GPU Traffic의 Forwarding, Routing, Buffering, Congestion과 Telemetry를 Hardware로 처리하는 Network Semiconductor입니다
일반 Switch와 무엇이 다른가요?RDMA·Collective Traffic에서 Tail Latency와 Fabric Utilization을 극대화해야 합니다
102.4Tbps가 왜 중요한가요?더 많은 800G·1.6T Port와 높은 Radix를 통해 Network Tier를 줄일 수 있기 때문입니다
Broadcom의 강점은?Merchant Ethernet Switch와 NIC·Retimer·Optics까지 이어지는 Open Portfolio입니다
NVIDIA의 강점은?GPU·NIC·Switch·NCCL을 함께 최적화하는 Vertical Integration입니다
Arista의 역할은?Merchant Silicon을 실제 AI Ethernet Fabric으로 운영하는 System·EOS Software Layer입니다
투자포인트는?102.4T Ramp, 200G SerDes, 1.6T Optics, AI Routing Feature와 Ethernet Share입니다

AI Switch ASIC은 Network의 단순 교통정리 장치가 아닙니다. GPU가 계산을 끝내고 다음 Data를 기다리는 순간 Network가 Compute 성능을 결정하기 때문에 Switch가 Accelerator Utilization을 높이는 AI Semiconductor로 변하고 있습니다.

앞으로 AI Cluster가 10만 개에서 100만 개 XPU 규모로 커질수록 가장 중요한 Switch는 단순 Peak Throughput이 높은 Chip이 아니라 Network Tier를 줄이고 Congestion을 빠르게 제어하며 Optics Power까지 낮춰 전체 AI Factory의 Goodput과 TCO를 개선하는 ASIC이 될 것입니다.

curiouszip

curiouszip
Tech Layers를 운영하는 에디터입니다. AI 반도체, 데이터센터, 첨단 패키징, 네트워크 기술처럼 복잡하지만 산업의 방향을 결정짓는 기술들을 조사하고, 이를 누구나 이해할 수 있는 언어로 풀어 쓰는 작업을 하고 있습니다.
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.