본문 바로가기
Tech Layers | Under the chip Tech Layers | Under the chip
Complex tech, simply unpacked.

Optical Circuit Switch(OCS) 분석|AI 데이터센터가 네트워크 토폴로지를 빛으로 재구성하는 이유

curiouszip

102.4Tbps급 Ethernet Switch와 1.6T Optical Transceiver가 등장하면 AI Network의 Bandwidth 문제는 상당 부분 해결되는 것처럼 보입니다. 하지만 Switch와 Optical Link가 아무리 빨라져도 또 하나의 문제가 남습니다.

어떤 Switch를 어떤 Switch와 연결할 것인가입니다.

기존 Data Center Network에서는 수천~수만 개의 Fiber가 물리적으로 배선되고, Leaf·Spine 또는 여러 단계의 Packet Switch를 통해 Traffic Path가 결정됩니다. 한번 만들어진 Physical Topology를 바꾸려면 Cable을 다시 연결하거나 새로운 Switching Layer를 추가해야 합니다.

AI Cluster가 커질수록 이 구조가 부담이 됩니다. GPU 세대가 바뀌고, 일부 Rack의 Traffic이 갑자기 증가하고, Switch나 Link에 장애가 발생해도 Physical Network는 쉽게 바뀌지 않기 때문입니다.

이 문제를 전자적인 Packet Switching이 아니라 빛의 경로 자체를 바꾸는 방식으로 해결하려는 기술이 OCS입니다.

OCS(Optical Circuit Switch): 들어온 Optical Fiber를 원하는 다른 Fiber와 물리적으로 연결해 Optical Signal을 전기신호로 변환하지 않고 경로를 변경하는 광회선 스위치입니다.

OCS의 중요성은 단순히 새로운 Optical Equipment가 하나 추가된다는 데 있지 않습니다. 제대로 적용될 경우 기존 AI Network에서 당연하게 사용했던 Spine Switch, Optical-Electrical-Optical Conversion, 고정된 Network Topology의 일부를 다시 설계할 수 있기 때문입니다.

Google은 자체 Apollo OCS를 Jupiter Data Center Network에 적용해 왔고, 최근에는 TPU 기반 AI Infrastructure에서도 OCS를 적극적으로 활용하고 있습니다. 한편 Lumentum과 Coherent 같은 Optical 업체가 상용 OCS 시장에 본격적으로 진입하면서 이 기술은 특정 Hyperscaler의 내부 Architecture를 넘어 하나의 독립적인 AI Infrastructure 시장으로 이동하고 있습니다.

Packet Switch와 OCS는 무엇이 다를까요?

가장 중요한 차이는 Packet을 보는가, 빛의 길만 바꾸는가입니다.

일반적인 Ethernet Switch는 Packet Header를 읽고 어떤 Port로 Data를 보낼지 결정합니다. Optical Fiber를 통해 Data가 들어왔다면 Transceiver에서 먼저 Optical Signal을 Electrical Signal로 바꾸고, Switch ASIC이 Packet을 처리한 뒤 다시 Transceiver를 통해 Optical Signal로 변환합니다.

OCS는 이 과정을 하지 않습니다.

들어온 빛을 그대로 원하는 Output Fiber로 보냅니다.

구분Packet SwitchOptical Circuit Switch
처리 대상PacketOptical Path
Header 처리필요없음
Packet Buffer있음없음
SwitchingElectronicOptical
O/E/O 변환일반적으로 필요OCS 내부에서는 불필요
Traffic 제어 단위PacketCircuit·Fiber Path
Data Rate 의존성ASIC 세대에 따라 변화상대적으로 Rate-transparent
주요 역할Packet Routing·Congestion 제어Physical Topology 재구성
AI Network 역할실제 Traffic SwitchingSwitch 사이 연결구조 변경

따라서 OCS가 102.4T Ethernet Switch를 그대로 대체한다고 이해하면 안 됩니다.

OCS에는 Packet Buffer도 없고 Routing Table을 이용해 매 Packet의 목적지를 판단하지도 않습니다. OCS는 Packet Switch 사이의 물리적인 연결관계를 바꿉니다.

Packet Switch가 “이 Packet을 어디로 보낼까?”를 결정한다면 OCS는 그보다 아래에서 **“A Switch와 B Switch를 물리적으로 연결할까, 아니면 A와 C를 연결할까?”*\*를 결정하는 장비입니다.

이 차이가 AI Network Architecture 전체를 바꿀 가능성을 만듭니다.

OCS 내부에서는 실제로 무엇이 움직일까요?

대표적인 방식이 MEMS 기반 Optical Switching입니다.

MEMS(Micro-Electro-Mechanical Systems): Semiconductor 공정을 이용해 매우 작은 기계 구조물을 만드는 기술입니다.

Lumentum의 R300 같은 OCS에는 수백 개의 미세한 Silicon Mirror가 들어갑니다. Fiber에서 나온 빛이 Mirror에 도달하면 Mirror의 각도를 조절해 원하는 Output Fiber 방향으로 빛을 반사합니다.

하나의 Input과 하나의 Output을 연결하기 위해 Mirror의 각도를 정밀하게 제어하고, 여러 Mirror를 동시에 조절하면 수백 개 Optical Path의 연결관계를 바꿀 수 있습니다.

이런 구조의 장점은 Optical Signal을 전기신호로 변환하지 않는다는 것입니다. Packet 처리도 없고, 특정 Ethernet Speed에 묶이지도 않습니다.

400G에서 800G, 1.6T로 Network Speed가 올라가더라도 OCS는 기본적으로 “빛이 어디로 가야 하는지”만 결정합니다.

모든 OCS가 MEMS를 사용하는 것은 아닙니다.

Coherent는 Digital Liquid Crystal 기반 Optical Switching Architecture를 개발하고 있습니다. Liquid Crystal의 광학적 특성을 전기적으로 조절해 빛의 방향을 바꾸는 방식입니다.

즉 OCS 시장에서도 MEMS, Liquid Crystal 등 서로 다른 Optical Switching 방식이 경쟁하게 됩니다.

OCS의 핵심은 낮은 Latency보다 O/E/O를 줄이는 데 있습니다

Packet Switch를 한 번 통과한다는 것은 단순히 ASIC 하나를 거친다는 의미가 아닙니다.

Optical Network에서는 일반적으로 Fiber에서 들어온 Signal을 Photodetector와 Transceiver가 Electrical Signal로 바꿔야 합니다. Switch ASIC이 이를 처리한 뒤 다시 Laser와 Optical Engine을 통해 빛으로 만들어 다음 Fiber로 보냅니다.

이를 O/E/O(Optical-Electrical-Optical) Conversion이라고 합니다.

Switching Stage가 늘어날수록 Switch ASIC뿐 아니라 SerDes, DSP, Transceiver, Power Supply와 Cooling까지 함께 필요해집니다.

OCS를 이용해 두 Packet Switch 사이를 직접 연결하면 중간 Switching Stage의 일부를 건너뛸 수 있습니다.

따라서 OCS의 경제성은 단순히 Latency 몇 ns를 줄이는 문제가 아닙니다.

중간 Packet Switch, Transceiver Pair, 전력, Cooling, Rack Space를 얼마나 줄일 수 있는가가 더 중요합니다.

AI Cluster가 커질수록 이 효과는 누적될 수 있습니다.

Google Jupiter가 OCS의 가장 중요한 실증 사례입니다

OCS가 최근 갑자기 등장한 기술은 아닙니다.

Google은 2010년대부터 자체 개발한 Apollo OCS를 Jupiter Data Center Network에 적용해 왔습니다.

기존 Clos Network에서는 Aggregation Switch 위에 대규모 Spine Layer가 필요합니다. 새로운 세대의 Network Equipment를 추가하더라도 기존 Spine과 연결해야 하므로 서로 다른 40G·100G·200G 장비가 섞이면 최신 장비가 가진 Bandwidth를 완전히 활용하기 어려울 수 있습니다.

Google은 OCS를 Aggregation Block 사이에 배치한 뒤 Optical Path를 동적으로 변경할 수 있도록 만들었습니다.

그 결과 고정된 Spine Layer 대신 서로 다른 Aggregation Block을 Direct Mesh 형태로 연결하고, SDN Control Plane이 Workload와 장애 상황에 따라 Logical Topology를 변경하는 Architecture를 구축했습니다.

여기서 중요한 부분이 있습니다.

Network Topology가 Hardware가 아니라 Software가 제어하는 Resource가 되기 시작했다는 점입니다.

과거에는 Cable을 어떻게 연결했는지가 Network Topology였습니다.

OCS Architecture에서는 Fiber는 OCS에 연결해 놓고 Software가 Mirror 또는 Optical Switching Element를 움직여 Logical Connection을 변경할 수 있습니다.

Compute에서는 Virtual Machine이 Physical Server를 추상화했고, Storage에서는 Software-defined Storage가 Physical Disk를 추상화했습니다.

OCS는 비슷한 변화를 Physical Network Layer에서 만들고 있습니다.

AI Cluster에서는 왜 이 기능의 가치가 더 커질까요?

AI Training Network에서는 GPU가 비쌉니다.

따라서 Network가 조금 비효율적이라는 문제는 단순한 Network 성능 저하로 끝나지 않습니다. 수만 달러에서 수십만 달러에 이르는 Accelerator가 Communication을 기다리며 Idle 상태에 들어가면 Compute Capex 자체가 낭비됩니다.

특히 Collective Communication에서는 여러 GPU가 동시에 Data를 교환합니다.

Workload와 Parallelism 방식에 따라 특정 GPU Group 사이의 Traffic이 집중될 수도 있습니다.

기존 Network에서는 충분한 Bandwidth를 확보하기 위해 모든 방향에 많은 Capacity를 미리 설치하는 방식이 일반적입니다.

OCS에서는 실제 Communication Pattern에 맞춰 물리적인 Connectivity 자체를 일부 조정할 수 있습니다.

즉 목표가 단순히 더 빠른 Network에서 필요한 곳에 Bandwidth를 배치할 수 있는 Network로 바뀝니다.

AI Cluster 규모가 커질수록 또 다른 문제가 있습니다.

장애입니다.

10만 개 Accelerator가 연결된 System에서는 어느 Switch나 Optical Link도 영원히 정상이라고 가정할 수 없습니다. Failure Probability가 매우 낮아도 Component 수가 많아지면 어딘가에서는 지속적으로 문제가 발생합니다.

이때 OCS를 이용하면 고장 난 Path를 물리적으로 우회하도록 Optical Topology를 다시 구성할 수 있습니다.

이 단계가 되면 OCS는 단순 Network Equipment보다 GPU Goodput을 높이기 위한 RAS Infrastructure에 가까워집니다.

OCS가 Compute Architecture 안으로 내려오고 있습니다

OCS의 초기 활용처는 Data Center Network였습니다.

하지만 AI Infrastructure에서는 OCS가 점점 Accelerator Fabric에 가까운 위치로 내려오고 있습니다.

Google의 TPU Infrastructure에서도 OCS는 단순한 Building Network 장비가 아니라 Compute Pod와 Interconnect Architecture의 일부로 사용됩니다.

이 변화는 OCS의 TAM을 볼 때 중요합니다.

OCS 시장을 단순히 기존 Spine Switch Replacement 시장으로만 볼 필요가 없기 때문입니다.

장기적으로는 Scale-out Network뿐 아니라 Scale-across, 일부 Scale-up 영역까지 적용 가능성이 열릴 수 있습니다.

다만 모든 GPU Scale-up Link가 OCS로 바뀐다고 보는 것은 지나친 해석입니다.

Scale-up은 매우 낮은 Latency와 빠른 Fine-grained Communication이 필요하기 때문에 Copper, CPO, Optical I/O, Silicon Photonics와의 경제성 비교가 계속 필요합니다.

102.4T Switch가 발전하면 OCS가 필요 없어지는 것 아닐까요?

오히려 이 질문이 OCS 산업을 볼 때 가장 중요합니다.

Broadcom Tomahawk 6나 NVIDIA Spectrum-X·Spectrum 계열처럼 Switch ASIC의 Radix와 Total Bandwidth가 커지면 동일한 GPU 수를 연결하는 데 필요한 Switching Tier를 줄일 수 있습니다.

즉 High-radix Packet Switch 자체도 Network Flattening 기술입니다.

OCS 역시 Network를 Flatten할 수 있습니다.

두 기술은 일부 영역에서 경쟁하지만 완전히 같은 문제를 해결하지는 않습니다.

High-radix Switch는 한 개 Packet Switch가 더 많은 Traffic을 처리하도록 만드는 방법입니다.

OCS는 Packet Switch 사이의 연결관계를 바꾸고 일부 중간 Switching Stage를 우회하는 방법입니다.

따라서 미래 AI Fabric은 둘 중 하나만 선택하기보다 높은 Radix의 Packet Switch와 OCS를 함께 사용하는 구조가 될 수 있습니다.

Packet Level Congestion Control은 Ethernet Switch가 담당하고, 더 느린 시간축에서 Physical Topology Optimization은 OCS가 담당하는 방식입니다.

OCS와 CPO는 경쟁기술이 아닙니다

CPO(Co-Packaged Optics)는 Optical Engine을 Switch ASIC이나 XPU 가까이에 배치해 High-speed Electrical Reach를 줄이는 기술입니다.

OCS는 이미 Optical Signal로 변환된 이후 어느 Fiber와 어느 Fiber를 연결할 것인지를 결정합니다.

기술해결하는 문제위치
1.6T TransceiverElectrical↔Optical 변환Switch Front Panel
CPOASIC과 Optics 사이 Electrical ReachASIC Package 주변
Optical I/OXPU I/O 자체의 Optical 전환Compute Package
OCSOptical Path·Topology 재구성Fabric 내부
Packet SwitchPacket Routing·Buffering·CongestionNetwork Switching Layer

따라서 CPO가 성장한다고 OCS 시장이 사라지는 구조가 아닙니다.

오히려 CPO와 Optical I/O가 확산될수록 Data가 더 이른 시점에 Optical Domain으로 들어갑니다.

Optical Signal 상태로 이동하는 거리가 길어진다면 그 빛을 중간에서 전기신호로 바꾸지 않고 Routing할 수 있는 OCS의 적용 가능성도 커질 수 있습니다.

CPO는 빛으로 바꾸는 위치를 Chip 가까이 이동시키고, OCS는 그 빛이 갈 목적지를 바꿉니다.

두 기술은 서로 다른 Layer입니다.

OCS가 독특한 이유는 800G에서 1.6T로 가도 본체를 바꿀 필요가 적다는 점입니다

Packet Switch ASIC은 세대교체가 매우 빠릅니다.

51.2Tbps에서 102.4Tbps, 이후 204.8Tbps로 올라가면 Silicon과 SerDes가 바뀌어야 합니다.

Optical Transceiver 역시 400G, 800G, 1.6T, 3.2T로 계속 세대교체됩니다.

하지만 Free-space Optical Switching 기반 OCS는 Packet을 해석하지 않습니다.

Mirror는 그 빛이 400Gbps인지 1.6Tbps인지 알 필요가 없습니다.

이 때문에 OCS는 Data Rate와 Wavelength에 상대적으로 독립적인 Infrastructure Layer가 될 수 있습니다.

투자 관점에서는 이 특성이 양면적입니다.

OCS 한 대의 Useful Life가 길어진다면 고객 입장에서는 ROI가 좋아집니다.

반대로 Vendor 입장에서는 Transceiver처럼 매 Network Speed Cycle마다 Installed Base 전체가 교체되는 시장이 아닐 수 있습니다.

따라서 OCS 시장의 매출성장은 Replacement Cycle보다 새로운 AI Fabric에서 OCS Architecture 자체의 침투율이 얼마나 올라가느냐에 더 크게 좌우될 가능성이 있습니다.

OCS가 들어오면 AI Network BOM은 어떻게 바뀔까요?

OCS는 기존 Network BOM에 장비 하나만 추가하는 방식으로 보면 안 됩니다.

Architecture에 따라 기존 Component의 수량 자체가 바뀔 수 있기 때문입니다.

BOM 영역OCS 도입 시 가능한 변화
OCS Chassis새로운 Content 발생
MEMS·Liquid Crystal Optical Engine새로운 Photonic Content 발생
Fiber·Connector·CollimatorOptical Path 증가와 함께 중요도 상승
Control ElectronicsOCS 제어용 Content 추가
SDN·Fabric Management SoftwareTopology 제어 중요도 상승
Spine Packet Switch일부 Architecture에서 감소 가능
Intermediate TransceiverO/E/O Stage 감소 시 일부 감소 가능
Switch ASICTier 감소 효과와 Endpoint Bandwidth 증가 효과가 상충
Power·CoolingElectronic Switching Stage 감소 시 절감 가능

특히 투자자가 조심해야 할 부분은 “OCS가 성장하면 모든 Optical 업체가 수혜를 본다”는 단순한 논리입니다.

OCS가 중간 Packet Switching Stage를 제거하면 해당 Stage에 들어가던 Transceiver Pair도 줄어들 수 있습니다.

반면 AI Cluster 자체의 Bandwidth와 Accelerator 수가 훨씬 빠르게 증가하면 전체 Optical Port 수는 계속 늘어날 수 있습니다.

따라서 1.6T Transceiver와 OCS가 모두 성장할 수 있지만 두 시장의 Content 변화는 단순히 더해서 계산할 수 없습니다.

Lumentum은 OCS에 가장 직접적으로 노출된 상장사 중 하나입니다

Lumentum은 MEMS 기반 R300 300×300 OCS와 R64 64×64 제품을 보유하고 있습니다.

R300은 대규모 AI Cluster와 Spine Replacement 같은 높은 Port Count 영역을 겨냥하고, R64는 상대적으로 작은 Port Count가 필요한 GPU Interconnect와 Data Center Application을 대상으로 합니다.

여기서 중요한 것은 OCS가 더 이상 단순한 Product Announcement 단계만은 아니라는 점입니다.

Lumentum은 OCS Backlog가 빠르게 증가하고 있음을 공개해 왔고, 최근 실적에서도 OCS가 AI Networking 성장동력으로 언급되고 있습니다.

따라서 Lumentum의 OCS 투자 Thesis를 볼 때는 전체 Cloud Revenue Growth보다 Backlog가 실제 OCS Revenue로 전환되는 속도가 더 중요한 KPI입니다.

또 Lumentum은 OCS만 판매하는 회사가 아닙니다.

EML, 1.6T Optical Transceiver 관련 부품, CPO용 External Laser 등 AI Optical Portfolio를 동시에 갖고 있습니다.

OCS Adoption과 CPO·1.6T 전환이 동시에 일어나면 한 회사 안에서 여러 Optical Layer의 Content가 증가할 수 있다는 점이 강점입니다.

Coherent는 다른 방식의 OCS Architecture를 구축하고 있습니다

Coherent는 MEMS 대신 Digital Liquid Crystal 기반 OCS를 개발하고 있습니다.

회사는 300 Port 이상급 OCS System을 확장하면서 Scale-up·Scale-out·Spine·Scale-across 등으로 Use Case를 넓히고 있습니다.

Coherent의 장점은 OCS Box만 보유한 것이 아니라 Laser, Detector, Silicon Photonics, Passive Optics, Transceiver 등 광학 Value Chain의 상당 부분을 내부에 보유하고 있다는 점입니다.

OCS가 하나의 독립시장으로 커지는 동시에 Data Center 전체가 Copper에서 Optical로 이동한다면 여러 제품군에서 Revenue Exposure가 발생할 수 있습니다.

다만 Coherent 역시 OCS Revenue를 독립적으로 상세 공시하지 않는 경우가 많기 때문에 전체 Datacenter 매출 증가를 곧바로 OCS 성장으로 해석해서는 안 됩니다.

Production Customer 수, 실제 Deployment, OCS System Shipment가 더 중요한 확인 지표입니다.

Google은 OCS Vendor가 아니라 가장 중요한 Architecture Validator입니다

Google은 자체 Apollo OCS를 사용하기 때문에 Lumentum이나 Coherent의 직접적인 고객 Revenue와 동일하게 볼 수 없습니다.

하지만 산업적으로는 오히려 더 중요한 의미가 있습니다.

OCS가 수십 년간 알려져 있던 Optical Technology에서 실제 Hyperscale Production Architecture로 이동할 수 있다는 것을 Google이 장기간 증명했기 때문입니다.

그리고 이 Architecture가 일반 Cloud Network를 넘어 TPU와 AI Compute System에서도 계속 사용되고 있다는 것은 OCS의 Use Case가 확장되고 있다는 신호입니다.

따라서 상용 OCS 시장을 평가할 때 중요한 질문은 “Google이 OCS를 쓰는가?”가 아닙니다.

Google이 자체적으로 증명한 Architecture를 다른 Hyperscaler와 AI Cluster 사업자가 상용 Vendor 제품으로 얼마나 채택하는가?

이 질문이 실제 시장규모를 결정합니다.

Broadcom과 NVIDIA에는 오히려 복잡한 변수입니다

OCS가 성장한다고 Broadcom이나 NVIDIA Networking 사업이 단순히 피해를 본다고 볼 수는 없습니다.

OCS Architecture에서도 Packet Switch는 필요합니다.

GPU에서 들어오는 수많은 Flow를 처리하고 Congestion Control, Routing, Load Balancing을 수행하는 역할은 여전히 Ethernet Switch ASIC이 담당합니다.

하지만 OCS가 Spine Layer 일부를 제거하거나 우회하면 Accelerator당 필요한 Electronic Switching Stage 수가 줄어들 가능성은 있습니다.

반대로 GPU Cluster가 더 커지고 Endpoint Bandwidth가 800G에서 1.6T 이상으로 올라가면 전체 Switch Silicon Demand는 계속 증가할 수 있습니다.

따라서 OCS는 Packet Switch 시장에 대한 단순 Bear Thesis가 아닙니다.

더 정확하게는 Packet Switching에 쓰이던 Network Capex의 일부가 Optical Topology Switching으로 이동할 가능성을 의미합니다.

High-radix ASIC, CPO, OCS가 동시에 발전하면서 AI Fabric의 BOM 배분이 달라지는 문제로 봐야 합니다.

OCS 시장에서 투자자가 봐야 할 KPI

OCS 시장을 볼 때 Port 수만 보는 것은 부족합니다.

첫 번째는 Production Deployment입니다.

Lab Sampling과 Qualification을 넘어 실제 Hyperscaler Network에 OCS가 들어가는지가 가장 중요합니다.

두 번째는 OCS가 Network의 어느 위치에 들어가는지입니다.

기존 Spine Replacement인지, Scale-out Fabric인지, GPU Scale-up인지에 따라 시장규모와 OCS Density가 완전히 달라집니다.

세 번째는 OCS Attach Rate입니다.

GPU 1만 개당 OCS가 몇 대 필요한지, Network Block당 몇 Port가 배치되는지가 Revenue Model을 결정합니다.

네 번째는 Insertion Loss와 Optical Link Budget입니다.

OCS를 중간에 넣으면 아무리 낮더라도 추가 Optical Loss가 발생합니다.

Transmitter Power와 Receiver Sensitivity, Connector Loss까지 고려했을 때 Link Budget 안에서 안정적으로 동작해야 합니다.

다섯 번째는 Reconfiguration Time입니다.

OCS는 Packet 단위로 빠르게 경로를 바꾸는 장비가 아닙니다.

따라서 Network Traffic Pattern이 얼마나 안정적인 시간축을 갖는지에 따라 OCS가 유효한 영역과 그렇지 않은 영역이 갈립니다.

여섯 번째는 Control Software입니다.

수백 개의 Mirror를 움직이는 것보다 어느 순간 어떤 Topology를 만들어야 하는지를 판단하는 일이 더 어렵습니다.

OCS가 커질수록 SDN Controller, Telemetry, Failure Detection과 Traffic Engineering이 Hardware 못지않게 중요해집니다.

마지막으로 Revenue Disclosure를 봐야 합니다.

Optical 업체의 전체 AI Revenue가 증가한다고 OCS가 성공했다고 판단하면 안 됩니다.

Backlog, Production Customer, OCS Shipment, System Revenue 안에서 실제 기여도가 얼마나 올라가는지를 확인해야 합니다.

Counter Thesis도 강합니다

OCS가 유망하다고 해서 모든 AI Data Center가 OCS Architecture로 이동한다고 가정하는 것은 위험합니다.

가장 큰 문제는 OCS가 Packet Switch가 아니라는 점 그 자체입니다.

Traffic이 매우 빠르게 변하고 수많은 작은 Flow가 계속 목적지를 바꾼다면 매번 Physical Circuit을 변경할 수 없습니다.

이런 Traffic은 기존 Packet Switching이 훨씬 적합합니다.

또 OCS를 활용해 Physical Topology를 동적으로 바꾸려면 Network 전체를 이해하는 강력한 Control Plane이 필요합니다.

Google은 자체 SDN Software와 Network를 모두 통제하기 때문에 OCS를 깊게 통합할 수 있었습니다.

일반 Enterprise나 작은 Cloud 사업자가 같은 수준의 Software Stack을 구축하는 것은 쉽지 않습니다.

102.4T와 향후 204.8T High-radix Packet Switch의 발전도 변수입니다.

Packet Switch 자체가 충분히 고밀도·저전력화돼 Network Tier를 크게 줄일 수 있다면 OCS를 추가하는 Architecture의 경제성이 낮아질 수 있습니다.

Reliability 역시 단순하지 않습니다.

OCS가 Intermediate Electronic Switch를 줄여 Failure Point를 감소시킬 수 있지만, 반대로 대규모 OCS 자체가 중요한 Failure Domain이 될 수 있습니다.

Hardware Redundancy와 Control Plane Failover가 반드시 필요합니다.

결국 OCS의 승부는 Optical Switching 기술 하나가 아니라 System TCO와 GPU Goodput을 실제로 개선할 수 있는가에서 결정됩니다.

OCS는 AI Infrastructure의 어느 Layer에 있을까요?

OCS는 Networking Semiconductor와 Optical Transceiver 사이의 기술로만 보면 위치가 애매합니다.

더 정확하게는 Optical Fabric Topology Layer입니다.

GPU가 계산하고, NIC가 Data를 Network에 내보내고, Packet Switch ASIC이 Packet을 처리하며, Transceiver와 CPO가 Data를 빛으로 바꿉니다.

그 다음 단계에서 OCS는 그 빛이 어느 Switch와 연결될지를 결정합니다.

이 Layer가 성장하면 AI Network의 경쟁구도도 달라집니다.

과거에는 더 빠른 Switch ASIC과 더 빠른 Transceiver를 만드는 것이 핵심이었다면 앞으로는 같은 Hardware를 얼마나 유연하게 재구성해 GPU를 놀리지 않을 것인가가 중요해질 수 있습니다.

OCS가 흥미로운 이유는 새로운 Optical Box가 등장했기 때문이 아닙니다.

Network Topology 자체가 Software로 제어할 수 있는 Resource로 변하고 있기 때문입니다.

Google은 이미 이를 Production Network와 TPU Infrastructure에서 구현했고, Lumentum과 Coherent는 이 Architecture를 상용시장으로 확장하려 하고 있습니다.

앞으로 확인해야 할 것은 OCS 장비의 스펙 경쟁보다 더 구체적입니다.

얼마나 많은 Hyperscaler가 OCS를 채택하는지, Spine·Scale-out·Scale-up 중 어디부터 확산되는지, Electronic Switching Tier가 실제로 얼마나 줄어드는지, 그리고 그 결과 Network BOM에서 누가 더 많은 Content를 가져가는지입니다.

AI Infrastructure에서 Compute가 GPU 중심으로 재설계되고 Memory가 HBM 중심으로 재설계됐듯이, Network 역시 단순히 Ethernet Speed를 높이는 단계를 넘어 Packet Switching과 Optical Switching의 역할 자체를 다시 나누는 단계로 들어가고 있습니다.

OCS는 바로 그 변화의 한가운데에 있는 Layer입니다.

curiouszip

curiouszip
Tech Layers를 운영하는 에디터입니다. AI 반도체, 데이터센터, 첨단 패키징, 네트워크 기술처럼 복잡하지만 산업의 방향을 결정짓는 기술들을 조사하고, 이를 누구나 이해할 수 있는 언어로 풀어 쓰는 작업을 하고 있습니다.
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.