본문 바로가기
Tech Layers | Under the chip Tech Layers | Under the chip
Complex tech, simply unpacked.

Optical I/O란? AI 반도체가 전기 대신 빛으로 데이터를 보내는 이유

curiouszip

Data Center에서는 이미 수많은 Optical Fiber가 사용됩니다. Switch와 Switch 사이, Rack과 Rack 사이의 400G·800G Link를 Fiber로 연결하는 것은 낯선 일이 아닙니다. 그런데 GPU와 Switch Chip 자체는 여전히 Package 밖으로 Data를 내보낼 때 먼저 Electrical Signal을 사용하고, Board 끝의 Optical Module에서 그 Signal을 빛으로 바꾸는 경우가 많습니다.

Network Bandwidth가 낮을 때는 이 구조가 매우 효율적이었습니다. 하지만 SerDes가 112G, 224G급으로 빨라지고 Switch와 XPU의 Total I/O가 수십 Tbps에서 100Tbps 이상으로 올라가면서 Chip에서 Optical Module까지 Electrical Signal을 운반하는 구간 자체가 Power와 Reach의 Bottleneck이 되기 시작합니다.

Optical I/O: CPU, GPU, XPU와 Switch 같은 Semiconductor Package 가까이에서 Electrical Data를 Optical Signal로 변환해 Fiber를 통해 전달하는 High-bandwidth I/O Architecture입니다.

Optical I/O의 핵심은 단순히 Fiber를 사용하는 것이 아닙니다. Optical Conversion Point를 Network Front-panel에서 Compute Package 가까이 옮기는 것입니다.

먼저 Pluggable, CPO, Optical I/O를 구분해보면

구분Pluggable OpticsCPOOptical I/O
Optical Engine 위치Front-panel ModuleSwitch ASIC 매우 가까이GPU·CPU·XPU Package 가까이
Electrical Reach상대적으로 김매우 짧음Package 내부 수준으로 최소화 가능
대표 목적범용 Optical PortSwitch I/O Power·Density 개선Compute I/O Bottleneck 해결
주요 대상Switch·NIC PortSwitch ASICGPU, CPU, XPU, Switch
주요 과제Module Power·ThermalYield·Serviceability·LaserLatency·Packaging·Thermal·Protocol Integration

CPO는 Optical I/O의 한 적용형태로 볼 수 있지만 시장에서 일반적으로 CPO는 Switch ASIC 주변 Optics를 의미하고 Optical I/O는 Compute Silicon 자체의 I/O까지 빛으로 바꾸는 더 넓은 방향을 가리키는 경우가 많습니다.

왜 Electrical I/O가 문제가 될까요?

Electrical SerDes는 매우 빠르게 발전해왔습니다. 하지만 Data Rate가 높아질수록 Channel Loss와 Crosstalk, Jitter가 커집니다.

Chip Package에서 Board를 지나 Connector와 Cable로 갈수록 Signal을 복원하기 위해 Equalization과 Retimer가 필요합니다. 224G-class PAM4 Lane에서는 Channel Design Margin이 더 작아지고 PCB Material, Connector와 Routing Cost도 올라갑니다.

Switch ASIC에서 Optical Module까지 수백 Lane을 Electrical로 보내면 상당한 I/O Power가 발생할 수 있습니다. GPU Scale-up에서도 Rack 내부 수 m를 Copper로 연결하려면 굵은 Cable과 Retimer·AEC가 필요합니다.

Optical I/O는 이 Electrical Reach를 최소화하고 긴 거리를 처음부터 Fiber가 담당하게 하려는 접근입니다.

Optical I/O는 어떤 구조로 동작할까요?

Logic Die에서 Data가 나오면 매우 짧은 Electrical D2D Interface를 통해 Photonic Engine으로 전달됩니다. Photonic Engine의 Modulator가 Laser Light에 Data를 실어 Fiber로 전송하고, 반대쪽 Photodetector가 빛을 다시 Electrical Signal로 변환합니다.

Photonic Engine은 Silicon Photonics 기반 Chiplet 형태가 될 수 있습니다. Logic Die와 Photonic Chiplet은 UCIe 같은 Die-to-die Interface 또는 Vendor-specific Interface로 연결될 수 있습니다.

이 Architecture에서 핵심은 High-speed Electrical Signal이 Board를 길게 달리는 것이 아니라 Logic Die와 Optical Engine 사이의 몇 mm 수준 구간만 Electrical로 유지되는 것입니다.

Silicon Photonics가 Optical I/O의 기반입니다

Optical I/O를 Package 안에 넣으려면 Waveguide, Modulator, Photodetector와 WDM Function을 작은 면적에 집적해야 합니다. Silicon Photonics가 중요한 이유입니다.

Silicon Photonics는 Semiconductor Manufacturing을 활용해 Optical Circuit을 PIC에 집적할 수 있고, Logic Package와 함께 Advanced Packaging으로 조립하기에 적합합니다.

다만 Laser Source는 Silicon만으로 효율적으로 만들기 어렵기 때문에 InP 같은 III-V Material이나 External Laser가 필요합니다. Optical I/O Architecture에서 Laser를 Package 안에 둘지, External Laser를 공유할지는 Power와 Reliability, Serviceability에 큰 영향을 줍니다.

Intel OCI는 Optical I/O가 무엇인지 보여주는 사례입니다

Intel은 Optical Compute Interconnect(OCI) Chiplet을 개발하고 있습니다. 공개된 1세대 OCI는 Photonics PIC와 Electrical IC를 결합해 최대 4Tbps Bidirectional Data Transfer를 지원하며 CPU, GPU, IPU 같은 Compute Device와 Co-package할 수 있도록 설계됐습니다.

Intel Demo는 64 channels의 32Gbps Data를 방향별로 전달하고 최대 100m Fiber Reach를 지원하는 Architecture를 보여줬습니다. 다만 실제 Compute Use Case에서는 Propagation Latency 때문에 수십 m 이하가 더 현실적일 수 있습니다.

중요한 점은 4Tbps라는 숫자보다 Optical Engine이 독립적인 Front-panel Module이 아니라 Compute Package의 Chiplet로 이동한다는 것입니다.

왜 AI Accelerator에서 Optical I/O가 필요할까요?

GPU Compute와 HBM Bandwidth는 계속 증가하고 있습니다. NVIDIA Rubin GPU는 HBM4에서 최대 22TB/s Memory Bandwidth를 제공합니다. GPU 내부 Data Processing이 이 정도로 빨라지면 GPU 밖 Scale-up·Scale-out Bandwidth도 계속 늘어야 합니다.

특히 MoE Model에서는 All-to-All Communication이 커지고 여러 GPU 사이에 많은 Token Data가 이동합니다. Scale-up Network가 느리면 Compute Unit이 다른 Accelerator를 기다리게 됩니다.

Electrical I/O의 Bandwidth Density와 Reach가 한계가 되면 Accelerator Package마다 더 많은 SerDes와 Copper Cable을 넣는 대신 Optical I/O를 통해 Fiber로 직접 연결하는 방식이 매력적일 수 있습니다.

Bandwidth Density가 왜 중요한가요?

GPU Package Edge의 공간은 제한돼 있습니다. 더 많은 Electrical Lane을 넣으려면 Package Pin과 SerDes PHY, Board Trace와 Connector가 늘어납니다.

Optical I/O는 WDM을 이용해 하나의 Fiber에 여러 Wavelength를 실을 수 있습니다. 따라서 동일한 Package Edge와 Cable Volume에서 훨씬 많은 Data를 전달할 가능성이 있습니다.

AI Rack에서 Cable 수가 수백 개로 늘어날 때 Fiber는 Copper보다 얇고 가벼워 Routing과 Airflow에도 장점이 있을 수 있습니다.

즉 Optical I/O의 경쟁력은 단일 Link Speed뿐 아니라 Tbps/mm 수준의 Bandwidth Density와 Cable Density에서 나타날 수 있습니다.

Power per Bit가 가장 중요한 경제성 지표입니다

Optical I/O가 아무리 멀리 갈 수 있어도 Electrical보다 더 많은 Power를 사용한다면 짧은 AI Scale-up Link에서는 채택되기 어렵습니다.

Optical I/O는 Logic에서 Photonics까지 Electrical Reach를 줄여 SerDes Equalization Power를 낮추고, WDM과 Shared Laser를 통해 전체 Energy per Bit를 낮추는 것을 목표로 합니다.

장기적으로 AI Rack에서는 Network Bandwidth가 수백 Tbps까지 커질 수 있기 때문에 pJ/bit의 작은 차이가 Rack Power에 큰 영향을 줍니다.

따라서 Optical I/O 업체의 기술을 볼 때 “몇 Tbps인가”와 함께 pJ/bit와 Laser Efficiency, DSP 유무를 확인해야 합니다.

Latency는 Optical I/O의 가장 까다로운 문제입니다

빛은 Fiber에서 빠르게 이동하지만 Optical Link 전체 Latency는 Fiber Propagation만으로 결정되지 않습니다. Electrical-to-optical Conversion, SerDes, DSP, FEC와 Receiver 처리시간이 추가됩니다.

Scale-out Ethernet에서는 수십 ns가 허용될 수 있지만 GPU Scale-up Fabric은 Memory-semantic Communication과 Collective Operation 때문에 Latency에 더 민감합니다.

따라서 Scale-up용 Optical I/O는 일반 Long-reach Optical Transceiver처럼 복잡한 DSP를 많이 사용하는 Architecture보다 매우 낮은 Processing Latency의 Optical Engine이 필요할 수 있습니다.

바로 이 이유 때문에 Linear Optics와 Coherent-free Short-reach Architecture가 AI Optics에서 중요해지고 있습니다.

Optical I/O와 UALink는 어떻게 연결될 수 있을까요?

UALink는 Accelerator-to-Accelerator Scale-up Interconnect입니다. 200G per lane을 지원하고 최대 1,024 Accelerator Domain을 목표로 합니다.

UALink Protocol이 반드시 Copper만 사용해야 하는 것은 아닙니다. Physical Layer가 Optical로 확장되면 Rack보다 더 큰 Scale-up Domain을 구성하는 데 도움이 될 수 있습니다.

2026년에는 UALink Chiplet Specification이 UCIe 3.0과 호환되는 방향으로 공개되면서 UALink Logic을 Chiplet 형태로 SoC에 통합하는 Ecosystem도 구체화되고 있습니다.

장기적으로 Logic Package 내부 UCIe, Accelerator Scale-up UALink, 외부 Optical I/O가 연결되는 Layered Connectivity Stack이 가능해집니다.

Optical I/O와 Ethernet도 연결됩니다

Optical I/O는 특정 Protocol에 종속되지 않는 Physical Connectivity Technology입니다. Ethernet Packet도 Optical I/O Engine을 통해 전송할 수 있습니다.

현재 Switch CPO는 사실상 Ethernet Electrical I/O를 Package 가까이에서 Optical로 바꾸는 대표적인 사례입니다. NVIDIA Spectrum-X Ethernet Photonics와 Broadcom Tomahawk 6-Davisson이 그 방향을 보여줍니다.

향후 GPU나 XPU Package에 Optical Engine이 들어가면 Scale-out Ethernet NIC 기능 일부가 XPU Package에 더 가깝게 통합될 가능성도 있습니다.

CXL도 Optical I/O와 연결될 수 있습니다

CXL은 PCIe PHY 기반 Memory Interconnect이므로 Reach가 늘어나면 Electrical Channel이 부담이 됩니다. CXL 4.0에서는 Retimer를 통해 Optical Connectivity를 구현하는 방향이 명시적으로 논의됩니다.

Optical I/O Chiplet이 CXL Traffic을 직접 전송할 수 있다면 Compute Package와 Remote Memory Shelf를 Fiber로 연결하는 Architecture도 가능해집니다.

즉 Optical I/O는 UALink, Ethernet, CXL 중 하나를 대체하는 Protocol이 아니라 이 Protocol들을 더 긴 거리와 높은 Bandwidth Density로 전달할 수 있는 Physical Layer입니다.

Packaging이 가장 어려운 제조과제입니다

Logic Die와 Photonic Die를 같은 Package에 넣으려면 Electrical D2D Link와 Fiber Coupling을 동시에 해결해야 합니다. Fiber Array는 매우 정밀하게 정렬돼야 하고 작은 Alignment Error도 Optical Loss로 이어질 수 있습니다.

Photonic Device와 Logic Die의 Manufacturing Yield도 따로 관리해야 합니다. 고가의 GPU Package에 불량 Photonic Engine을 붙이면 Package 전체의 Loss가 커집니다. Known-good-die Test와 Wafer-level Optical Test가 중요해집니다.

또 Fiber를 Package에 어떻게 Attach하고 Service할지도 문제입니다. 대량생산에서 자동화된 Fiber Assembly가 경제성을 결정할 수 있습니다.

Thermal이 Optical I/O에서 더 까다로운 이유

GPU와 Switch ASIC 주변은 매우 높은 Heat Density를 갖습니다. Laser와 Modulator는 Temperature에 따라 Wavelength와 Efficiency가 변할 수 있습니다.

Photonic Engine을 Logic Die에 가까이 가져갈수록 Electrical Power는 줄일 수 있지만 Thermal Environment는 더 나빠질 수 있습니다. 이 Trade-off를 해결하려면 Thermal Isolation, External Laser와 Cooling Design이 필요합니다.

따라서 Optical I/O는 Photonics와 Semiconductor Packaging뿐 아니라 Liquid Cooling과 Thermal Architecture까지 연결되는 기술입니다.

External Laser가 중요한 이유

Laser를 CPO·Optical I/O Package 안에 넣으면 Integration은 단순해 보이지만 고온 환경에서 Reliability가 문제될 수 있습니다. Laser가 고장 나면 고가의 Switch나 XPU Package 전체를 교체해야 할 수도 있습니다.

External Laser Source를 사용하면 Laser를 상대적으로 시원하고 교체 가능한 위치에 두고 여러 Optical Engine에 Light를 공급할 수 있습니다.

OIF가 CPO용 External Laser Source와 ELSFP Management를 표준화하는 이유도 Serviceability와 Reliability를 개선하기 위해서입니다.

Copper가 당장 사라지지 않는 이유

Optical I/O의 장점이 커도 매우 짧은 거리에서는 Electrical Link가 여전히 강합니다. Optical Conversion에는 Laser와 Modulator, Photodetector가 필요하고 Packaging Cost가 추가됩니다.

Board 내부 수십 cm나 Rack 내부 몇 m에서는 Passive Copper, Retimer, AEC가 더 경제적일 수 있습니다. Copper Technology도 224G SerDes와 Co-Packaged Copper를 통해 Reach와 Power를 개선하고 있습니다.

따라서 Optical I/O Adoption은 “Optical이 더 빠르다”가 아니라 특정 거리와 Bandwidth에서 Copper의 총 Power·Cost가 Optical보다 커지는 시점에 결정됩니다.

주요 기업은 어디에 있을까요?

Intel은 Silicon Photonics 양산경험과 OCI Chiplet을 통해 Compute Optical I/O를 개발하고 있습니다. Marvell은 Silicon Photonics, Optical DSP와 Custom XPU Connectivity를 결합해 CPO와 Optical I/O Architecture를 확대하고 있습니다.

Ayar Labs 같은 비상장 업체는 Optical I/O Chiplet을 XPU Package 가까이에 넣는 Architecture에 집중합니다. NVIDIA와 Broadcom은 Switch CPO를 실제 AI Network Platform에 적용하며 Optical Engine의 Production 경험을 쌓고 있습니다.

TSMC 같은 Foundry·Packaging 업체는 Logic과 Photonic Engine을 Advanced Packaging으로 통합하는 Platform을 개발합니다.

즉 Optical I/O Value Chain은 XPU, Silicon Photonics, Laser, Foundry, Advanced Packaging, Fiber Assembly와 Test로 이어집니다.

투자 관점에서 무엇을 봐야 할까요?

첫 번째는 실제 XPU Design Win입니다. Demo Chip보다 GPU·Custom Accelerator Production Package에 Optical I/O가 들어가는지가 가장 중요합니다.

두 번째는 pJ/bit입니다. Copper + Retimer/AEC 대비 System-level Power Advantage가 실제로 얼마나 되는지 봐야 합니다.

세 번째는 Optical Bandwidth per Package와 Fiber Count입니다. Bandwidth Density가 실제 Rack Cable Complexity를 얼마나 줄이는지도 중요합니다.

네 번째는 Manufacturing Yield와 Reliability입니다. Optical Alignment, Laser MTBF, Thermal과 Field Serviceability가 대규모 AI Deployment에 적합해야 합니다.

다섯 번째는 Protocol Integration입니다. UALink, Ethernet, CXL이 Optical I/O 위에서 실제 Standardized Ecosystem을 만드는지 확인해야 합니다.

핵심 정리

질문
Optical I/O란?GPU·CPU·XPU Package 가까이에서 Data를 빛으로 바꿔 Fiber로 전달하는 I/O Technology입니다
CPO와 차이는?CPO는 주로 Switch ASIC 주변, Optical I/O는 Compute Package 자체까지 범위를 확대합니다
왜 필요한가요?High-speed Electrical SerDes의 Reach, Power와 Cable Density 한계를 줄이기 위해서입니다
어떤 Protocol에 쓰이나요?Ethernet, UALink, CXL 등 다양한 Protocol의 Physical Transport가 될 수 있습니다
가장 큰 장점은?높은 Bandwidth Density와 긴 Reach, 낮은 Power per Bit 가능성입니다
가장 큰 과제는?Latency, Laser, Packaging Yield, Fiber Assembly와 Thermal입니다
투자포인트는?XPU Design Win, pJ/bit, Silicon Photonics, Advanced Packaging과 Standard Adoption입니다

Optical I/O의 핵심은 Data Center에 Fiber가 더 많아진다는 사실이 아닙니다. 빛으로 바꾸는 위치가 Switch Front-panel에서 ASIC 근처로, 다시 GPU와 XPU Package 안쪽으로 이동하는 것이 진짜 변화입니다.

AI Compute가 빨라질수록 Package 밖으로 내보내야 하는 Data도 증가합니다. Electrical I/O가 그 속도를 따라가지 못하면 GPU가 아무리 빨라도 System은 Connectivity를 기다리게 됩니다. Optical I/O는 이 I/O Bottleneck을 해결하기 위해 Photonics를 Compute Silicon 자체의 일부로 끌어들이는 기술이며, 상용화에 성공한다면 AI Accelerator와 Network의 경계를 크게 바꿀 수 있습니다.

curiouszip

curiouszip
Tech Layers를 운영하는 에디터입니다. AI 반도체, 데이터센터, 첨단 패키징, 네트워크 기술처럼 복잡하지만 산업의 방향을 결정짓는 기술들을 조사하고, 이를 누구나 이해할 수 있는 언어로 풀어 쓰는 작업을 하고 있습니다.
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.