광트랜시버란? AI 데이터센터에서 하는 역할 쉽게 이해하기
AI 데이터센터의 Network를 보면 Switch와 Server 사이에 Fiber Cable이 수없이 연결돼 있습니다. 그런데 Fiber 자체만으로는 GPU나 Switch가 Data를 주고받을 수 없습니다. GPU와 Switch는 Electrical Signal을 처리하고, Fiber는 Optical Signal을 전달하기 때문입니다. 이 두 세계를 연결하는 장치가 Optical Transceiver, 광트랜시버입니다.
Optical Transceiver: Network Device의 Electrical Signal을 Optical Signal로 변환해 Fiber로 보내고, 반대편에서 들어온 Optical Signal을 다시 Electrical Signal로 바꾸는 송수신 Module입니다.
이 부품은 크기가 작아 보이지만 AI 데이터센터에서는 매우 중요합니다. GPU Cluster가 커질수록 Switch Port가 늘어나고, Port Speed가 400G에서 800G와 1.6T로 올라가면서 Transceiver의 수량과 기술 Content가 동시에 증가하기 때문입니다.
광트랜시버를 한눈에 보면
| 구성 | 역할 |
| Host Electrical Interface | Switch·NIC에서 Electrical Data를 받음 |
| DSP | Signal Equalization, FEC 관련 Processing, Gearbox 등을 수행 |
| Driver / TIA | Optical Transmitter·Receiver와 Electrical Circuit을 연결 |
| Laser | Optical Carrier를 생성 |
| Modulator | Laser Light에 Data를 실음 |
| Photodetector | 받은 빛을 Electrical Signal로 변환 |
| Optical Coupling | Fiber와 Optical Engine을 연결 |
| Controller | Module 상태, Temperature, Power, Diagnostics 관리 |
실제 Module Architecture는 Standard와 Vendor에 따라 다르지만 핵심은 Electrical Domain과 Optical Domain을 양방향으로 연결한다는 것입니다.
왜 그냥 Copper Cable로 연결하지 않을까요?
짧은 거리에서는 Copper가 더 유리할 수 있습니다. DAC(Direct Attach Copper)는 구조가 단순하고 Power가 낮으며 Optical Conversion이 필요 없습니다. Rack 내부의 짧은 Link라면 AEC(Active Electrical Cable)를 이용해 더 긴 Reach를 확보할 수도 있습니다.
하지만 거리가 길어지고 Data Rate가 높아지면 Copper는 무겁고 굵어지며 Signal Loss가 커집니다. 800G와 1.6T Link를 여러 Rack 사이에 대량으로 배치하려면 Cable Density와 Reach 문제가 커집니다. 이 영역에서 Fiber와 Optical Transceiver의 장점이 커집니다.
따라서 AI Data Center에서는 Copper와 Optical이 서로 완전히 대체하는 관계가 아니라 거리와 Bandwidth에 따라 역할을 나누는 구조가 일반적입니다.
400G, 800G, 1.6T는 무엇을 의미할까요?
400G Transceiver는 초당 400Gbps, 800G는 800Gbps, 1.6T는 1.6Tbps 수준의 Aggregate Data Rate를 의미합니다. 실제 내부에서는 여러 개의 Electrical Lane과 Optical Lane을 묶어 이 속도를 만듭니다.
예를 들어 800G Module은 100G급 또는 200G급 Lane을 여러 개 사용해 전체 800Gbps를 구성할 수 있고, 1.6T 세대에서는 200G-class Lane이 중요해집니다. Lane 수를 줄이면서 Port Bandwidth를 높이려면 한 Lane이 더 빠르게 동작해야 하고, 그만큼 SerDes와 Optical Component의 난도가 높아집니다.
그래서 800G에서 1.6T로의 전환은 단순히 “속도가 두 배”가 아닙니다. DSP, SerDes, Modulator, Photodetector, Laser, Connector와 Test Equipment가 함께 세대교체되는 과정입니다.
왜 AI가 Optical Transceiver 수요를 크게 늘릴까요?
일반 Cloud Service에서는 User가 Server로 Data를 보내고 결과를 받아가는 North-South Traffic이 중요했습니다. AI Training에서는 GPU와 GPU가 계속 Data를 교환하는 East-West Traffic이 훨씬 커집니다.
수천 개 GPU가 AllReduce나 All-to-All Communication을 수행하려면 Server와 Switch, Switch와 Switch 사이에 많은 High-speed Link가 필요합니다. GPU 수가 늘어날수록 단순히 Server 수만 늘어나는 것이 아니라 Network Port와 Optical Link도 함께 늘어납니다.
또 GPU당 Scale-out Bandwidth가 높아지면 같은 GPU 수에서도 더 빠른 Transceiver가 필요합니다. 따라서 AI Optical Market은 GPU 개수와 GPU당 Network Bandwidth가 동시에 성장하는 구조를 갖습니다.
Form Factor는 왜 중요할까요?
Optical Transceiver는 Switch Front-panel의 제한된 공간에 들어가야 합니다. 대표적인 Form Factor로 QSFP-DD와 OSFP 등이 사용됩니다.
Port Speed가 높아지면 Module Power와 Heat도 증가합니다. Switch 한 대에 수십 개 Module이 꽂히면 Front-panel에서 상당한 Heat가 발생하고 Airflow를 방해할 수 있습니다. 그래서 800G와 1.6T 시대에는 Module 크기, Thermal Design, Connector Density가 중요한 System Issue가 됩니다.
이 문제는 결국 LPO와 CPO로 이어집니다. Pluggable Module 내부 DSP Power를 줄이려는 것이 LPO이고, Optical Engine 자체를 Switch ASIC 가까이 옮기는 것이 CPO입니다.
DSP는 광트랜시버 안에서 무엇을 할까요?
DSP(Digital Signal Processor): 고속 Electrical·Optical Signal의 왜곡을 보정하고 Lane 변환, Equalization, FEC 관련 Processing 등을 수행하는 Signal Processing Semiconductor입니다.
High-speed Transceiver에서는 Signal이 PCB와 Optical Channel을 지나면서 완벽한 형태를 유지하지 못합니다. DSP는 수신된 Signal을 분석해 원래 Data를 복원하고, 송신 쪽에서도 Channel 특성에 맞게 Signal을 보정합니다.
DSP가 강력할수록 다양한 Host ASIC과 PCB, Optical Component 환경에서 안정적인 Link를 만들기 쉽습니다. 반면 DSP는 전력을 소비하고 Latency를 추가합니다. 그래서 AI Network에서는 DSP의 안정성을 유지하면서 Power를 줄이는 방법이 중요한 기술경쟁이 됩니다.
LPO가 등장한 이유도 DSP Power 때문입니다
LPO(Linear Pluggable Optics): Pluggable Module 내부의 Full DSP Retiming 기능을 제거하거나 크게 줄이고 Host Switch ASIC의 SerDes와 Signal Processing 능력을 활용하는 저전력 Optical Architecture입니다.
기존 Retimed Transceiver는 Module 자체가 Electrical Signal을 다시 복원하므로 Interoperability와 Link Margin이 좋지만 Power가 높습니다. LPO는 DSP를 줄여 Power와 Latency를 낮출 수 있지만 Host-to-module Channel Quality와 Vendor간 Tuning이 더 중요해집니다.
즉 Optical Transceiver 시장은 단순히 400G에서 800G로 속도만 올라가는 것이 아니라 Retimed, LRO, LPO, CPO 같은 Architecture 경쟁으로 발전하고 있습니다.
DR, FR, LR은 무엇이 다를까요?
Optical Transceiver 이름에는 DR, FR, LR 같은 표현이 자주 등장합니다. 기본적으로 Reach와 Optical Architecture를 구분하는 용어입니다.
DR 계열은 Data Center 내부의 비교적 짧은 Single-mode Fiber 연결에 많이 사용되고, FR은 더 긴 Reach, LR은 그보다 더 긴 거리에서 사용되는 경우가 많습니다. 다만 정확한 거리와 Lane 구성은 Ethernet Standard와 Module Specification에 따라 달라지므로 제품명만 보고 일률적으로 판단하면 안 됩니다.
AI Scale-out Network에서는 Rack과 Row 사이의 수십 m에서 수백 m 연결이 많아 DR 계열 Optical Link가 중요하고, Data Center Campus나 Building 사이를 연결할 때는 더 긴 Reach의 Optics가 필요할 수 있습니다.
Multimode와 Single-mode Fiber도 구분해야 합니다
Multimode Fiber는 짧은 거리에서 비용효율적인 연결에 사용되지만 고속·장거리로 갈수록 Modal Dispersion의 영향을 받습니다. Single-mode Fiber는 더 긴 거리와 높은 Bandwidth에 유리해 Hyperscale Data Center와 AI Network에서 중요성이 높습니다.
Silicon Photonics와 WDM을 활용하는 Data Center Optics도 주로 Single-mode Fiber와 결합되는 경우가 많습니다. Network Architecture를 볼 때 Transceiver Speed만 아니라 Fiber Type과 Reach를 같이 봐야 하는 이유입니다.
광트랜시버의 Power가 왜 데이터센터 문제로 커질까요?
Port당 Optical Module의 Power가 몇 W 또는 수십 W 수준이라고 하면 GPU에 비해 작아 보일 수 있습니다. 하지만 Switch 한 대에 수십 개, Data Center 전체에 수만 개 Module이 들어가면 누적 Power는 매우 커집니다.
더 중요한 것은 Module이 Front-panel에 밀집해 있어 Heat Density가 높다는 점입니다. Module에서 발생한 열을 빼기 위해 Fan Power가 늘어날 수도 있고, Switch Thermal Design이 복잡해집니다.
그래서 AI Optical Network에서는 단순한 Gbps보다 Watts per Port와 pJ/bit가 중요한 경쟁지표가 됩니다. 1.6T로 가면서 Power가 두 배 이상 늘어난다면 Network Efficiency가 좋아졌다고 보기 어렵습니다.
BER과 FEC도 Transceiver의 핵심 성능입니다
BER(Bit Error Rate): 전송한 Bit 중 잘못 수신된 Bit의 비율입니다.
고속 PAM4 Signal은 NRZ보다 Noise Margin이 작기 때문에 Raw BER가 높아질 수 있습니다. 따라서 Optical Module과 Host ASIC은 FEC(Forward Error Correction)를 이용해 일정 수준의 오류를 복구합니다.
중요한 것은 FEC가 있다고 Link Quality가 중요하지 않은 것이 아니라는 점입니다. Pre-FEC BER가 너무 높으면 FEC가 교정할 수 있는 범위를 넘어가고 Link가 불안정해질 수 있습니다. 따라서 AI Cluster에서는 Optical Module의 BER와 FEC Margin, Link Flap이 System Uptime에 직접 연결됩니다.
Reliability가 AI Cluster에서 더 중요해지는 이유
AI Training Job은 수시간이 아니라 수일 또는 수주 동안 실행될 수 있습니다. 수만 개의 Optical Link 중 일부가 반복적으로 Flap하거나 Error를 발생시키면 Collective Communication 성능이 떨어지고 Job 자체가 영향을 받을 수 있습니다.
그래서 Hyperscaler는 Transceiver의 Peak Speed뿐 아니라 Field Failure Rate, Temperature Stability, Link Diagnostics, Firmware Update와 Telemetry를 중요하게 봅니다. Optical Module 업체가 단순 Hardware Vendor가 아니라 Network Operations Data를 제공하는 Infrastructure Vendor로 변하는 이유입니다.
누가 돈을 벌 수 있을까요?
Optical Transceiver Value Chain은 여러 Layer로 나뉩니다. Module Vendor는 완제품을 조립하고, Optical DSP 업체는 Signal Processing Chip을 공급하며, Silicon Photonics와 InP 업체는 Optical Engine과 Laser 관련 Component를 만듭니다. Connector와 Fiber 업체, Packaging과 Test 업체도 필요합니다.
Broadcom과 Marvell은 Optical DSP와 SerDes에서 강점을 보유하고 있으며 Silicon Photonics와 CPO까지 확장하고 있습니다. Credo는 DSP와 Low-power Optics, AEC를 함께 공급하며 AI Connectivity 전반을 공략합니다. Coherent, Lumentum 등 Optical Component 업체는 Laser와 Photonic Component 생태계에서 중요한 역할을 합니다.
투자 관점에서는 “광통신 관련주”라는 큰 범주보다 어느 업체가 800G에서 1.6T로 넘어갈 때 더 많은 Dollar Content를 확보하는가를 보는 것이 중요합니다.
1.6T 전환에서 확인할 포인트
첫 번째는 200G-class Optical Lane의 Yield와 Cost입니다. Lane Speed가 높아져도 Module 가격과 Power가 과도하게 올라가면 Adoption이 늦어질 수 있습니다.
두 번째는 1.6T Module의 Thermal입니다. Switch Front-panel에서 수십 개 1.6T Module을 안정적으로 운영하려면 Cooling과 Power Delivery가 중요합니다.
세 번째는 LPO와 Retimed Optics의 비중입니다. 저전력 Architecture가 얼마나 실제 Production Network에서 Reliability를 증명하는지 확인해야 합니다.
네 번째는 CPO가 Pluggable Market의 어느 영역을 가져가는지입니다. CPO Adoption이 빨라지면 일부 High-end Switch에서는 Front-panel Transceiver 수요구조가 달라질 수 있습니다.
핵심 정리
| 질문 | 답 |
| 광트랜시버란? | Electrical Signal과 Optical Signal을 서로 변환해 Fiber 통신을 가능하게 하는 Module입니다 |
| 왜 AI에서 중요할까요? | GPU Cluster의 East-West Traffic과 Network Port 수가 급증하기 때문입니다 |
| 800G·1.6T는 무엇인가요? | Module 하나가 처리할 수 있는 Aggregate Network Bandwidth Generation입니다 |
| DSP는 왜 필요한가요? | High-speed Signal의 왜곡을 보정하고 안정적인 Link를 만들기 위해 사용됩니다 |
| 가장 큰 문제는 무엇인가요? | Power, Thermal, BER, Reliability와 Cost입니다 |
| Copper를 대체하나요? | 긴 거리와 높은 Bandwidth에서는 Optical이 유리하지만 짧은 거리는 Copper가 계속 사용됩니다 |
| 투자포인트는? | 800G·1.6T Volume, 200G/lane, DSP·Laser Content, LPO·CPO 전환입니다 |
광트랜시버는 AI GPU만큼 화려한 부품은 아니지만 AI Cluster가 커질수록 반드시 함께 늘어나야 하는 Infrastructure입니다. GPU가 많아질수록 Network Port가 늘고, GPU당 Bandwidth가 올라갈수록 Port Speed도 높아집니다.
따라서 AI Optical Market의 핵심은 단순히 Data Center가 늘어난다는 사실보다 Accelerator당 필요한 Network Bandwidth와 Optical Content가 동시에 증가하고 있다는 점입니다. 이 흐름이 800G에서 1.6T로 이어지면서 Optical DSP, Silicon Photonics, Laser, CPO까지 하나의 Value Chain으로 연결되고 있습니다.
curiouszip
댓글 0
첫 댓글을 남겨보세요.