CXL 4.0이란? 128GT/s Memory Fabric이 AI 서버를 어떻게 바꿀까
CXL이 처음 등장했을 때 가장 쉽게 이해할 수 있는 Use Case는 Memory Expansion이었습니다. CPU의 DDR Channel 밖에 CXL Memory Device를 연결해 Server Capacity를 늘리는 방식입니다.
하지만 CXL의 장기목표는 여기서 끝나지 않습니다.
여러 CPU와 GPU, Memory Device를 Rack 단위 Fabric으로 연결하고 Compute와 Memory를 독립적으로 확장하는 Composable Infrastructure로 발전하려 합니다.
Fabric이 커질수록 더 높은 Bandwidth와 더 많은 Port, 더 긴 Reach와 강한 RAS가 필요합니다.
이를 위해 CXL Consortium이 2025년 11월 공개한 Specification이 CXL 4.0입니다.
CXL 4.0: PCIe 7.0 Physical Layer를 기반으로 Data Rate를 128GT/s로 높이고 Bundled Ports, Native x2, 최대 4 Retimer 지원, Memory RAS와 Security 기능을 강화한 차세대 Compute Express Link Specification입니다.
CXL 3.x의 64GT/s에서 다시 두 배로 빨라졌습니다.
하지만 CXL 4.0의 의미를 단순히 “CXL이 두 배 빨라졌다”로 보면 중요한 변화의 절반밖에 보지 못합니다.
CXL 4.0을 먼저 한눈에 보면
| 항목 | CXL 3.x | CXL 4.0 |
| Physical Base | PCIe 6 | PCIe 7 |
| Data Rate | 64GT/s | 128GT/s |
| Signaling | PAM4 | PAM4 |
| FLIT/FEC | 지원 | 기존 구조 유지·확장 |
| Native Link Width | 기존 Width 중심 | Native x2 추가 |
| Retimer | 제한된 Reach 지원 | 최대 4 Retimer 지원 |
| Multi-port Accelerator | 기존 방식 | Bundled Ports 추가 |
| Memory RAS | 지원 | PPR·Sparing 등 강화 |
| 핵심 방향 | Fabric 확장 | 더 높은 Bandwidth와 더 큰 Heterogeneous Fabric |
CXL 4.0은 CXL을 단순 Memory Expansion Bus에서 대규모 AI Resource Fabric으로 확장하기 위한 규격이라고 볼 수 있습니다.
왜 128GT/s가 필요할까요?
CXL Memory를 하나 추가하는 단계에서는 64GT/s도 상당한 Bandwidth입니다.
하지만 여러 GPU와 CPU가 하나의 Memory Pool을 공유하면 이야기가 달라집니다.
Host 수가 늘어나고 CXL Switch 뒤에 여러 Memory Device가 연결되면 Aggregate Traffic이 매우 커집니다.
특히 AI Inference에서 KV Cache, Embedding, Model State와 Large Memory Dataset을 Fabric을 통해 이동시키려면 Link Bandwidth가 중요한 병목이 될 수 있습니다.
CXL 4.0은 Lane당 Data Rate를 두 배로 높여 같은 Lane 수에서 더 많은 Memory Traffic을 처리할 수 있도록 합니다.
CXL 4.0은 PCIe 7 Physical Layer를 사용합니다
PCI-SIG는 PCIe 7.0 Specification 1.0을 2025년 6월 발표했습니다.
PCIe 7은 128GT/s PAM4를 사용합니다.
CXL 4.0은 이 Physical Layer를 기반으로 CXL.cache와 CXL.mem Semantics를 유지합니다.
즉 PCIe 7 SerDes, Retimer와 Test Ecosystem이 발전하면 CXL 4 Hardware Development에도 직접 도움이 됩니다.
이 구조는 CXL이 PCIe Ecosystem의 규모를 활용할 수 있는 큰 장점입니다.
128GT/s에서도 PAM4를 유지합니다
CXL 4는 새로운 Modulation으로 다시 바꾸는 대신 PAM4를 유지하고 Nyquist Frequency를 두 배로 높입니다.
CXL Consortium은 CXL 4.0이 128GT/s에서 PAM4와 FLIT 기반 FEC·CRC Architecture를 CXL 3.x에서 이어받는다고 설명합니다.
즉 CXL 3.x에서 만든 Protocol Architecture를 유지하면서 PHY Frequency를 높이는 방식입니다.
하지만 Channel Loss는 훨씬 어려워집니다.
CXL Consortium Q&A에서는 128GT/s PAM4 Channel에서 약 -36dB 수준의 Channel Loss Budget과 매우 높은 Raw Error 환경을 고려합니다.
그래서 Reach Extension이 CXL 4의 중요한 Design Issue가 됩니다.
최대 4 Retimer가 왜 중요할까요?
CXL 4.0은 하나의 Link Path에서 최대 4개의 Retimer를 지원할 수 있도록 확장합니다.
이는 128GT/s Electrical Signal을 현실적인 Server·Rack Topology에서 사용하려면 중간 Signal Regeneration이 더 중요해졌다는 의미입니다.
Retimer를 여러 개 넣으면 Channel을 여러 짧은 Segment로 나눌 수 있습니다.
하지만 Power와 Latency도 추가됩니다.
따라서 “4개까지 지원한다”는 것이 실제 System에 항상 4개를 넣는다는 뜻은 아닙니다.
Architecture Designer가 Reach와 Latency를 Trade-off할 수 있는 선택지를 넓힌 것입니다.
Native x2 Width는 왜 추가됐을까요?
기존 High-speed Interface는 x4·x8·x16 같은 비교적 넓은 Link를 많이 사용했습니다.
하지만 Rack-scale Fabric에서는 많은 Endpoint를 연결하는 Fan-out이 중요합니다.
Native x2: CXL 4.0에서 두 Lane만 사용하는 더 좁은 Native Link Width를 지원해 하나의 Host나 Switch에서 더 많은 Device를 연결할 수 있게 하는 기능입니다.
Device 하나가 매우 큰 Bandwidth를 필요로 하지 않는다면 x2 Link를 여러 개 구성해 Port Count를 늘릴 수 있습니다.
즉 CXL 4는 Bandwidth만 높이는 것이 아니라 Fabric Connectivity Density까지 개선하려 합니다.
Bundled Ports가 CXL 4의 중요한 변화입니다
CXL 4.0의 가장 흥미로운 기능 중 하나가 Bundled Ports입니다.
Bundled Ports: 여러 개의 Physical CXL Port를 하나의 Logical Device Connection처럼 묶어 더 높은 Aggregate Bandwidth와 Flexible Connectivity를 제공하는 기능입니다.
특히 Type 1·Type 2 Accelerator 같은 Device에서 여러 Physical Link를 동시에 사용하면서 Software에는 하나의 Accelerator처럼 보이도록 할 수 있습니다.
CXL Consortium은 각 Bundle에 최소 하나의 Full-capability Standard Port가 있고 추가 Streamlined Port가 Data Movement를 담당할 수 있도록 정의합니다.
즉 내부 Silicon은 여러 Port로 Bandwidth를 늘리면서 Software Enumeration Model을 복잡하게 만들지 않는 것이 목표입니다.
Bundled Ports를 Memory Module 여러 개 묶는 기능으로 보면 안 됩니다
이 기능을 단순히 여러 CXL Memory Expander를 하나로 묶는 기술이라고 설명하면 부정확합니다.
Bundled Ports의 핵심 Use Case는 Multi-port Device, 특히 Accelerator 쪽입니다.
Device가 하나의 Logical Entity로 보이면서 여러 Physical Link를 사용해 Bandwidth를 늘릴 수 있습니다.
Memory Fabric에도 Architecture 영향은 있지만 “Type 3 Memory Pool 여러 개를 묶는 기능”으로 단순화하면 안 됩니다.
이 구분이 중요합니다.
왜 AI Accelerator에 여러 CXL Port가 필요할까요?
GPU와 XPU의 Compute 성능과 Memory Bandwidth가 빠르게 증가하고 있습니다.
CXL을 통해 External Memory나 Shared Resource에 접근하려면 x16 Link 하나로도 부족한 상황이 생길 수 있습니다.
Physical Port를 여러 개 사용하면 Bandwidth를 늘릴 수 있지만 Software에서 여러 Device처럼 보이면 Programming이 복잡해집니다.
Bundled Ports는 Hardware Bandwidth를 Scale하면서 Software에는 하나의 Device Model을 유지하려는 방식입니다.
즉 CXL이 Peripheral Bus에서 Accelerator Fabric으로 확장되는 신호입니다.
CXL 4.0의 Memory RAS도 크게 강화됩니다
CXL Memory가 Production에 들어갈수록 Performance만큼 Reliability가 중요합니다.
CXL 4는 Memory Maintenance와 RAS 기능을 강화합니다.
PPR(Post Package Repair): DRAM Package가 출하된 뒤 발견된 Faulty Row를 Spare Resource로 교체해 Memory Device Reliability를 높이는 기능입니다.
Memory Sparing: 문제가 발생하거나 열화된 Memory 영역을 Spare Capacity로 대체하는 방식입니다.
Patrol Scrub: Memory를 주기적으로 읽어 Error를 찾고 Correctable Error를 미리 수정하는 Background RAS 기능입니다.
CXL 4.0은 이런 Memory Event Reporting과 Host-initiated Maintenance를 강화합니다.
Memory가 Rack-scale Shared Resource가 되면 DIMM 한 개보다 더 높은 Availability Requirement가 필요하기 때문입니다.
RAS가 더 중요해지는 이유는 Failure Domain이 커지기 때문입니다
Local DIMM이 실패하면 Server 한 대가 영향을 받을 수 있습니다.
하지만 Shared CXL Memory Pool이 여러 Host에 Capacity를 제공한다면 Memory Device나 Switch Failure가 여러 Server에 영향을 줄 수 있습니다.
따라서 Pooling으로 Utilization을 높이는 대신 Failure Domain이 커집니다.
CXL 4의 RAS 강화는 단순 Enterprise Feature가 아니라 Memory Disaggregation을 실제 Production에 넣기 위한 필수조건입니다.
Security도 강화됩니다
CXL Fabric에는 여러 Host와 Device가 연결될 수 있습니다.
Memory Data가 External Link를 이동하기 때문에 Confidentiality와 Integrity가 중요합니다.
CXL은 IDE(Integrity and Data Encryption)를 통해 Link-level Data Protection을 지원합니다.
CXL 4 Generation에서는 Fabric 규모와 Multi-host Architecture가 커지면서 Security Requirement도 더 중요해집니다.
Memory Fabric이 Network처럼 커질수록 Network Security와 비슷한 Isolation 문제가 Memory Layer에도 생깁니다.
CXL 4는 Optical Connectivity도 고려합니다
128GT/s Electrical Link의 Reach는 매우 어렵습니다.
Retimer를 최대 4개까지 지원해 Copper Reach를 늘릴 수 있지만 Rack-to-rack과 더 긴 Fabric에서는 Power와 Cable Density 문제가 생깁니다.
CXL Consortium은 CXL 4.0 Q&A에서 Optical Connectivity를 Retimer를 통해 구현하는 방식을 설명합니다.
즉 Electrical CXL Link를 Retimer에서 복원하고 Optical Engine으로 연결한 뒤 반대편에서 다시 Electrical CXL로 변환할 수 있습니다.
CXL Protocol 자체는 유지됩니다.
이것이 33번에서 다룬 Optical CXL로 이어집니다.
Optical을 쓴다고 Ethernet이 되는 것은 아닙니다
Fiber는 Physical Medium일 뿐 Protocol이 아닙니다.
CXL Traffic을 Optical Link로 전달해도 Memory Semantics는 CXL입니다.
Ethernet RDMA와는 다른 Architecture입니다.
CXL은 낮은 Latency의 Load/Store Memory Fabric을 목표로 하고 Ethernet·RDMA는 더 넓은 Network Scale에서 Data Movement를 처리합니다.
거리와 Latency Requirement에 따라 두 Technology가 서로 다른 Resource Layer를 담당할 가능성이 높습니다.
CXL 4 Hardware는 2026년에 바로 대량 출하될까요?
그렇지 않습니다.
Specification은 2025년 11월 공개됐지만 128GT/s PHY와 CXL 4 Controller·Switch를 실제 Silicon으로 구현하고 Validation하는 데 시간이 필요합니다.
2026년 현재 CXL Hardware 시장의 실제 Product는 CXL 2.0과 CXL 3.x가 중심입니다.
Marvell Structera S 20256은 CXL 2.0 Commercial Product이고 S 30260은 PCIe 6/CXL 3.x로 2026년 3분기 Sampling 계획입니다.
Samsung MD310도 CXL 3.2/PCIe 6 Generation입니다.
즉 Specification은 CXL 4까지 갔지만 Revenue Hardware는 CXL 2·3.x에서 발생하는 Timing Gap이 있습니다.
투자 관점에서 이 Timing Gap이 매우 중요합니다
새 Specification이 발표되면 관련기업 주가 Theme가 먼저 움직일 수 있습니다.
하지만 실제 Revenue는 IP 개발, Tape-out, Sample, Interoperability, Customer Qualification, Production의 순서를 거칩니다.
CXL 4는 지금 당장 Memory Module Revenue를 크게 만드는 기술이라기보다 다음 Silicon Design Cycle을 시작하는 규격입니다.
따라서 투자자는 “CXL 4 지원”이라는 발표와 실제 Product Shipment를 구분해야 합니다.
가장 먼저 돈을 벌 수 있는 Layer는 IP와 EDA일 수 있습니다
Specification이 나오면 Semiconductor 업체는 먼저 Controller와 PHY를 설계해야 합니다.
Synopsys는 CXL 4 Controller IP와 PCIe 7 PHY, Verification IP를 제공하며 128GT/s, Bundled Port와 최대 4 Retimer Architecture를 지원하는 방향을 공개하고 있습니다.
Cadence도 2026년 CXL 4 Verification IP를 공개해 128GT/s와 Bundled Port Verification을 지원합니다.
즉 End Product가 나오기 전에도 IP License와 Verification Tool에서 Revenue Opportunity가 먼저 생길 수 있습니다.
이것이 Semiconductor Standard의 일반적인 Monetization 순서입니다.
Test Equipment도 Silicon보다 먼저 움직일 수 있습니다
128GT/s PAM4 Device를 만들려면 Transmitter와 Receiver Compliance를 먼저 검증해야 합니다.
PCIe 7 Physical Layer를 사용하는 CXL 4는 High-speed Oscilloscope, BERT와 Compliance Software가 필요합니다.
Keysight 등 Test 업체는 이미 PCIe 7 128GT/s Receiver Test Solution을 확대하고 있습니다.
다만 이를 곧바로 “CXL 4 Revenue”라고 부르는 것은 조심해야 합니다.
PCIe 7 Test가 CXL 4 PHY Development에도 사용될 수 있다는 인접 수혜로 보는 것이 정확합니다.
Switch와 Controller 업체는 그다음 단계입니다
Marvell, Astera Labs 같은 Connectivity Semiconductor 업체가 CXL 4 Switch와 Controller를 개발하려면 IP와 PHY가 먼저 안정돼야 합니다.
제품 Announcement 후에도 Customer Sample과 Qualification까지 시간이 걸립니다.
따라서 2026년 투자에서는 CXL 4 Product를 가정하기보다 현재 CXL 3.x Design Win과 Production Ramp를 먼저 보는 것이 현실적입니다.
CXL 4는 장기 Product Roadmap의 방향을 보여주는 신호입니다.
Memory 업체도 CXL 4만 보고 투자하면 안 됩니다
Samsung, SK hynix, Micron은 CXL Memory Module을 개발하고 있습니다.
하지만 현재 Commercial Opportunity는 CXL 2.0과 3.x Module에서 먼저 발생합니다.
CXL 4가 128GT/s가 됐다고 DRAM Demand가 즉시 두 배가 되는 것도 아닙니다.
CXL의 목적 중 하나가 Memory Utilization을 높이는 것이기 때문에 Overprovisioned DRAM을 줄일 수도 있습니다.
따라서 Memory Vendor 수혜는 AI Memory Capacity Growth와 Pooling Efficiency의 균형으로 봐야 합니다.
CXL 4와 HBM은 여전히 보완관계입니다
CXL 4 Bandwidth가 두 배로 올라가도 HBM Bandwidth와 Latency를 대체하는 것은 아닙니다.
GPU HBM은 Compute Core 바로 옆에서 수 TB/s급 Bandwidth를 제공합니다.
CXL Memory는 훨씬 낮은 Bandwidth와 높은 Latency를 갖지만 더 큰 Capacity와 Flexible Pooling을 제공합니다.
AI Inference에서는 HBM에 Hot Working Set을 두고 CXL Memory에 KV Cache나 Warm Data 일부를 배치하는 Hierarchy가 가능할 수 있습니다.
즉 CXL 4의 역할은 HBM 대체가 아니라 Capacity Tier를 더 빠르고 유연하게 만드는 것입니다.
CXL 4는 Rack-scale AI Inference에서 더 중요할 수 있습니다
Training은 GPU-to-GPU Scale-up·Scale-out Bandwidth가 핵심입니다.
Inference는 Memory Capacity와 Data Movement의 중요성이 더 커질 수 있습니다.
큰 Model을 여러 Accelerator에 분산하고 KV Cache를 Shared Resource로 관리한다면 External Memory Fabric의 가치가 올라갑니다.
CXL 4의 128GT/s와 Multi-port Accelerator 기능은 이런 Disaggregated Inference Architecture에 더 잘 맞을 수 있습니다.
다만 Software가 실제로 이런 Memory Tier를 효율적으로 활용해야 합니다.
NUMA 문제는 사라지지 않습니다
CXL Memory가 하나의 Address Space로 보인다고 모든 Memory Latency가 같아지는 것은 아닙니다.
Local DRAM, Local CXL Device, Switch 뒤의 Remote CXL Memory는 각각 Latency가 다를 수 있습니다.
NUMA(Non-Uniform Memory Access): Memory 위치에 따라 Access Latency와 Bandwidth가 달라지는 Architecture입니다.
CXL Fabric이 커질수록 NUMA Topology도 더 복잡해질 수 있습니다.
OS와 Runtime이 Data를 적절한 Memory에 배치하지 못하면 128GT/s Bandwidth가 있어도 Performance를 제대로 활용하지 못할 수 있습니다.
Software가 CXL 4 성공의 핵심입니다
Hardware Bandwidth가 두 배가 되는 것보다 더 어려운 문제일 수 있습니다.
Memory Tiering, Fabric Manager, Page Migration, Accelerator Memory Allocation과 Security Policy가 필요합니다.
Application이 CXL Memory의 높은 Latency를 고려해 Data Structure를 배치해야 할 수도 있습니다.
따라서 CXL Adoption은 CPU·Memory Vendor뿐 아니라 Linux Kernel, Hypervisor와 Cloud Software Ecosystem의 성숙도에 달려 있습니다.
CXL 4 Value Chain을 보면 누가 먼저 돈을 벌지 보입니다
| 단계 | 주요 역할 | 기업 사례 |
| Specification | Standard 정의 | CXL Consortium |
| IP / EDA | Controller·PHY·Verification | Synopsys, Cadence 등 |
| Test | 128GT/s Compliance | Test Equipment 업체 |
| Switch / Controller | CXL Silicon | Marvell, Astera Labs 등 |
| Memory Module | DRAM Capacity | Samsung, SK hynix, Micron 등 |
| Retimer / Cable | Reach 확장 | Astera Labs, Marvell 등 |
| Optical | Rack-to-rack CXL | Optical Ecosystem |
| Software | Tiering·Fabric Management | OS·Cloud Platform 업체 |
이 순서를 보면 CXL 4 투자에서 Specification 발표 직후와 대규모 Data Center Deployment 사이에 여러 Revenue Stage가 존재한다는 것을 알 수 있습니다.
앞으로 첫 번째로 볼 것은 CXL 4 Controller IP Tape-out입니다
EDA 업체의 IP Announcement 다음에는 실제 Fabless와 CPU Vendor가 CXL 4 Controller를 Silicon에 넣는 단계가 필요합니다.
Design Start와 Tape-out Signal이 늘어나면 CXL 4 Ecosystem이 Paper Spec에서 Hardware로 이동하고 있다는 의미입니다.
두 번째는 PCIe 7 PHY Maturity입니다
CXL 4의 128GT/s는 PCIe 7 PHY에 의존합니다.
Receiver Margin, Retimer Interop와 Connector·PCB Ecosystem이 안정돼야 합니다.
PCIe 7 Server Deployment가 늦어지면 CXL 4도 같이 늦어질 수 있습니다.
세 번째는 CXL 3.x의 성공 여부입니다
CXL 4 Adoption을 예측하는 가장 좋은 선행지표는 CXL 3.x입니다.
CXL 3.x Memory Pooling과 Switch가 실제 고객에게 의미 있는 TCO Benefit을 만들지 못한다면 고객이 더 비싼 128GT/s CXL 4로 빠르게 이동할 이유도 줄어듭니다.
따라서 Marvell Structera S 30260과 차세대 CXL Memory Module의 실제 Deployment가 중요합니다.
네 번째는 Bundled Ports Use Case입니다
CXL 4의 차별화 기능이 실제 Accelerator Design에 사용되는지 확인해야 합니다.
GPU·XPU Vendor가 여러 CXL Port를 하나의 Device로 묶어 External Memory Bandwidth를 확장한다면 CXL이 Accelerator Fabric에서 훨씬 중요한 역할을 하게 됩니다.
반대로 Memory Expansion에만 머문다면 Bundled Ports의 경제적 영향은 제한적일 수 있습니다.
다섯 번째는 Optical CXL입니다
128GT/s에서 Copper Reach와 Retimer Power가 부담이 되면 Optical CXL의 필요성이 커집니다.
PCIe 6 over Optics Demo가 실제 CXL 4 Optical Product로 발전하는지, Latency와 Power가 Memory Workload 요구를 만족하는지가 중요한 장기 신호입니다.
Optical이 들어오면 CXL Value Chain은 Switch와 DRAM에서 Silicon Photonics·Optical Engine까지 확대됩니다.
핵심 정리
| 질문 | 답 |
| CXL 4.0이란? | 128GT/s PCIe 7 PHY를 기반으로 Bandwidth·Connectivity·Memory RAS를 강화한 차세대 CXL Specification입니다 |
| 언제 발표됐나요? | 2025년 11월 CXL Consortium이 Specification을 공개했습니다 |
| CXL 3.x보다 무엇이 빨라졌나요? | Link Data Rate가 64GT/s에서 128GT/s로 두 배 증가했습니다 |
| Bundled Ports란? | 여러 Physical CXL Port를 하나의 Logical Device Connection처럼 묶어 Accelerator Bandwidth를 확장하는 기능입니다 |
| Native x2는 왜 필요한가요? | 적은 Lane으로 더 많은 Endpoint를 연결해 Fabric Fan-out을 높이기 위해서입니다 |
| Retimer는 몇 개까지 지원하나요? | CXL 4.0은 최대 4 Retimer를 지원해 Channel Reach 선택지를 늘립니다 |
| 2026년에 CXL 4 제품이 대량 출하되나요? | 아직 아닙니다. 현재 Commercial Hardware는 CXL 2.0·3.x가 중심이고 CXL 4는 IP·Design 단계가 앞섭니다 |
| 투자포인트는? | IP→Test→Silicon→Memory→Optical 순서의 Monetization과 CXL 3.x 실제 Adoption을 함께 봐야 합니다 |
CXL 4.0의 핵심은 단순히 “CXL이 두 배 빨라졌다”가 아닙니다.
128GT/s, Native x2와 Bundled Ports, 더 긴 Retimer Reach와 Memory RAS가 함께 들어간 이유는 CXL이 Point-to-point Memory Expansion을 넘어 Rack-scale Heterogeneous Memory Fabric으로 커지려 하기 때문입니다.
하지만 2026년 현재 시장에서는 Specification과 Revenue Timing을 구분해야 합니다. CXL 4는 다음 Silicon Cycle을 시작했지만 실제 Data Center에는 CXL 2.0 Memory Expansion과 CXL 3.x Switch·Controller가 먼저 들어가고 있습니다.
따라서 지금 가장 중요한 것은 CXL 4라는 이름 자체보다 CXL 3.x가 실제 Production에서 Memory Pooling의 경제성을 증명하는가입니다.
그리고 CXL Fabric이 Rack보다 더 멀리 확장되면 다시 Physical Connectivity 문제가 나타납니다. 128GT/s Electrical Signal을 여러 Retimer로 연결하는 데는 Power와 Reach 한계가 있습니다.
결국 CXL의 다음 질문은 Memory Fabric을 Copper가 버티는 거리 너머까지 어떻게 확장할 것인가입니다.
그 답으로 등장하는 기술이 Optical CXL입니다.
curiouszip
댓글 0
첫 댓글을 남겨보세요.