BER이란? AI 네트워크에서 Bit Error가 중요한 이유
AI Network에서 800G나 1.6T라는 숫자는 매우 화려합니다. 하지만 Network가 아무리 빠르게 데이터를 보내도 중간에서 Bit가 틀리면 실제 Application은 그 Bandwidth를 그대로 사용할 수 없습니다.
예를 들어 GPU가 다른 GPU로 Model Data를 전송했는데 일부 Bit가 잘못 전달된다면 단순히 숫자 하나가 틀리는 것으로 끝나지 않을 수 있습니다. Packet이 다시 전송되거나 Link Recovery가 발생하고, Collective Communication이 늦어지며 전체 GPU Job의 Tail Latency가 증가할 수 있습니다.
그래서 High-speed Digital Link에서는 단순 Speed만큼 중요한 지표가 BER(Bit Error Rate)입니다.
BER: 전송된 전체 Bit 가운데 잘못 수신된 Bit의 비율을 나타내는 지표입니다.
예를 들어 BER가 10^-12라면 통계적으로 약 1조 Bit당 1bit의 Error가 발생하는 수준을 의미합니다. 하지만 Link Speed가 수백 Gbps까지 올라가면 1조 Bit는 생각보다 빠르게 지나갑니다.
즉 AI Network에서는 매우 작은 Error Rate도 대규모 System 전체에서는 빈번한 Event가 될 수 있습니다.
BER를 먼저 한눈에 보면
| 항목 | 의미 |
| BER | 전체 전송 Bit 중 Error Bit의 비율입니다 |
| Pre-FEC BER | FEC로 Error를 수정하기 전 Raw Link BER입니다 |
| Post-FEC BER | FEC를 적용한 뒤 남은 Error 수준입니다 |
| BER Tester | Known Pattern을 보내고 Error Bit를 직접 측정하는 Test 장비입니다 |
| 주요 원인 | Noise, Jitter, Signal Loss, Crosstalk, Reflection 등입니다 |
| AI에서 중요한 이유 | Error Recovery가 GPU Communication Delay와 Job Completion Time에 영향을 줄 수 있기 때문입니다 |
BER는 단순한 Lab Measurement가 아니라 실제 AI Cluster Reliability와 연결됩니다.
10^-12 같은 숫자는 왜 필요한가요?
BER가 10^-6이라면 100만 Bit당 하나의 Error가 발생하는 수준입니다.
1Gbps Link라면 매우 자주 Error가 나타납니다. 반면 10^-12는 훨씬 낮은 Error Rate입니다.
하지만 800Gbps Link에서는 1초에 8,000억 Bit가 이동합니다. 여러 Lane과 수천 개 Link가 동시에 동작하면 System 전체에서 전송되는 Bit 수는 엄청납니다.
그래서 개별 Link에서 매우 낮은 BER를 달성해야 Cluster 전체 Reliability를 유지할 수 있습니다.
AI Data Center 규모가 커질수록 작은 확률 × 엄청난 Link 수 × 긴 운영시간이 문제를 만듭니다.
PAM4가 BER를 더 어렵게 만드는 이유
NRZ는 두 Voltage Level을 사용합니다.
PAM4는 네 Level을 사용합니다.
같은 Voltage Range 안에서 Level이 더 촘촘해지기 때문에 Noise와 Jitter에 대한 Margin이 줄어듭니다. 따라서 같은 Channel 조건이라면 PAM4는 NRZ보다 Raw BER가 높아질 수 있습니다.
PCIe 6.0이 좋은 사례입니다. PCI-SIG는 PCIe 6.0이 64GT/s PAM4로 전환하면서 FLIT Mode에서 약 10^-6 수준의 Raw BER 환경을 고려하고, Lightweight FEC와 Strong CRC를 이용해 Reliability를 유지하도록 Architecture를 바꿨다고 설명합니다.
즉 Speed를 두 배로 올리기 위해 Signaling 방식을 바꾸자 Error Detection과 Correction 구조까지 Protocol에 들어온 것입니다.
Pre-FEC BER와 Post-FEC BER는 다릅니다
High-speed Optical Network에서 BER를 볼 때 반드시 구분해야 하는 것이 Pre-FEC와 Post-FEC입니다.
Pre-FEC BER: FEC Decoder가 Error를 수정하기 전에 Physical Link가 만들어내는 Raw Bit Error Rate입니다.
Post-FEC BER: FEC가 수정 가능한 Error를 처리한 뒤 최종적으로 남아 있는 Bit Error Rate입니다.
Modern PAM4 Link는 Raw Signal을 완벽하게 만들기보다 일정 수준의 Error를 허용하고 FEC가 이를 수정하도록 설계됩니다.
따라서 Pre-FEC BER가 0이 아니라고 해서 Link가 실패한 것이 아닙니다. 중요한 것은 FEC의 Correction Capability 안에 Error가 들어오고 최종 Post-FEC Reliability가 System Requirement를 만족하는지입니다.
이 변화는 Network Design 철학 자체가 바뀌었다는 뜻입니다.
왜 Error를 0으로 만들지 않고 FEC로 고칠까요?
Physical Channel을 Error 0에 가깝게 만들려면 매우 큰 Signal Margin이 필요합니다.
더 강한 Transmitter, 더 좋은 Cable, 더 많은 Equalization, 더 낮은 Data Rate를 사용할 수 있습니다. 하지만 Cost와 Power가 증가합니다.
반대로 약간의 Raw Error를 허용하면 더 높은 Bandwidth를 현실적인 Channel에서 사용할 수 있습니다.
그래서 Modern High-speed Link는 Physical Layer와 Error Correction을 함께 최적화합니다.
즉 FEC는 Signal Integrity가 실패해서 넣는 임시방편이 아니라 PAM4 High-speed Architecture의 핵심 일부입니다.
BER는 어떤 원인으로 나빠질까요?
Signal Integrity에서 다룬 대부분의 문제가 BER로 이어집니다.
Insertion Loss가 커지면 Eye가 닫히고 Receiver Decision Margin이 줄어듭니다. Crosstalk가 증가하면 Noise가 커집니다. Reflection이 발생하면 Symbol Shape가 왜곡됩니다. Jitter가 커지면 Sampling Timing Margin이 줄어듭니다.
Temperature와 Power Supply Noise도 영향을 줄 수 있습니다.
즉 BER는 여러 Physical Problem이 최종적으로 Digital Error로 나타난 결과입니다.
그래서 BER Measurement를 통해 Link의 실제 Health를 확인할 수 있습니다.
BER Tester는 무엇을 할까요?
BERT(Bit Error Rate Tester): 미리 알고 있는 High-speed Test Pattern을 Transmitter 쪽에서 보내고 Receiver가 받은 Data와 비교해 Error Bit를 측정하는 Test Instrument입니다.
High-speed SerDes를 Validation할 때 단순히 Oscilloscope Eye Diagram만 보는 것으로 부족합니다.
Eye가 좋아 보여도 장시간 Error가 발생할 수 있기 때문입니다.
BERT는 PRBS(Pseudo-Random Binary Sequence) 같은 Pattern을 매우 오랫동안 전송해 실제 Error Probability를 측정합니다.
Data Rate가 높아질수록 짧은 시간에 엄청난 Bit를 보낼 수 있지만 목표 BER가 매우 낮아지면 충분한 Statistical Confidence를 얻기 위해 장시간 Test가 필요할 수 있습니다.
BER와 Eye Diagram은 어떤 차이가 있을까요?
Eye Diagram은 Signal Margin을 시각적으로 보여줍니다.
BER는 실제 Error를 숫자로 측정합니다.
Eye가 열려 있다고 BER가 자동으로 특정 수준 이하라고 단정할 수는 없습니다. 반대로 BER가 좋다고 해서 Channel Margin이 충분하다고 말하기도 어렵습니다.
그래서 High-speed Validation에서는 Eye·Jitter Analysis와 BER Test를 함께 사용합니다.
AI Network가 224G·448G로 올라갈수록 Measurement Complexity도 높아지는 이유입니다.
왜 AI Cluster에서는 한 Link의 BER가 전체 문제로 커질까요?
GPU Cluster 하나에 Link가 매우 많다고 생각해보겠습니다.
GPU와 NIC 사이 PCIe Link가 있고 NIC와 Switch 사이 Ethernet Link가 있으며 Switch 사이 Spine·Leaf Optical Link가 있습니다.
각 Link의 Error Probability가 매우 작더라도 수십만 개의 Link가 24시간 동작하면 일부 Link에서 Error Event가 발생할 가능성은 커집니다.
더 중요한 문제는 AI Job이 Synchronization-heavy Workload라는 점입니다.
Collective Communication 중 한 GPU의 Packet이 늦으면 다른 GPU들도 다음 단계로 넘어가지 못할 수 있습니다.
따라서 AI Network에서는 평균 Link BER뿐 아니라 Error가 Job Tail Latency와 Availability에 미치는 영향이 중요합니다.
Error가 발생하면 무슨 일이 생길까요?
Protocol에 따라 다릅니다.
Ethernet에서는 FEC가 먼저 일부 Error를 수정합니다. 수정할 수 없는 Error가 남으면 Frame CRC에서 Error를 감지하고 Packet이 Drop될 수 있습니다. 상위 Transport에서 Retransmission이 발생할 수 있습니다.
PCIe에서는 Link-level Retry와 CRC, FEC가 사용됩니다.
문제는 Error Recovery가 Bandwidth와 Latency를 사용한다는 것입니다.
Error가 아주 드물면 영향이 작지만 특정 Cable이나 Optical Module이 열화돼 Error가 반복되면 Retransmission이 급증하면서 Effective Bandwidth가 떨어질 수 있습니다.
즉 BER는 Reliability 지표이면서 동시에 Performance 지표이기도 합니다.
FEC Corrected Error가 늘어나는 것도 중요한 신호입니다
Post-FEC Error가 아직 0에 가까워도 Pre-FEC Error가 계속 증가할 수 있습니다.
FEC는 이를 계속 수정해 Application에는 문제가 보이지 않을 수 있습니다.
하지만 Correction Count가 증가한다는 것은 Link Margin이 줄어들고 있다는 뜻일 수 있습니다.
그래서 Modern Network Telemetry에서는 FEC Correctable Error와 Uncorrectable Error를 모니터링합니다.
Optical Module Aging, Fiber 문제, Connector Contamination, Temperature 변화 등을 조기에 발견할 수 있기 때문입니다.
AI Cluster에서 Predictive Maintenance가 중요해지는 이유입니다.
BER는 Optical Link에서도 핵심입니다
Optical Network에서는 Laser Power, Modulator Quality, Fiber Loss, Receiver Sensitivity와 Optical Noise가 BER에 영향을 줍니다.
800G·1.6T Optical Module은 PAM4와 고속 DSP를 사용하기 때문에 Pre-FEC BER Monitoring이 중요합니다.
Optical Module이 완전히 실패하기 전에 BER Margin이 천천히 악화될 수 있습니다.
Hyperscaler는 이런 Telemetry를 이용해 문제가 큰 Link를 사전에 교체하거나 Traffic을 우회할 수 있습니다.
즉 Optical Networking의 경쟁력도 단순 Port Speed가 아니라 Error Visibility와 Fleet-level Reliability까지 포함하게 됩니다.
BER가 낮다고 무조건 좋은 설계는 아닙니다
극단적으로 낮은 Raw BER를 만들기 위해 Transmitter Power를 높이고 더 비싼 DSP와 Cable을 사용하면 System Cost와 Power가 증가합니다.
반대로 FEC Capability 안에서 적절한 Raw BER를 허용하면 더 효율적인 Link를 만들 수 있습니다.
따라서 Engineering 목표는 BER를 무조건 0으로 만드는 것이 아니라 Total System Cost와 Power 안에서 필요한 Post-FEC Reliability를 달성하는 것입니다.
이것이 LPO 같은 Architecture에서도 중요한 논쟁입니다.
DSP를 줄이면 Power는 낮아질 수 있지만 Link Margin과 BER 관리가 더 어려워질 수 있습니다.
LPO와 BER는 직접 연결됩니다
20번에서 본 LPO는 Optical Module 내부 Retimer DSP를 줄이고 Host SerDes가 End-to-end Equalization을 더 많이 담당합니다.
DSP가 줄면 Power와 Latency는 낮아질 수 있지만 Channel Variation에 대응할 Margin도 줄어듭니다.
따라서 LPO가 성공하려면 다양한 Temperature와 Cable, Vendor 조합에서도 Pre-FEC BER가 FEC Correction Range 안에 안정적으로 들어와야 합니다.
즉 LPO Adoption의 핵심은 단순 Power Saving이 아니라 BER Margin을 얼마나 안정적으로 확보할 수 있는가입니다.
CPO도 BER와 Reliability가 중요합니다
CPO는 Optical Engine을 Switch ASIC 가까이 가져와 Electrical Channel을 짧게 만듭니다.
이는 Signal Integrity와 Power에는 유리하지만 Optical Engine이 고가의 Switch Package와 더 밀접하게 연결됩니다.
따라서 Optical Engine Failure와 BER Degradation을 얼마나 빨리 감지하고 서비스할 수 있는지가 중요합니다.
CPO가 대규모 AI Data Center에 들어갈수록 Link Telemetry와 Reliability Test도 핵심 Value Layer가 됩니다.
PCIe 6.0의 BER 변화가 중요한 이유
PCIe는 오랫동안 매우 낮은 Raw BER를 요구했습니다.
하지만 64GT/s PAM4로 올라가면서 PCI-SIG는 10^-6 수준의 Raw BER 환경을 고려하는 FLIT/FEC Architecture를 도입했습니다.
이것은 중요한 변화입니다.
Server 내부 I/O도 Network Optical Link와 비슷하게 완벽한 Physical Signal을 만드는 방식에서 Error를 Coding으로 관리하는 방식으로 이동하고 있기 때문입니다.
GPU와 NIC, CXL Memory가 모두 PCIe 6 기반으로 연결되면 FEC와 BER Telemetry가 Server 내부에서도 더 중요한 운영정보가 됩니다.
BER는 Test Equipment 시장과도 연결됩니다
224G·448G SerDes가 나오면 Transmitter와 Receiver를 검증할 Instrument도 더 빨라져야 합니다.
BERT는 더 높은 Symbol Rate와 PAM4 Pattern을 생성하고 Error를 측정해야 합니다. Oscilloscope는 더 넓은 Bandwidth와 낮은 Noise Floor가 필요합니다.
Optical Test에서도 Optical Receiver와 Reference Transmitter가 차세대 Lane Speed를 지원해야 합니다.
즉 AI Network Speed Upgrade는 Semiconductor뿐 아니라 Measurement Infrastructure의 Upgrade Cycle을 만들 수 있습니다.
투자 관점에서는 BER 자체보다 Reliability Complexity를 봐야 합니다
BER가 올라간다고 특정 회사가 자동으로 돈을 버는 것은 아닙니다.
중요한 것은 더 빠른 Link를 안정적으로 만들기 위해 어떤 Component와 Software가 추가되는지입니다.
| Layer | BER 문제와 연결되는 기술 |
| SerDes | Equalization·CDR·Receiver DSP |
| Retimer | Signal Regeneration |
| Optical DSP | FEC·Equalization·Telemetry |
| Cable / Connector | Channel Loss 감소 |
| Switch / NIC | FEC Counters·Retransmission·Telemetry |
| Test | BERT·Oscilloscope·Compliance Validation |
즉 BER는 AI Connectivity에서 Reliability Content가 증가하는 이유를 설명하는 핵심 지표입니다.
앞으로 볼 것은 Pre-FEC Telemetry입니다
대규모 AI Cluster에서는 Link가 완전히 죽은 뒤 대응하는 방식이 비효율적입니다.
Pre-FEC Error Count가 서서히 올라가는 Link를 미리 찾아 교체하거나 Traffic을 우회하는 Predictive Operation이 중요합니다.
따라서 Switch, NIC, Optical Module과 Retimer가 얼마나 상세한 Link Health Telemetry를 제공하는지가 경쟁력이 될 수 있습니다.
두 번째는 224G·1.6T Interoperability입니다
1.6T Optical Ecosystem이 커지려면 여러 Vendor Module과 Switch, NIC가 동일한 BER Margin 안에서 안정적으로 동작해야 합니다.
초기 세대에서는 Lab에서는 동작하지만 특정 Vendor 조합에서 Error Margin이 부족한 문제가 발생할 수 있습니다.
Interop Test와 Compliance Maturity가 Volume Adoption을 결정하는 중요한 요소입니다.
세 번째는 FEC Overhead와 Latency입니다
강한 FEC를 사용하면 Error Correction Capability는 좋아지지만 Encoding·Decoding Logic과 Latency, Power가 증가할 수 있습니다.
따라서 다음 세대 Network에서는 더 높은 Raw BER를 허용하면서도 낮은 Latency로 Correction하는 Coding Architecture가 중요합니다.
이것이 FEC가 독립적인 핵심기술로 이어지는 이유입니다.
핵심 정리
| 질문 | 답 |
| BER란? | 전체 전송 Bit 중 잘못 수신된 Bit의 비율입니다 |
| 왜 AI Network에서 중요한가요? | Link 수와 Data Volume이 매우 커 작은 Error Probability도 Cluster 성능과 Reliability에 영향을 줄 수 있기 때문입니다 |
| Pre-FEC BER란? | FEC로 수정하기 전 Raw Link Error Rate입니다 |
| Post-FEC BER란? | FEC Correction 이후 남은 Error 수준입니다 |
| PAM4와 어떤 관계인가요? | PAM4는 Voltage Margin이 작아 Raw BER 관리가 더 어렵습니다 |
| Error가 발생하면? | FEC Correction, Packet Drop, Retry와 Retransmission으로 Bandwidth와 Latency가 영향을 받을 수 있습니다 |
| 투자포인트는? | FEC·Telemetry·Retimer·Optical DSP·High-speed Test Complexity 증가입니다 |
BER는 숫자가 매우 작아서 중요하지 않아 보일 수 있습니다. 하지만 AI Infrastructure에서는 작은 Error Probability가 엄청난 Data Rate와 Link 수를 만나면서 큰 운영문제로 바뀝니다.
800G·1.6T Network와 PCIe 6가 모두 PAM4를 사용하면서 Industry는 Physical Layer를 Error 0으로 만드는 대신 일정 Raw Error를 허용하고 Coding과 Retransmission을 이용해 Reliability를 확보하는 방향으로 이동하고 있습니다.
결국 다음 질문은 명확합니다. Raw Signal에서 Error가 어느 정도 발생하는 것을 허용한다면 그 Error를 어떻게 빠르고 적은 Latency로 수정할 것인가입니다.
그 역할을 하는 기술이 바로 FEC입니다.
curiouszip
댓글 0
첫 댓글을 남겨보세요.