본문 바로가기
Tech Layers | Under the chip Tech Layers | Under the chip
Complex tech, simply unpacked.

Memory Wall이란? AI GPU가 빨라져도 메모리가 병목이 되는 이유

curiouszip

GPU 성능을 이야기할 때 가장 먼저 보는 숫자는 FLOPS입니다. Tensor Core가 얼마나 많은 연산을 할 수 있는지, FP8이나 FP4에서 몇 PFLOPS를 제공하는지가 눈에 띕니다. 하지만 실제 AI Workload가 항상 GPU의 Peak FLOPS를 그대로 사용하는 것은 아닙니다.

연산할 Data를 GPU Core에 충분히 빠르게 공급하지 못하면 Compute Unit은 기다리게 됩니다. 아무리 빠른 계산기가 있어도 필요한 숫자가 계속 늦게 도착하면 전체 작업속도는 빨라지지 않습니다.

Memory Wall: Processor의 연산성능이 Memory의 Bandwidth와 Latency 개선속도보다 빠르게 증가하면서, System Performance가 Compute보다 Memory Access에 의해 제한되는 현상입니다.

AI 시대에 Memory Wall이 다시 중요해진 이유는 GPU Compute가 폭발적으로 증가했지만 Model Parameter와 Activation, KV Cache도 함께 커졌기 때문입니다. 결국 GPU가 더 빨라질수록 메모리가 GPU를 먹여 살리는 속도가 더 중요해집니다.

Compute와 Memory Bandwidth는 다른 성능입니다

Compute Performance는 GPU가 초당 얼마나 많은 연산을 할 수 있는지를 의미합니다. Memory Bandwidth는 HBM에서 GPU Core로 초당 얼마나 많은 Data를 옮길 수 있는지를 의미합니다.

예를 들어 GPU가 매우 많은 Matrix Multiplication을 수행할 능력이 있어도 매 연산마다 HBM에서 새로운 Data를 읽어야 한다면 HBM Bandwidth가 먼저 포화될 수 있습니다. 반대로 같은 Data를 SRAM이나 Cache에서 여러 번 재사용할 수 있다면 Compute Unit을 더 높은 Utilization으로 사용할 수 있습니다.

이 차이를 이해하기 위해 자주 사용하는 개념이 Arithmetic Intensity입니다.

Arithmetic Intensity: Memory에서 가져온 Byte당 얼마나 많은 연산을 수행하는지를 나타내는 개념입니다. Arithmetic Intensity가 낮은 Workload는 Memory Bandwidth에 민감하고, 높은 Workload는 Compute 성능에 더 민감할 수 있습니다.

Training과 Inference에서 Memory Wall은 다르게 나타납니다

AI Training에서는 대형 Matrix Operation이 많아 Compute Intensity가 높을 수 있습니다. 하지만 여러 GPU 사이 Communication과 Activation, Optimizer State, Parameter Movement가 커지면서 Memory와 Network Bandwidth도 중요합니다.

Inference에서는 특히 Decode Phase가 Memory Bandwidth에 민감할 수 있습니다. Token 하나를 생성할 때 Model Weight와 KV Cache에 반복적으로 접근해야 하는데, Batch가 작거나 Memory Reuse가 충분하지 않으면 Tensor Core보다 HBM Bandwidth가 먼저 병목이 될 수 있습니다.

NVIDIA도 Rubin Architecture 설명에서 Long Context와 Agentic Workload의 Decode 단계에서 Memory Subsystem Performance가 중요한 제약이라고 설명하고 있습니다. Rubin GPU가 HBM4와 함께 최대 22TB/s급 Memory Bandwidth를 제공하도록 설계된 이유도 이 흐름과 연결됩니다.

HBM이 등장한 이유

일반 DDR Memory는 CPU Socket 주변의 DIMM Slot에 배치되고 비교적 좁은 Bus를 높은 Clock으로 동작시킵니다. GPU는 훨씬 더 많은 병렬연산을 수행하기 때문에 더 넓은 Memory Bandwidth가 필요합니다.

HBM(High Bandwidth Memory): 여러 DRAM Die를 수직으로 적층하고 TSV로 연결해 매우 넓은 I/O Bus를 구현한 고대역폭 Memory입니다.

HBM은 GPU Package 가까이에 배치되고 Interposer나 Advanced Packaging을 통해 GPU와 매우 많은 Data Lane으로 연결됩니다. 좁은 Bus를 극단적으로 빠르게 돌리는 대신 매우 넓은 Bus를 사용해 높은 Aggregate Bandwidth와 낮은 Energy per Bit를 얻는 구조입니다.

이 방식이 AI Accelerator에 잘 맞습니다. GPU는 수천 개의 Core가 동시에 Data를 요구하기 때문에 좁은 DDR Channel보다 넓은 HBM Interface가 유리합니다.

HBM3E에서 HBM4로 무엇이 달라질까요?

HBM4는 단순히 HBM3E의 Speed만 높인 제품이 아닙니다. Interface Width가 1024-bit급에서 2048-bit급으로 확대돼 한 Stack에서 훨씬 더 많은 Data를 동시에 이동할 수 있습니다.

Micron의 HBM4는 2048-bit Interface와 11Gbps를 넘는 Pin Speed를 통해 Stack당 2.8TB/s 이상의 Bandwidth를 제공하는 방향으로 공개돼 있습니다. NVIDIA Rubin은 HBM4를 사용해 GPU당 최대 288GB Capacity와 22TB/s Memory Bandwidth를 제시하고 있습니다.

SK hynix도 2026년 HBM4 Mass Shipment를 시작했고 HBM4E Sample까지 주요 고객에게 공급하고 있습니다. HBM 경쟁이 단순 Capacity 경쟁에서 Bandwidth, Power Efficiency, Base Die Logic, Packaging Yield를 모두 포함하는 경쟁으로 이동하고 있다는 의미입니다.

Memory Bandwidth를 높이면 Memory Wall이 사라질까요?

그렇지는 않습니다. GPU Compute도 동시에 더 빨라지기 때문입니다.

HBM Bandwidth가 두 배가 되더라도 GPU Compute가 세 배 증가하면 특정 Workload에서는 Compute-to-memory Ratio가 오히려 더 나빠질 수 있습니다. Model Parameter와 Context Length도 계속 커지고 있습니다.

또 HBM은 매우 비싸고 Package 면적과 Power, Capacity에 한계가 있습니다. 모든 Data를 HBM에 넣을 수 없기 때문에 Local DRAM, CXL Memory, SSD를 포함한 Memory Hierarchy가 중요해집니다.

즉 Memory Wall은 한 세대의 HBM으로 해결되는 문제가 아니라 Compute와 Memory가 발전할 때마다 다시 나타나는 구조적 문제입니다.

Capacity Wall도 함께 봐야 합니다

Bandwidth가 충분해도 Model과 KV Cache가 HBM Capacity에 들어가지 않으면 문제가 생깁니다. GPU당 HBM Capacity를 늘리면 더 큰 Model을 Local Memory에 유지하고 Offload를 줄일 수 있습니다.

Inference에서는 긴 Context와 많은 동시 User가 KV Cache를 크게 만듭니다. HBM Capacity가 부족하면 KV Cache를 DDR이나 CXL Memory, SSD로 내보내야 하고, 이 과정에서 Latency와 Bandwidth Trade-off가 발생합니다.

따라서 AI Memory 문제는 Bandwidth Wall과 Capacity Wall을 동시에 해결해야 하는 문제입니다.

왜 SRAM과 Cache만 크게 만들면 안 될까요?

GPU Chip 안의 SRAM은 HBM보다 훨씬 빠르고 Latency가 낮습니다. 하지만 SRAM Cell은 Die Area를 많이 사용하고 Capacity를 수백 GB까지 늘리기 어렵습니다.

HBM은 SRAM보다 느리지만 훨씬 큰 Capacity를 제공하고, DDR은 더 큰 Capacity를 낮은 Cost로 제공하며, SSD는 더 느리지만 TB 단위 Storage를 제공합니다.

결국 AI System은 여러 Memory Tier를 사용합니다. 가장 자주 사용하는 Data는 Register와 SRAM, 더 큰 Working Set은 HBM, CPU-side Data는 DDR, Capacity Tier는 CXL Memory, Persistent Data는 SSD에 두는 식입니다.

Memory Wall을 해결한다는 것은 하나의 Memory를 무한히 빠르게 만드는 것이 아니라 Data를 올바른 Tier에 배치하고 이동량을 줄이는 것입니다.

Software가 Memory Wall에 영향을 주는 이유

Hardware Bandwidth가 같아도 Software가 Data를 어떻게 배치하느냐에 따라 실제 Performance는 크게 달라집니다.

Kernel Fusion을 통해 중간 Data를 HBM에 쓰고 다시 읽는 과정을 줄일 수 있고, Tiling을 이용해 SRAM에 Data를 오래 유지하면 HBM Traffic을 줄일 수 있습니다. Quantization으로 Weight Size를 줄이면 Memory Bandwidth와 Capacity 부담을 동시에 낮출 수 있습니다.

Attention Algorithm과 KV Cache Management도 Memory Traffic을 줄이는 방향으로 발전합니다. 따라서 AI Hardware 경쟁은 단순 HBM Bandwidth뿐 아니라 Memory를 얼마나 효율적으로 사용하는 Software Stack까지 포함합니다.

MoE는 Network와 Memory Wall을 동시에 만듭니다

MoE(Mixture of Experts) Model은 모든 Token이 모든 Parameter를 사용하는 대신 일부 Expert만 선택해 Compute Efficiency를 높입니다. 하지만 Expert가 여러 GPU에 분산돼 있다면 Token을 다른 GPU로 보내야 하므로 All-to-All Network Traffic이 증가합니다.

또 각 GPU는 자신이 담당하는 Expert Weight와 KV Cache를 Memory에 유지해야 합니다. 따라서 MoE는 Compute를 절약하는 대신 Memory Capacity와 Network Data Movement 부담을 키울 수 있습니다.

이 때문에 최신 AI Platform은 HBM만 빠르게 만드는 것이 아니라 NVLink와 Scale-out Network까지 함께 Bandwidth를 높이고 있습니다.

HBM Bandwidth가 GPU 가격과 연결되는 이유

AI Accelerator에서 HBM은 단순 DRAM Component가 아닙니다. GPU Package Cost의 상당부분을 차지하고, HBM 공급이 부족하면 GPU 출하량 자체가 제한될 수 있습니다.

HBM Stack 수가 늘어나면 Interposer 면적이 커지고 Packaging 난도가 높아집니다. HBM Capacity와 Bandwidth를 늘리려면 Memory Die뿐 아니라 TSV, Microbump, Base Die, Interposer, CoWoS 같은 Advanced Packaging Capacity도 함께 필요합니다.

즉 Memory Wall은 SK hynix·Micron·Samsung 같은 Memory Vendor뿐 아니라 TSMC의 Advanced Packaging과 Packaging Equipment까지 연결되는 산업문제입니다.

HBM4에서 Base Die가 더 중요해지는 이유

HBM Stack의 맨 아래에는 Memory Core Die를 외부 Interface와 연결하는 Base Die가 있습니다. HBM4에서는 Interface가 더 넓어지고 Power Management와 Signal 기능이 복잡해지면서 Base Die Logic의 중요성이 커집니다.

Memory Vendor는 Logic Process와 Foundry Partnership을 통해 Base Die 기능을 강화하려 합니다. 이는 HBM이 단순 DRAM 적층제품에서 Logic과 Memory가 결합된 Heterogeneous Package로 발전하고 있다는 의미입니다.

장기적으로 Custom HBM과 Customer-specific Base Die가 확대되면 GPU Vendor와 Memory Vendor의 Co-design 관계도 더 깊어질 수 있습니다.

Memory Wall과 CXL은 어떻게 연결될까요?

HBM은 최고 Bandwidth Tier이지만 Capacity당 Cost가 높습니다. 모든 AI Data를 HBM에 저장하는 것은 경제적이지 않습니다.

CXL은 CPU와 Accelerator가 더 큰 External Memory Pool에 접근할 수 있도록 합니다. HBM보다 Latency와 Bandwidth는 불리하지만 DDR Capacity를 GPU와 Server가 더 유연하게 활용할 수 있습니다.

따라서 미래 AI Server에서는 HBM이 Hot Data와 High-bandwidth Working Set을 담당하고, CXL Memory가 Capacity Expansion과 Warm Data Tier를 담당하는 구조가 확대될 수 있습니다.

Memory Wall이 HBM만의 이야기가 아니라 전체 Memory Hierarchy Architecture의 문제인 이유입니다.

주요 기업은 어떻게 봐야 할까요?

SK hynix는 HBM3E에서 HBM4로 이어지는 Production Leadership과 Packaging Yield, MR-MUF가 중요한 경쟁력입니다. 2026년에는 HBM4 Mass Shipment와 HBM4E Sample까지 다음 세대로 이동하고 있습니다.

Micron은 HBM3E와 HBM4에서 Power Efficiency와 Capacity, Advanced TSV를 강조하며 시장점유율 확대를 노립니다. Samsung 역시 HBM와 Foundry, Advanced Packaging을 동시에 보유해 Integration 측면의 잠재력이 있습니다.

NVIDIA와 AMD는 HBM을 구매하는 Customer이면서 Memory Architecture를 결정하는 Platform 업체입니다. GPU당 HBM Stack 수와 Interface, Capacity가 Memory Vendor의 Revenue와 Packaging 수요를 직접 결정합니다.

TSMC는 CoWoS를 통해 GPU와 HBM을 하나의 Package로 연결합니다. HBM 수요가 늘어도 Advanced Packaging Capacity가 부족하면 완성된 AI GPU를 출하하기 어렵습니다.

투자 관점에서 볼 포인트

첫 번째는 HBM Bit Growth보다 Stack과 Package Mix입니다. HBM4와 16-high 같은 고부가 제품 비중이 늘면 같은 Bit Growth보다 Revenue Impact가 클 수 있습니다.

두 번째는 Customer Qualification과 Yield입니다. HBM은 Performance가 좋아도 GPU Vendor Qualification을 통과하고 안정적으로 대량생산해야 매출이 발생합니다.

세 번째는 CoWoS와 Advanced Packaging Capacity입니다. Memory Wafer만 충분해도 Packaging Bottleneck이 있으면 Shipment가 제한될 수 있습니다.

네 번째는 GPU당 Memory Capacity와 Bandwidth입니다. GPU Architecture가 HBM Stack 수와 Capacity를 늘리면 Memory Content per Accelerator가 증가합니다.

다섯 번째는 CXL과 Memory Tiering입니다. HBM 가격이 너무 높아지면 고객이 일부 Capacity를 DDR·CXL로 이동시킬 수 있어 Memory Mix와 System Architecture가 달라질 수 있습니다.

핵심 정리

질문
Memory Wall이란?Processor 연산성능이 Memory Bandwidth·Latency보다 빠르게 증가해 Memory Access가 System Bottleneck이 되는 현상입니다
AI에서 왜 심해지나요?GPU Compute와 Model Size, KV Cache, Collective Data가 동시에 빠르게 커지기 때문입니다
HBM이 해결책인 이유는?매우 넓은 Interface를 통해 높은 Bandwidth와 낮은 Energy per Bit를 제공하기 때문입니다
HBM4의 핵심 변화는?2048-bit급 Interface와 더 높은 Bandwidth, Logic Base Die와 Packaging Complexity 확대입니다
HBM만 늘리면 해결되나요?아닙니다. Capacity·Cost 한계 때문에 DDR, CXL, SSD와 Memory Hierarchy가 필요합니다
투자포인트는?HBM4 Qualification·Yield, GPU당 HBM Content, Advanced Packaging, CXL Memory Tiering입니다

Memory Wall을 이해하면 왜 AI Semiconductor 산업에서 HBM의 중요성이 GPU 못지않게 커졌는지 알 수 있습니다. GPU Core를 더 많이 넣는 것만으로는 성능이 올라가지 않습니다. Core가 계산할 Data를 충분히 빠르게 공급해야만 추가된 Compute가 실제 Performance로 바뀝니다.

이 때문에 AI Memory 경쟁은 HBM Bandwidth, Capacity, Power Efficiency뿐 아니라 TSV, Interposer, CoWoS, CXL까지 확장됩니다. Memory Wall은 하나의 Memory Chip 문제가 아니라 AI Compute 전체의 Data Movement Architecture를 결정하는 출발점입니다.

curiouszip

curiouszip
Tech Layers를 운영하는 에디터입니다. AI 반도체, 데이터센터, 첨단 패키징, 네트워크 기술처럼 복잡하지만 산업의 방향을 결정짓는 기술들을 조사하고, 이를 누구나 이해할 수 있는 언어로 풀어 쓰는 작업을 하고 있습니다.
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.