본문 바로가기
Tech Layers | Under the chip Tech Layers | Under the chip
Complex tech, simply unpacked.

인터포저란? GPU와 HBM 사이에 필요한 이유

curiouszip

AI GPU Package를 보면 거대한 GPU Die 옆에 여러 개의 HBM Stack이 아주 가까이 붙어 있습니다. 겉으로는 Chip을 나란히 배치한 것처럼 보이지만, 실제로는 GPU와 HBM 사이에 수천 개의 신호를 매우 짧고 촘촘하게 연결해야 합니다. HBM의 장점은 일반 DDR보다 훨씬 넓은 Memory Interface를 통해 높은 Bandwidth를 확보하는 데 있는데, 이 넓은 Interface를 일반적인 PCB 수준의 배선으로 연결하면 면적과 Signal Integrity, Power에서 감당하기 어려운 문제가 생깁니다.

Interposer: 여러 Semiconductor Die 사이에 매우 높은 Density의 Electrical Interconnect를 제공하는 중간 Wiring Layer입니다. AI Accelerator에서는 GPU나 XPU와 HBM 사이를 짧고 넓게 연결해 HBM이 가진 Bandwidth를 실제 Compute Die가 사용할 수 있도록 만드는 핵심 Packaging Component입니다.

Interposer가 중요한 이유는 HBM 자체가 아무리 빨라도 GPU와 HBM 사이의 길이 충분히 넓지 않으면 Memory Bandwidth를 사용할 수 없기 때문입니다. HBM 시대에는 Memory Chip 성능과 함께 Package 안의 Data Highway가 얼마나 넓고 짧은가가 Accelerator 성능을 결정합니다.

먼저 한눈에 보면

구분일반 PCB / Package SubstrateInterposer
주 역할Package와 Board 연결Die와 Die 사이 Fine-pitch 연결
배선 Density상대적으로 낮음매우 높음
주요 거리Package 외부·Board 수준Package 내부의 짧은 거리
HBM 연결 적합성제한적매우 적합
대표 방식Organic SubstrateSilicon, RDL, Local Silicon Interconnect
AI와의 관계PCIe·Power·Board 연결GPU·HBM·Chiplet 고밀도 연결

Interposer와 Package Substrate를 같은 것으로 생각하기 쉽지만 역할이 다릅니다. Interposer는 GPU와 HBM 같은 Die 사이에 매우 Fine한 Wiring을 제공하고, Package Substrate는 완성된 Package를 Motherboard와 연결하며 전원과 외부 I/O를 더 넓은 Pitch로 전달합니다.

왜 HBM은 Interposer가 필요할까요?

HBM은 여러 DRAM Die를 TSV로 수직 적층한 Memory입니다. Stack 내부에서는 TSV가 수직 Data Path를 만들지만, HBM Stack과 GPU 사이에서는 별도의 수평 연결이 필요합니다. 이때 HBM의 매우 넓은 I/O Interface를 GPU까지 짧게 연결해야 합니다.

일반 DDR은 상대적으로 좁은 Bus를 더 높은 Clock으로 동작시키는 방식에 가깝습니다. 반면 HBM은 수많은 I/O를 병렬로 사용하는 Wide I/O Architecture입니다. 이런 Interface는 Wiring 수가 많기 때문에 배선 Pitch가 크고 길이가 길어지면 Package 면적과 전력, Signal Integrity 부담이 크게 증가합니다.

Interposer는 GPU와 HBM 바로 아래에 Fine-pitch Metal Routing을 제공해 수많은 I/O를 짧은 거리에서 연결합니다. 따라서 HBM의 높은 Bandwidth는 DRAM Stack 하나만의 성능이 아니라 TSV와 Interposer, Micro-bump, Package Routing이 함께 만들어내는 System 성능입니다.

Silicon Interposer는 왜 그렇게 많이 쓰였을까요?

Silicon Interposer: Silicon Wafer Process를 이용해 매우 Fine한 Metal Wiring과 TSV를 구현한 Interposer입니다.

Silicon은 Semiconductor Lithography와 Metal Process를 사용할 수 있기 때문에 Organic Substrate보다 훨씬 Fine한 Wiring Pitch를 구현할 수 있습니다. GPU와 여러 HBM Stack 사이에 수천 개의 신호를 배치해야 하는 AI Accelerator에서는 이 Routing Density가 매우 큰 장점입니다.

TSMC CoWoS-S가 대표적인 Silicon Interposer 기반 2.5D Packaging입니다. TSMC는 CoWoS-S에서 큰 Silicon Interposer 위에 Logic Chiplet과 HBM Cube를 배치하고 고밀도 Interconnect로 연결합니다. 현재 CoWoS-S Silicon Interposer는 최대 3.3배 Reticle 수준까지 확장돼 대형 HPC Package를 지원합니다.

이 구조의 장점은 명확합니다. GPU와 HBM 사이의 Wiring을 짧게 만들 수 있고, Fine Pitch로 매우 많은 I/O를 연결하며, Signal과 Power Integrity를 높은 수준으로 설계할 수 있습니다.

그런데 Silicon Interposer를 계속 크게 만들면 문제가 생깁니다

AI Accelerator는 Compute Die가 커지고 HBM Stack 수가 늘어나면서 Package 면적이 계속 확대되고 있습니다. 문제는 Silicon Interposer도 그만큼 커져야 한다는 점입니다.

Semiconductor Lithography에는 한 번에 노광할 수 있는 면적이 있습니다. 이를 Reticle Limit라고 합니다. Interposer는 Logic Die와 달리 여러 Reticle 영역을 Stitching해 더 크게 만들 수 있지만, 면적이 커질수록 Wafer 사용량과 Manufacturing Complexity, Yield, Cost가 증가합니다.

또 Silicon은 Organic Material보다 상대적으로 비싸고 큰 면적에서 Mechanical Stress와 Warpage를 관리해야 합니다. GPU, HBM, Silicon Interposer, Organic Substrate의 Thermal Expansion 특성이 서로 다르기 때문에 온도가 변할 때 Package가 휘거나 Joint에 Stress가 집중될 수 있습니다.

즉 AI Chip이 커질수록 “더 큰 Silicon Interposer를 만들면 된다”는 접근의 경제성이 떨어질 수 있습니다. 그래서 Industry는 RDL Interposer와 Local Silicon Interconnect 같은 다른 구조를 함께 발전시키고 있습니다.

RDL Interposer는 무엇이 다른가요?

RDL(Redistribution Layer): Copper와 Polymer 기반의 Fine Wiring Layer를 이용해 Chip I/O 위치를 재배치하고 Die 사이를 연결하는 Packaging Technology입니다.

TSMC CoWoS-R은 거대한 Silicon Interposer 대신 RDL Interposer를 사용합니다. TSMC는 CoWoS-R을 2023년부터 Volume Production하고 있으며, RDL Interposer가 상대적으로 유연해 큰 Package에서 CTE mismatch와 C4 Joint Stress를 완화하는 데 도움이 된다고 설명합니다.

RDL은 Silicon Interposer보다 Fine Routing Density가 낮을 수 있지만 대형 Package를 경제적으로 확장하는 데 장점이 있습니다. 따라서 모든 AI Accelerator에 같은 Interposer를 사용하는 것이 아니라 필요한 I/O Density와 Package Size, Cost에 따라 다른 구조를 선택할 수 있습니다.

CoWoS-L은 왜 등장했을까요?

CoWoS-L은 RDL과 Local Silicon Interconnect를 결합합니다. Package 전체를 거대한 Silicon Interposer로 만드는 대신 정말 Fine Pitch가 필요한 Die 사이 구간에만 Silicon을 배치하고 나머지는 RDL로 연결하는 방식입니다.

TSMC는 이를 LSI(Local Silicon Interconnect)와 RDL 기반 Architecture로 설명합니다. 첫 3.5배 Reticle Size CoWoS-L은 2024년부터 Volume Production에 들어갔습니다.

이 방식의 핵심은 Silicon의 장점과 RDL의 장점을 절충하는 것입니다. GPU·Chiplet 사이처럼 매우 높은 Density가 필요한 부분에는 Local Silicon을 사용하고, 전체 Package 면적은 RDL로 넓게 확장해 Cost와 Mechanical Constraint를 줄입니다.

AI Accelerator가 한 개의 거대한 Monolithic Die가 아니라 여러 Compute Chiplet, I/O Die, HBM Stack으로 구성될수록 이런 Local Interconnect Architecture의 중요성이 커질 수 있습니다.

Interposer는 단순 Data Wiring만 담당하지 않습니다

고성능 AI Package에서는 Power Delivery도 중요합니다. GPU는 매우 높은 Current를 소비하고 HBM 역시 안정적인 전원과 Ground가 필요합니다. Interposer와 Package Substrate에는 Data Signal뿐 아니라 Power와 Ground Network도 함께 설계해야 합니다.

고속 신호에서는 Return Path와 Ground Shielding도 중요합니다. Fine-pitch Routing이 촘촘해질수록 Crosstalk과 Impedance Control, Power Noise 문제가 더 어려워집니다. 따라서 Interposer 설계는 “선을 많이 그리는 것”이 아니라 Signal Integrity와 Power Integrity를 동시에 최적화하는 작업입니다.

TSMC는 CoWoS-S에 Embedded Deep Trench Capacitor를 활용해 High-performance Compute Package의 Power Delivery를 보완하고 있습니다. AI Chip의 전력이 높아질수록 Decoupling과 Power Delivery Network도 Packaging 경쟁력의 일부가 됩니다.

HBM4에서는 Interposer 부담이 더 커집니다

HBM4는 HBM3E보다 Interface Width가 더 넓어지고 대역폭도 크게 증가하는 방향입니다. NVIDIA Rubin GPU는 HBM4를 사용하며 GPU당 288GB, 최대 22TB/s Memory Bandwidth를 제시하고 있습니다. 이런 Memory 성능을 실제 GPU가 사용하려면 Package 내부에서 더 많은 Data를 안정적으로 움직여야 합니다.

HBM Stack 수와 I/O가 늘면 Interposer Routing Density가 높아지고 Package 면적도 커질 수 있습니다. 동시에 GPU Compute 성능과 Power가 올라가면서 Thermal과 Power Integrity 요구도 강화됩니다.

즉 HBM4 전환은 DRAM 세대교체만이 아닙니다. HBM4의 성능을 받아낼 수 있는 Interposer, Bump, Substrate와 Packaging Process까지 함께 세대교체해야 하는 변화입니다.

Interposer와 Chiplet은 왜 함께 이야기될까요?

Chiplet Architecture에서는 하나의 큰 Logic Die를 여러 작은 Die로 나눕니다. 그러면 Package 안에서 연결해야 하는 Die 수가 늘어납니다.

Compute Chiplet끼리 빠르게 통신해야 하고, 각 Chiplet이 HBM이나 I/O Die와도 연결돼야 합니다. 따라서 Chiplet을 사용하면 Interposer의 필요성이 줄어드는 것이 아니라 오히려 Package 내부 Interconnect가 더 중요해질 수 있습니다.

미래 AI Accelerator는 GPU 또는 XPU Chiplet, HBM4 Stack, I/O Chiplet, Optical I/O Chiplet까지 하나의 Package에 들어갈 가능성이 있습니다. 이 경우 Interposer는 단순 Memory 연결판이 아니라 Package 전체의 System Fabric 역할을 하게 됩니다.

Interposer가 AI GPU 공급량까지 영향을 줄 수 있습니다

GPU Wafer와 HBM이 모두 생산됐다고 최종 Accelerator가 완성되는 것은 아닙니다. Interposer Fabrication, Chip Bonding, Underfill, Molding, Substrate Assembly, Test까지 완료돼야 출하할 수 있습니다.

따라서 AI GPU 수요가 급증하면 Advanced Packaging Capacity가 Supply Bottleneck이 될 수 있습니다. 과거 AI GPU 공급부족에서 CoWoS Capacity가 자주 언급된 이유도 Logic Wafer 생산 이후의 Packaging Capacity가 최종 Shipment를 제한할 수 있기 때문입니다.

Interposer 면적이 커지면 한 Wafer에서 얻을 수 있는 Interposer 수가 줄고, 동일한 GPU Unit을 생산하기 위해 더 많은 Wafer-level Packaging Capacity가 필요해질 수 있습니다. 즉 GPU Unit 증가뿐 아니라 Package Size 증가 자체도 Packaging Capacity Demand를 키웁니다.

어떤 기업들이 Interposer Value Chain에 연결될까요?

TSMC는 CoWoS-S, CoWoS-R, CoWoS-L을 통해 가장 직접적인 Advanced Packaging Platform을 제공합니다. NVIDIA, AMD와 Custom AI Accelerator 업체는 Interposer를 이용해 Logic과 HBM을 연결하는 수요자입니다.

SK hynix, Micron, Samsung 같은 Memory 업체는 HBM Stack을 공급하고 Package Interface와 Thermal·Mechanical Compatibility를 Foundry와 공동으로 검증해야 합니다. Package Substrate 업체는 Interposer 아래의 Organic Substrate를 공급하며, Bonding·Inspection·Metrology Equipment 업체는 Die가 많아질수록 더 정교한 Assembly와 Test를 지원해야 합니다.

즉 Interposer는 Foundry 하나의 사업만이 아니라 HBM, Substrate, Packaging Equipment, Materials와 Test가 연결되는 Supply Chain입니다.

투자 관점에서 무엇을 봐야 할까요?

첫 번째는 AI Accelerator당 HBM Stack 수와 Package Area입니다. GPU당 HBM이 늘고 Logic Chiplet이 많아지면 Interposer 면적과 Routing Complexity가 커질 가능성이 있습니다.

두 번째는 CoWoS-S, CoWoS-R, CoWoS-L Mix입니다. 어떤 Architecture가 더 많이 채택되는지는 Silicon Interposer 수요, RDL Process, Local Silicon Interconnect와 Materials 수요에 영향을 줄 수 있습니다.

세 번째는 Advanced Packaging Capacity와 Yield입니다. Packaging Line이 늘어도 대형 Interposer에서 Yield가 낮으면 실제 Output은 기대보다 적을 수 있습니다. 따라서 단순 Capacity Announcement보다 실제 Volume Ramp와 Package Complexity를 함께 봐야 합니다.

네 번째는 HBM4와 차세대 Chiplet Architecture입니다. Memory Interface가 넓어지고 Die 수가 늘수록 Interposer는 더 복잡해지며 Package당 Value Content가 높아질 가능성이 있습니다.

Interposer의 리스크는 무엇일까요?

가장 큰 리스크는 Cost입니다. Package가 너무 커지고 Interposer가 복잡해지면 Advanced Packaging Cost가 Accelerator BOM에서 빠르게 증가할 수 있습니다. 고객이 동일한 성능을 더 단순한 Package로 구현하는 Architecture를 개발하면 일부 Interposer Content가 줄어들 수 있습니다.

또 Local Silicon Interconnect와 Fan-out, 3D Stacking, Hybrid Bonding 같은 다양한 기술이 발전하면서 거대한 Silicon Interposer의 역할이 일부 대체될 수 있습니다. 따라서 “AI가 성장하면 Silicon Interposer 수요가 무조건 같은 비율로 증가한다”고 단순하게 계산해서는 안 됩니다.

중요한 것은 Interposer라는 특정 형태보다 AI Package 내부의 High-density Interconnect Content가 계속 증가하는가입니다.

핵심 정리

질문
Interposer란?GPU, HBM, Chiplet 사이를 Fine-pitch로 연결하는 중간 Wiring Layer입니다
HBM에 왜 필요한가?HBM의 매우 넓은 I/O를 짧은 거리에서 GPU에 연결해야 하기 때문입니다
Silicon Interposer 장점은?Semiconductor Process를 이용해 매우 높은 Routing Density를 구현할 수 있습니다
단점은?Package가 커질수록 Cost, Reticle Stitching, Yield, Warpage 부담이 커질 수 있습니다
RDL과 Local Silicon을 쓰는 이유는?대형 Package의 경제성과 Fine-pitch 연결을 절충하기 위해서입니다
HBM4와 관계는?더 넓은 Interface와 높은 Bandwidth를 지원하려면 Packaging Interconnect도 함께 고도화돼야 합니다
투자포인트는?HBM Stack 수, Package Area, CoWoS Mix, Packaging Capacity와 Yield입니다

Interposer는 완성된 AI Accelerator에서 눈에 잘 보이지 않지만 GPU와 HBM 사이에 수 TB/s의 Data Highway를 만드는 핵심 Layer입니다. HBM이 빨라질수록, GPU가 Chiplet화될수록, Package가 커질수록 Interposer는 단순 중간기판이 아니라 AI Semiconductor Architecture 자체를 결정하는 System Component로 변합니다.

결국 AI 시대의 경쟁은 Transistor를 더 많이 넣는 것만으로 끝나지 않습니다. 서로 다른 Die를 얼마나 짧고 넓고 안정적으로 연결할 수 있는가가 성능과 공급량, Cost를 함께 결정하며, Interposer는 그 문제의 중심에 있습니다.

curiouszip

curiouszip
Tech Layers를 운영하는 에디터입니다. AI 반도체, 데이터센터, 첨단 패키징, 네트워크 기술처럼 복잡하지만 산업의 방향을 결정짓는 기술들을 조사하고, 이를 누구나 이해할 수 있는 언어로 풀어 쓰는 작업을 하고 있습니다.
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.