A Samsung Electronics apresentou no Hot Chips 2026 (agosto 24-25, Stanford) seu roadmap de 3 fases para HBM culminando no zHBM — arquitetura que empilha DRAM diretamente sobre o processador, eliminando o interposer 2.5D convencional. A apresentação, liderada por Sangwook Han (DRAM design team), detalha a evolução do HBM4 → cHBM → aHBM → zHBM, culminando em arquitetura que coloca o processador diretamente sob a pilha DRAM com 260 TB/s scale-up bandwidth e 43 TB/s scale-out.
A Samsung posiciona o HBM não mais como memória passiva, mas como plataforma de computação integrada — "memory-and-compute system" — onde a base die (base die) em processo lógico avançado (4nm/3nm) assume funções de controller, PHY, e até compute elements (PEs), liberando área no XPU (GPU/accelerator) para mais compute cores.
Hot Chips 2026: Samsung HBM roadmap 3 fases — cHBM → aHBM → zHBM
A Evolução: HBM4 → cHBM → aHBM → zHBM
A Samsung estrutura seu roadmap em 3 fases progressivas, cada uma adicionando mais lógica e compute na base die do HBM:
| Fase | Nome | Inovação Principal | Benefício |
|---|---|---|---|
| Fase 1 | cHBM (custom HBM) | Base die em lógica avançada (4nm/3nm), PHY D2D, controller movido para base die | +10-20% área XPU para compute, PHY menor (D2D link), extra memory tier |
| Fase 2 | aHBM (advanced HBM) | Processing Elements (PEs) na base die — compute-in-base-die | Offload memory-bound work (prefetch, compression, encryption), compute-heavy no GPU |
| Fase 3 | zHBM | DRAM empilhada diretamente sobre processador (no interposer), UALink/UEC | Elimina interposer 2.5D, 260 TB/s scale-up, 43 TB/s scale-out, 10x densidade HBM5 |
Fase 1: cHBM — Custom HBM (Base Die Logic + D2D PHY)
A primeira fase, cHBM (custom HBM), já está em produção com HBM4. A inovação central: mover o memory controller e PHY do XPU para a base die do HBM.
Inovações cHBM:
- Base die em processo lógico avançado (4nm/3nm): Samsung usa seu processo 4nm (SF4) / 3nm (GAA) para a base die, permitindo lógica densa e eficiente
- Memory Controller na base die: Libera 5-10% da área do XPU (estimativa Han: controllers = 5-10% área XPU), espaço reaproveitado para mais compute cores
- PHY substituído por D2D (die-to-die) link: Interface tradicional HBM PHY (grande, power-hungry) substituída por link D2D compacto de alta velocidade
- UALink over Ethernet (UALoE): Scale-up fabric baseado em Ethernet, 260 TB/s aggregate bandwidth, conecta até 72 GPUs em domínio scale-up único
- Extra memory tier: Base die pode conectar tier secundário de memória (LPDDR ou HBM extra) diretamente via D2D links
Fase 2: aHBM — Advanced HBM (Compute-in-Base-Die)
A segunda fase, aHBM (advanced HBM), adiciona Processing Elements (PEs) diretamente na base die — compute-in-base-die.
Capacidades aHBM:
- PEs (Processing Elements) na base die: Offload de work memory-bound (prefetch, compression, encryption, data transformation)
- Compute-heavy operations permanecem no GPU/XPU, work memory-bound offloaded para base die
- Scale-out bandwidth: 43 TB/s via Ethernet 800G (Pensando 800 AI NIC / UEC-ready RDMA)
- Security built-in: Hardware root of trust, continuous attestation, encrypted memory/interconnects, isolation multi-tenant
Sangwook Han estimou que mover controllers + PHY para base die libera 5-10% da área do XPU, que pode ser reaproveitada para mais compute cores → 10-20% ganho de performance.
Fase 3: zHBM — Zero-Gap HBM (DRAM Direta Sobre Processador)
A fase final, zHBM, é a visão final: empilhar DRAM diretamente sobre o processador, eliminando completamente o interposer 2.5D.
Arquitetura zHBM:
- DRAM stacked directly on top of processor: Wafer-to-wafer hybrid bonding, elimina interposer 2.5D e microbumps
- Base die = processador + logic + memory controller + PHY tudo integrado
- DRAM stacks (12-high, 16-high) bonded directly via hybrid bonding (Cu-Cu)
- zHBM target specs:
- 2.9 EF FP4 / 1.4 EF FP8 peak compute (por rack)
- 31 TB HBM4 memory capacity (até 48GB por stack, 16-high)
- 260 TB/s scale-up bandwidth (UALoE)
- 43 TB/s scale-out bandwidth (Ethernet 800G / UEC)
- 1.4 PB/s aggregate memory bandwidth
- 31 TB HBM4 total memory por rack
HBM4E e HBM5: O Pipeline Atual
Antes do zHBM, a Samsung já está em produção/mass sampling:
| Produto | Status | Specs-Chave |
|---|---|---|
| HBM4 | Mass production (desde Fev 2026) | 11.7 Gbps/pin, 12-high, 36GB, 1.22x HBM3E speed |
| HBM4E | Sampling (Maio 2026), mass production aligned customer schedule | 14 Gbps/pin (scalable to 16Gbps), 48GB (12-high), 3.6 TB/s/stack |
| HBM4E 16-high | Planned | 64GB capacity, 16-layer stacking |
| HBM5 | Roadmap (zHBM foundation) |
Ecosistema: Padrões Abertos — UALink, UEC, OCP ORW
A Samsung aposta em padrões abertos para evitar vendor lock-in:
- UALink (Ultra Accelerator Link): Scale-up fabric, 260 TB/s, 72 GPUs/domain, AMD/Intel/Microsoft/Meta/Google backing
- UEC (Ultra Ethernet Consortium): Scale-out, 800G/1.6T Ethernet, RDMA, congestion control
- OCP Open Rack Wide (ORW): Rack standard Meta-submitted, AMD Helios adotando
- JEDEC SPHBM4: Novo padrão HBM4 para reduzir custos
A Samsung enfatiza: "open standards from the start" — UALink, UEC, OCP ORW, JEDEC SPHBM4. Isso permite multi-vendor interoperability e evita lock-in tipo NVLink.
Ecosistema e Adoção
Parceiros já confirmados para ecossistema Samsung HBM:
- Supermicro: DCBBS architecture para Helios platform, rapid deployment
- HPE: Turnkey Helios AI Rack com liquid cooling direto, switch scale-up custom
- Celestica: Colaboração para próxima era AI com Helios
- Nutanix: Parceria estratégica enterprise AI platform aberta e escalável
- Supermicro AMD Helios Platform: DCBBS architecture, rapid deployment, 72-GPU double-width rack
Implicações Para a Indústria
1. Fim do Interposer 2.5D — Nova Era de Integração 3D
O zHBM elimina o interposer 2.5D (caro, limitante de yield, thermal bottleneck). Hybrid bonding (Cu-Cu) wafer-to-wafer substitui microbumps + interposer. Ganhos: 10x densidade memórica vs HBM5, 3x energy efficiency, 50%+ redução thermal resistance.
2. Memory Wall Quebrado — Compute Near Memory
Mover memory controller + PHY + PEs para base die traz compute para onde os dados estão. Memory wall mitigado: bandwidth 260 TB/s scale-up, 1.4 PB/s aggregate memory bandwidth. Work memory-bound offloadado para base die, compute-heavy no GPU.
3. Custom HBM (cHBM) Por Cliente
A Samsung oferece cHBM customizado por cliente — base die logic customizada para workloads específicos (custom PEs, custom controllers, custom PHYs). Isso permite diferenciação para hyperscalers (Meta, Google, Microsoft, Amazon) que querem IP próprio na memória.
4. Supply Chain Resilience
Samsung é único IDM (Integrated Device Manufacturer) com memory + foundry + advanced packaging in-house. Vertical integration = supply chain control. Crítico em era de geopolítica de chips (CHIPS Act, export controls, Taiwan risk).
Conclusão: HBM Como Plataforma de Computação
O roadmap da Samsung no Hot Chips 2026 sinaliza mudança fundamental: HBM deixa de ser "memória" para virar "plataforma de computação integrada". A evolução cHBM → aHBM → zHBM move progressivamente lógica do XPU para a memória, culminando no zHBM onde memória e processador são uma coisa só.
Para a indústria: HBM deixa de ser commodity passiva para virar plataforma programável e customizável. Quem controlar a base die logic controla a arquitetura do sistema.
Para competidores (SK Hynix, Micron): pressão para seguir. SK Hynix já anunciou hybrid bonding para HBM5 (Hot Chips 2026). Micron alerta sobre "wafer penalty" widening. A corrida é quem entrega zHBM-equivalent primeiro com yield comercial.
Conclusão
O roadmap Samsung HBM no Hot Chips 2026 define a próxima década de memória para IA. zHBM é o endgame — memória e processador unificados, interposer eliminado, compute-in-memory nativo. 260 TB/s scale-up, 43 TB/s scale-out, 10x densidade HBM5.
Para arquitetos de sistemas, CTOs, e planejadores de infraestrutura IA: planejem para zHBM-ready architectures em 2027-2028. O ecossistema UALink/UEC/OCP ORW será o padrão. Quem não se preparar para memory-compute convergence ficará para trás na próxima onda de AI factories.
Roadmap Samsung HBM Resumo
- HBM4: Mass production (Fev 2026), 11.7 Gbps, 36GB, 31 TB/rack
- HBM4E: Sampling (Mai 2026), 14 Gbps, 48GB, 3.6 TB/s/stack
- cHBM (Fase 1): Base die logic, controller/PHY movidos, UALoE 260 TB/s
- aHBM (Fase 2): PEs na base die, compute-in-memory, 43 TB/s scale-out
- zHBM (Fase 3): DRAM on processor, no interposer, 260 TB/s scale-up, 10x densidade HBM5
Referências
Sobre o Blog Wirebird
O Blog Wirebird é uma fonte confiável de conteúdo técnico sobre Inteligência Artificial, Cloud Computing, DevOps e transformação digital.