美光警示AI内存墙加剧:TFLOPS失效,HBM成性能瓶颈

问AI · 采购AI系统为何更该看HBM代际而非算力?

图片

2026年8月23日,在加州斯坦福大学举行的Hot Chips 2026大会“Day 0”教程中,美光科技(Micron Technology)HBM设计架构研究员Raghu Sreeramaneni提出核心观点:在不升级内存代际的情况下,单纯提升浮点运算性能无法解决AI芯片算力与内存供给之间的差距。该差距每两年扩大相当于额外50的量,这一演示将业界关于“内存墙”的模糊讨论转化为具体的算术问题。

本周,Hot Chips 2026正在斯坦福大学举行,美光、三星和SK海力士均展示了专用高带宽内存(HBM环节)。这种行业汇聚表明,对于2026年及以后构建或采购加速器的各方而言,内存限制已成为AI硬件设计的核心议题。

算力增速远超内存,差距持续复利扩大

Sreeramaneni指出,AI加速器的TFLOPS(每秒万亿次浮点运算次数)约每两年增长三倍,而HBM带宽同期增长不足两倍。随着硬件代际更迭,若系统TFLOPS是前代的3倍,但内存带宽仅为2倍,实际AI吞吐量最高只能达到2倍,且通常更低。由于大多数大型语言模型推理工作负载受限于内存带宽而非计算能力,计算单元常处于等待数据的空闲状态。每过两年,这种空闲程度会略微恶化。

“内存墙”术语由Wulf和McKee于1995年首次提出。美光此次量化了AI语境下内存墙的上升速度,并确认即使考虑到HBM发展至2038年的完整轨迹,这一瓶颈也无法完全消除。

HBM架构解析:硅成本为何是DDR5的三倍

HBM并非DDR5的简单提速版。标准DDR5模块将扁平DRAM芯片焊接至电路板;而HBM采用多颗DRAM芯片(通常8至12颗),减薄后垂直堆叠,并通过数千个硅通孔(TSV)连接,最终通过先进封装固定在硅中介层上,与计算芯片并排安装。封装完成后,内存与计算成为整体,现场无法单独升级。

HBM的带宽优势源于其宽接口:DDR5使用64位通道,HBM3E使用1,024位接口,HBM4则翻倍至2,048位。总线越宽,并行移动数据越多,但代价高昂。设计复杂性、TSV形成和先进封装导致HBM3E提供相同存储容量时,消耗的制造硅面积约为DDR5的三倍。

数据显示,一个典型的现代AI加速器封装包含一个基础芯片和八个使用十二层堆叠的HBM4实例,总表面积超过12,000平方毫米。其中内存硅面积超过GPU芯片本身表面积的八倍。在现代AI加速器封装中,内存而非GPU才是主导组件。

从HBM3E到HBM4:制造挑战与经济账

HBM3E每个DRAM芯片拥有128个存储库,通过1,024个IO连接通信;HBM4将这两项指标均翻倍。随着IO数量翻倍,中介层布线密度需成比例增加,TSV形成工艺更苛刻,良率压力随之增加。HBM与DDR5之间三比一的硅成本比例反映了这一制造现实。

美光2026年全年HBM供应已在年初前签订合约,HBM4于2026年初开始为英伟达Vera Rubin平台供货。美光预测,全球HBM总可寻址市场将从2025年的约350亿美元增长至2028年的约1000亿美元,年复合增长率约为40%。

可靠性挑战:纠错与热机械应力

现代AI训练对内存错误几乎零容忍。HBM采用双层纠错架构:系统级别每次访问携带16位元数据纠错数据;DRAM堆栈内部运行基于符号的里德-所罗门(Reed-Solomon)纠错码,以处理高密度下的错误模式。

热学可靠性方面,异构集成封装中各组件热膨胀系数不匹配,随温度变化产生热机械应力,可能导致分层或开裂。美光指出,随着堆叠增高,这一问题日益重要。缓解措施包括液冷、混合键合以及改变焊料成分和模塑材料。

封装技术:共封装光学与玻璃基板

当带宽需求超过增加HBM实例所能解决的范畴时,封装技术成为关键。共封装光学(CPO)将光收发器直接集成到加速器封装中,消除序列化步骤,降低多机架AI集群中节点间移动数据的延迟和功耗。CPO通过将光连接本地化到封装内部,解决节点间带宽约束。

玻璃基板代表中介层的结构转变。相比有机基板,玻璃提供更紧密公差、更低信号损耗,并能容纳更大中介层,以适应持续增长HBM堆叠数量。台积电CoWoS-L和CoWoS-R格式代表了迈向大尺寸片上硅的中间步骤。

HBM8路线图:差距仍未缩小

根据韩国科学技术院(KAIST)等机构研究,HBM5预计2029年左右投产,带宽每秒4TB;HBM6在2032年左右达到每秒8TB;HBM7在2035年左右达到每秒24TB;HBM8在2038年左右达到每秒64TB。尽管绝对值巨大,但按每两年三倍计算扩展率评估,计算增益仍超过带宽增益。内存墙并未关闭,而是随每个硬件周期向上漂移。

对于大型语言模型推理工作负载,相关指标是系统所携带HBM代际的带宽规格。配备较旧HBM代际的高TFLOPS芯片,在推理吞吐量上经常输给配备较新HBM代际的低TFLOPS芯片,因为推理受限于内存。

演讲影响:重新定义AI硬件评估标准

Hot Chips是架构师披露决定未来12至24个月采购决策的技术与约束之地。美光展示的量化差异是一项设计约束披露,将指导超大规模企业、云服务提供商和企业AI买家在2027年和2028年指定系统的方式。

未经相应内存带宽数据和HBM代际指示符发布的原始TFLOPS指标,作为AI基础设施评估标准已变得不完整。通过移至新计算芯片并将TFLOPS翻倍,若保留相同HBM代际,可能在受内存限制负载上带来几乎零额外推理吞吐量;而移至较新HBM代际并保持计算不变,将带来可测量吞吐量改进。

HBM带宽、硅成本、热性能和可靠性之间的权衡,将塑造接下来几代加速器的设计、规范和采购方式。美光在Hot Chips 2026上的演示从根本上承认,内存已取代计算成为AI硬件的核心设计问题,而紧随HBM堆叠之后的封装技术,将是赢得AI性能下一阶段战斗的关键。


常见问题解答

HBM带宽何时能赶上AI计算吞吐量?

基于美光Hot Chips 2026数据及KAIST/Tera HBM路线图,答案是否定的。至少通过计划到2038年HBM8的轨迹,AI加速器TFLOPS每两年增长三倍,而HBM带宽增长不足两倍。即使HBM5至HBM8提供巨大带宽增益,这些增益在每个步骤上都落后于计算扩展率。差距不会缩小,而是复利增长。

计算-内存差距对评估AI硬件有何意义?

对于受内存限制的推理工作负载,系统所携带的HBM代际比TFLOPS计数是更有意义的性能预测指标。具有更高TFLOPS但较旧HBM代际的芯片,通常比具有较低TFLOPS和较新HBM代际的芯片提供较低推理吞吐量。评估AI硬件时,应询问每堆叠带宽数据和HBM代际,并对内存指标赋予更高权重。

HBM架构如何物理上提供高带宽?

HBM用更宽接口替换传统DDR5窄64位通道——HBM3E为1,024位,HBM4为2,048位。为实现此宽度并保持内存靠近计算芯片,HBM垂直堆叠多个DRAM芯片,并通过硅通孔(TSV)连接。整个组件直接坐在GPU旁边硅中介层上,缩短信号路径。权衡在于制造复杂性和成本:一吉字节HBM3E消耗制造硅面积约是一吉字节DDR5的三倍。

什么是共封装光学,为何美光在内存演讲中包含它们?

共封装光学(CPO)将光收发器直接集成到芯片封装中。美光包含它们是因为大型AI集群带宽问题不仅涉及单节点内数据移动,还涉及数千节点间数据移动。当AI系统规模超出单台服务器容纳能力时,节点间带宽成为第二堵内存墙。CPO通过将光连接拉近至接近计算芯片位置,减少电信号转换为光信号时的延迟和功耗,从而解决这第二堵墙。

【星途科讯 图文丨欧阳布布 首发于ZAKER科技,转载请注明出处】