AI正在重新划定内存与存储的边界。
最先提出HBF(高带宽闪存)概念的NAND厂商闪迪(Sandisk)市值近一年膨胀了40多倍,韩国SSD主控厂商FADU“仅仅”涨了9倍,正在努力创造属于自己的AI叙事。
无论是HBF还是SSD,它们背后真正被重新定价的,都是NAND。正如HBM的价值最终建立在DRAM之上,未来AI存储体系中,NAND也正在获得一种新的战略地位。
FADU坚定地跟着英伟达走,相信年初黄仁勋在GTC上提出的CMX(上下文内存扩展)架构,将推动SSD从数据仓库的角色转向深度参与计算的“扩展内存”。如果这一判断成立,那么,不仅SSD的直接需求将大幅增长,过去数十年来指导SSD设计的核心指标,都需要被重新审视;至少,SSD的设计哲学将开始根据实际工作负载而分化。
英伟达提出CMX,与闪迪提出HBF相似,都是为了解决智能体时代越来越膨胀的上下文缓存。这些上下文以KV Cache(键值缓存)的形式存在,否则,如果每轮对话都重新计算,不仅会增加响应延迟,更会浪费昂贵的GPU算力。根据访问频繁程度与缓存大小的权衡,这些KV Cache需要被安置到算力基础设施的不同的层级上。
随着智能体持续运行,KV Cache已经从会话级别的临时产物,逐渐变成值得长期保持可访问性的持久资产。到了Vera Rubin NVL72时代,它必须找到一个足够便宜、足够大、又足够快的位置。而现有HBM仅存放模型权重就已经十分紧张,网络存储的延迟又难以满足推理需求,这便给新的内存层级留下了空间。
HBF竞争开启,“HBM之父”怎么看 | 笔记
2026/04/15 完整阅读 >
围绕这个问题,产业界正在形成两条路线。KAIST(韩国科学技术院)的金正浩教授相信HBF路线,认为英伟达提出CMX,只是因为“没有牙齿只能嚼口香糖”,最终接受HBF“只是时间问题”。而FADU首席技术官Nam Yi-hyun则认为,NAND在高温环境下及其固有的可靠性等问题,使HBF的商业化前景仍存在较大不确定性;更重要的是,如果英伟达不推动,新的存储介质很难形成生态。
今年以来,在上下文领域,英伟达正迅速形成自己的AI原生技术栈。从命名形式上看,CMX是继它的CUDA-X、Spectrum-X后又一个品牌体系。年初,在CES上它还是ICMS(Inference Context Memory Storage),2个月后的GTC上就改名为CMX(Context Memory eXtension)。在英伟达生态内更大的架构是STX(Storage Technology eXtension),将CMX等所有上下文技术都囊括在内。
通过CMX,KV Cache变成整个Pod共享资产。首先,GPU节点上的主机BlueField-4,将存储虚拟化为本地NVMe(非易失性存储高速接口协议)设备;但实际数据位于一个独立的端点上,该端点拥有自己的BlueField-4和SSD池。当GPU发出读请求时,主机BlueField-4将其转换为RDMA(远程直接内存访问)请求,并通过网络结构发送出去。端点BlueField-4接收该请求,从本地NVMe SSD中读取数据,然后将数据传回。结果通过PCIe(高速外设互连总线)点对点直接送入GPU HBM。主机CPU和DRAM全程不接触此传输。
这意味着,CMX同时实现了三个目标:通过Spectrum-X实现接近DRAM的延迟;提供每GPU太字节级别的Pod级存储;以及跨所有GPU的共享访问。但这也意味着,适配CMX的SSD,与过去的企业级SSD,在设计哲学上已经完全不同。
长上下文和智能体工作负载下,每块GPU可能产生数十TB的KV Cache,容量需要随GPU数量线性扩展,同时受到机架功耗和空间的严格约束。在解码阶段,KV Cache主要以读取为主,仅在预填充和缓存更新时进行写入,其工作负载与传统数据库或企业应用截然不同。在大规模CMX部署中,SSD本身将成为数据中心的重要耗能单元,系统级的Token/W(每瓦生成Token数)也将直接受到存储层效率的影响。
过去,企业级SSD服务的是文件系统和数据库,其核心指标是IOPS(每秒输入输出操作数),追求海量4KB随机读写能力,强调单位TB价格。而CMX中的KV Cache,则表现出完全不同的特征:数据块巨大,以顺序读取为主,追求的是GB/s(每秒搬运多少数据),以及GB/s/W价格。
这正是FADU等主控厂商嗅到的新机会。