CXL 3.0内存池化落地,KV cache卸载降推理成本
发布日期:2026-09-11
事件概述
CXL 3.0 把内存从“焊在主板上”变成“机架里的共享池”,多主机可动态借用容量。对推理最立竿见影的,是把膨胀的 KV cache 卸载到 CXL 池化 DRAM 层。
核心要点
- 利用率:典型机群 DRAM 利用率仅 20-30%,池化后可升至 60-80%
- KV cache:长上下文 + 高并发下 KV cache 激增,HBM 太贵太稀缺,CXL 层提供近 DRAM 延迟、低得多的每 GB 成本
- 产品:三星 CMM-D、美光 CZ120、SK海力士 CXL 模组已送样/量产
- 结论:推理成本(而非训练)才是企业部署后真正持续支付的账单
行业意义
在“AI进入推理时代”的主线下,这条进展指向同一个判断:存储(HBM 与 NAND)的演进正从“堆容量”转向“按温度分层”——HBM 当热层、CXL 池化 DRAM 当温层、NAND/AI SSD 当冷层与模型仓库。谁先把这三层打通、把 KV cache 管好,谁就握住推理成本的下限。