推理算力将反超训练,内存墙成下一主战场
发布日期:2026-09-11
事件概述
随着推理模型(长思考、多步推理)普及,单次查询消耗的 token 数倍增长。多家机构预测 2026-2027 年推理算力需求将达到训练的 4-5 倍,“内存墙”从训练瓶颈转为推理瓶颈。
核心要点
- 结构变化:算力消耗主体从“造模型”转向“用模型”
- 负载特征:推理是内存带宽受限 + KV cache 膨胀 + 高并发
- 结论:存储演进方向从“堆容量”转向“分层”——热(HBM)/温(CXL DRAM)/冷(NAND)
- 投资含义:HBM、CXL 内存模组、高密度 NAND 三条线同步受益
行业意义
在“AI进入推理时代”的主线下,这条进展指向同一个判断:存储(HBM 与 NAND)的演进正从“堆容量”转向“按温度分层”——HBM 当热层、CXL 池化 DRAM 当温层、NAND/AI SSD 当冷层与模型仓库。谁先把这三层打通、把 KV cache 管好,谁就握住推理成本的下限。